vLLM 서버 실행 옵션 정리
·
Etc
- 사용하는 옵션tensor-parallel-size 2 enable-expert-parallel gpu-memory-utilization 0.95 max-model-len 16384 max-num-seqs 32 max-num-batched-tokens 8192 enable-chunked-prefill enable-prefix-caching mm-encoder-tp-mode data mm-processor-kwargs '{"min_pixels": 524288, "max_pixels": 1310720}' attention-backend flash_attn return-tokens-as-token-ids speculative-config '{ "model": ""RedHatAI/Qwen3.6-35B-A..