vLLM 서버 실행 옵션 정리
·
Etc
- 사용하는 옵션tensor-parallel-size 2 enable-expert-parallel gpu-memory-utilization 0.95 max-model-len 16384 max-num-seqs 32 max-num-batched-tokens 8192 enable-chunked-prefill enable-prefix-caching mm-encoder-tp-mode data mm-processor-kwargs '{"min_pixels": 524288, "max_pixels": 1310720}' attention-backend flash_attn return-tokens-as-token-ids speculative-config '{ "model": ""RedHatAI/Qwen3.6-35B-A..
[5] DeepSeek-OCR 2: Visual Causal Flow
·
Paper Review/LLM & VLM
[Paper] https://arxiv.org/pdf/2601.20552[Github] https://github.com/deepseek-ai/DeepSeek-OCR-2 GitHub - deepseek-ai/DeepSeek-OCR-2: Visual Causal FlowVisual Causal Flow. Contribute to deepseek-ai/DeepSeek-OCR-2 development by creating an account on GitHub.github.com 1. Introduction 기존 VLM의 이미지 처리 방식에 대한 문제 제기기존 방식에서는 2D patch를 미리 정해진 1D 순서로 flattenA B CD E FG H Iraster scan을 적용하면A → B → C → D ..
Locust를 이용한 vLLM Vision-Language Model 부하 테스트
·
Pytorch
이번 글에서는 Locust를 이용하여 vLLM 기반 Vision-Language Model 서버를 부하 테스트하는 방법을 설명하겠습니다.테스트 대상은 OpenAI API 호환 형태로 서비스되는 vLLM 서버이고, 부하테스트 할 task는 "문서 정보추출"입니다. 1. Locust를 사용하는 이유 Locust는 Python 코드로 부하 시나리오를 자유롭게 작성할 수 있다는 장점이 있습니다.특히 VLM 서비스에서는이미지 업로드Streaming 응답멀티턴 대화복잡한 Prompt등을 테스트해야 하는 경우가 많습니다. 다른 라이브러리보다 훨씬 유연하게 구현할 수 있습니다. 2. 진행과정 데이터 로딩 ↓Locust User 생성 ↓VLM API 호출 ↓응답 수집 ..
[4] SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
·
Paper Review/LLM & VLM
[paper] https://arxiv.org/pdf/2602.06040[Github] https://github.com/Accio-Lab/SwimBird GitHub - Accio-Lab/SwimBirdContribute to Accio-Lab/SwimBird development by creating an account on GitHub.github.com 1. Introduction 기존 MLLM모델들의 추론패턴 문제점을 지적항상 텍스트 CoT만 사용하거나 latent Visual Token만 사용하는 방식⇒ 질문마다 필요한 사고방식이 다른데 왜 항상 같은 추론 패턴을 사용할까?다양한 유형의 쿼리에 유연하게 대응하지 못하는 한계 직면텍스트 중심의 논리적 문제에서 불필요한 시각적 연산을 초래하여 성..