[5] DeepSeek-OCR 2: Visual Causal Flow
·
Paper Review/LLM & VLM
[Paper] https://arxiv.org/pdf/2601.20552[Github] https://github.com/deepseek-ai/DeepSeek-OCR-2 GitHub - deepseek-ai/DeepSeek-OCR-2: Visual Causal FlowVisual Causal Flow. Contribute to deepseek-ai/DeepSeek-OCR-2 development by creating an account on GitHub.github.com 1. Introduction 기존 VLM의 이미지 처리 방식에 대한 문제 제기기존 방식에서는 2D patch를 미리 정해진 1D 순서로 flattenA B CD E FG H Iraster scan을 적용하면A → B → C → D ..
Locust를 이용한 vLLM Vision-Language Model 부하 테스트
·
Pytorch
이번 글에서는 Locust를 이용하여 vLLM 기반 Vision-Language Model 서버를 부하 테스트하는 방법을 설명하겠습니다.테스트 대상은 OpenAI API 호환 형태로 서비스되는 vLLM 서버이고, 부하테스트 할 task는 "문서 정보추출"입니다. 1. Locust를 사용하는 이유 Locust는 Python 코드로 부하 시나리오를 자유롭게 작성할 수 있다는 장점이 있습니다.특히 VLM 서비스에서는이미지 업로드Streaming 응답멀티턴 대화복잡한 Prompt등을 테스트해야 하는 경우가 많습니다. 다른 라이브러리보다 훨씬 유연하게 구현할 수 있습니다. 2. 진행과정 데이터 로딩 ↓Locust User 생성 ↓VLM API 호출 ↓응답 수집 ..
[4] SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
·
Paper Review/LLM & VLM
[paper] https://arxiv.org/pdf/2602.06040[Github] https://github.com/Accio-Lab/SwimBird GitHub - Accio-Lab/SwimBirdContribute to Accio-Lab/SwimBird development by creating an account on GitHub.github.com 1. Introduction 기존 MLLM모델들의 추론패턴 문제점을 지적항상 텍스트 CoT만 사용하거나 latent Visual Token만 사용하는 방식⇒ 질문마다 필요한 사고방식이 다른데 왜 항상 같은 추론 패턴을 사용할까?다양한 유형의 쿼리에 유연하게 대응하지 못하는 한계 직면텍스트 중심의 논리적 문제에서 불필요한 시각적 연산을 초래하여 성..
[OpenCV] C++ OpenCV Image Thresholding
·
OpenCV
c++과 opencv를 이용해 이미지 각 픽셀값을 thresholding하는 방법입니다. 이번 챕터에서는 아래 이미지를 입력으로 사용합니다. 계속 사용하게 될 threshold 함수의 원형은 아래와 같습니다.threshold(입력이미지, 출력이미지, 임계값, 최대값, 방식) 1. Binary Thresholding 픽셀값이 1~255 → 흰색(255)픽셀값이 0 → 검정(0) #include #include using namespace std;using namespace cv;int main() { // Read image Mat src = imread("threshold.png", IMREAD_GRAYSCALE); Mat dst; // Set threshold and maxValue ..