비전언어 모델 DSpark 3.13배, 내 서비스도 빨라질까: 디코드와 전체 지연을 나눠 읽기
이미지 한 장을 보내 설명을 받는 서비스에서 ‘생성 속도가 3배’라는 문구를 보면 곧바로 응답 대기 시간도 3분의 1이 될 것처럼 느껴집니다. 하지만 이미지 인코딩, 입력 처리, 첫 토큰 생성, 이후 토큰 생성은 서로 다른 구간입니다. Liquid AI가 공개한 실험용 LFM2.5-VL-3B-DSpark는 마지막의 디코드 구간을 겨냥합니다. 따라서 도입 질문은 “최고 배속이 얼마인가”보다 “우리 요청의 시간 중 실제로 단축되는 구간이 얼마인가”가 먼저입니다.
이 글은 Liquid AI의 발표문과 해당 모델 카드를 읽고, 서로 다른 가속 수치와 실행 조건을 실무 판단표로 재구성했습니다. 수치는 제작사가 공개한 측정값입니다. 모델을 내려받아 실행하거나 서비스 트래픽에서 재현한 결과가 아닙니다.
작은 초안 모델이 하는 일
DSpark는 단독 이미지 모델이나 더 빠른 타깃 모델의 대체품이 아닙니다. 타깃인 LFM2.5-VL-3B에 짝지어 쓰는 초안 모델입니다. 타깃의 중간 상태를 받아 다음 토큰 후보 묶음을 먼저 제안하고, 타깃이 그 후보를 검증합니다. 발표문은 이미지 패치와 텍스트 토큰이 같은 차원의 표현으로 투영된 뒤 사용되므로 초안 생성 알고리즘을 재활용할 수 있다고 설명합니다. 초안이 제안했다고 무조건 통과하는 것은 아닙니다.
모델 카드의 초안 파라미터는 279.5M이고 발표문은 이를 약 280M, 약 3B 타깃 대비 8.9%의 추가 파라미터로 설명합니다. 이는 배포 모델의 파라미터 증가율에 관한 표현이지 실제 장치의 메모리 사용량이 정확히 8.9% 늘었다는 측정 결과가 아닙니다. 학습 당시 블록 크기는 9, 추론에서는 장치에 따라 8 또는 9를 사용합니다.
Liquid AI의 작동 설명을 재구성했다. 초안 후보는 타깃이 검증하며 그리디 출력 동일성은 해당 조건에 한한다. 출처: huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark.
타깃이 제안 토큰을 확인하므로 그리디 디코딩 조건에서는 타깃 단독 실행과 출력이 같다는 것이 모델 카드의 설명입니다. 모델 카드는 조건을 맞춘 비영(非零) 온도 샘플링에서 분포를 보존한다는 일반적 성질도 적지만, 뒤에 소개하는 MLX-VLM 구현은 현재 그리디 샘플링만 사용한다고 명시합니다. 이를 근거로 모든 런타임의 모든 샘플링 설정에서 품질이나 문장이 완전히 동일하다고 주장하지 않습니다.
숫자 두 개를 같은 속도로 읽으면 안 된다
모델 카드의 표는 각 작업마다 디코드 배속 / 엔드투엔드 배속을 나란히 제시합니다. 비교 기준은 동일한 타깃 모델에서 DSpark를 사용하지 않은 실행입니다. Apple M5 Max와 MLX-VLM의 여섯 작업에서 디코드는 2.30~3.13배, 엔드투엔드는 1.56~2.62배입니다. 단일 H100 80GB와 SGLang의 여섯 작업에서는 각각 2.04~2.66배, 1.64~2.27배입니다. 여섯 행은 서로 다른 작업 조건의 제작사 측정이지, 독립 연구 여섯 건이나 고객 서비스의 보장 수치가 아닙니다.
대표적으로 M5 Max의 COCO 행은 디코드 3.13배, 전체 2.59배이고, TextVQA 행은 디코드 2.69배, 전체 1.56배입니다. 같은 하드웨어에서도 작업 구성에 따라 두 숫자의 간격이 달라집니다. 디코드만 보고 전체 응답의 개선 폭을 약속하면 이미지 전처리와 입력 처리 시간을 빠뜨리기 쉽습니다.
Liquid AI 모델 카드의 동일 타깃 단독 실행 대비 여섯 작업 범위. H100 블록은 카드 기준 9이며 발표문의 20.4배 불일치는 결과에서 제외했다. 출처: huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark/raw/main/README.md.
측정 조건도 함께 붙여 읽어야 합니다. 모델 카드에 따르면 H100 표는 BF16, 배치 1, 온도 0, 블록 9입니다. Apple 표는 FP16, 배치 1, 온도 0, 블록 8, 출력 최대 2,048토큰 조건이며 측정에는 Pipette를 사용했습니다. 발표문의 “두 구성 모두 블록 8”이라는 문장과 모델 카드의 H100 블록 9 설명은 충돌합니다. H100 디코드에 관해 발표문에 적힌 “20.4x to 2.66x”도 카드의 전체 표와 제목·요약에 맞지 않습니다. 이 글은 상충하는 20.4배를 성능 결과로 채택하지 않고, 작업별 표에 일관되게 기재된 2.04~2.66배를 사용합니다. 원문 사이의 불일치는 해소된 정오표가 아니라 확인이 필요한 출처상 한계로 남겨 둡니다.
디코드가 빨라도 전체가 덜 빨라지는 이유
비전언어 모델은 이미지를 먼저 비전 인코더에 통과시키고 이미지에서 나온 여러 토큰과 질문을 입력 처리한 뒤 답을 생성합니다. 발표문은 DSpark가 비전 인코딩과 프리필을 가속하지 않는다고 명시합니다. 이미지가 크거나 프롬프트가 길고 답변은 짧다면 비가속 구간의 비중이 커질 수 있습니다. 반대로 생성할 토큰이 많을 때에는 디코드 단축이 전체 시간에 더 크게 반영될 여지가 있습니다. 이것은 단계별 시간 구성에서 나오는 편집상 추론이며, 특정 배포의 실제 개선률을 예측하는 공식 측정값은 아닙니다.
발표문의 비전 인코딩·프리필 미가속 한계를 재구성했다. 도형 크기는 실측 시간 비율을 뜻하지 않는다. 출처: huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark.
따라서 지표를 최소한 이미지 인코딩·프리필 또는 첫 토큰까지의 시간과, 그 이후 디코드 시간, 최종 응답 완료 시간으로 나눠 보세요. 초안 후보가 얼마나 채택됐는지도 함께 보되 채택률만으로 최종 속도를 단정하지 마세요. 모델 카드는 타깃 검증 한 번당 평균 채택 토큰 수를 별도 표로 싣고, 실제 배속에는 런타임 오버헤드와 하드웨어가 함께 영향을 준다고 설명합니다. 이 글의 측정 제안은 운영자의 실험 설계이지 새 성능 데이터가 아닙니다.
도입 전 판단표: 내 요청에서 무엇을 볼까
아래는 출시 자료를 제품 사용자의 질문으로 바꾼 편집상 판단표입니다. ‘통과’ 판정이나 제조사가 약속한 권장 설정표가 아닙니다.
| 질문 | 공식 근거에서 확인할 것 | 내 서비스에서 측정할 것 |
|---|---|---|
| 타깃과 초안이 짝이 맞나? | 모델 카드의 LFM2.5-VL-3B ↔ LFM2.5-VL-3B-DSpark 대응 | 실제 로딩 모델 ID, 가중치 형식과 런타임 버전 |
| 주요 요청은 무엇인가? | 여섯 작업의 디코드/전체 배속은 작업마다 다름 | 이미지 크기, 입력 길이, 출력 토큰 수별 요청 분포 |
| 느린 구간이 디코드인가? | 비전 인코딩과 프리필은 가속 대상 아님 | 첫 토큰 시간, 디코드 시간, 전체 응답 시간의 분해 |
| 정확히 어떤 출력 조건인가? | 그리디 출력 동일성; MLX-VLM 현재 그리디만 지원 | 같은 입력·설정의 출력 비교, 필요한 샘플링 기능 |
| 배포 비용을 감당할 수 있나? | 초안 279.5M 추가 파라미터; 메모리 점유율 실측 아님 | 실제 메모리 사용량, 동시 요청, 지연·처리량 변화 |
공식 런타임 조건과 디코드 한계에서 도출한 편집상 질문이다. 독립 재현이나 제조사 인증 절차가 아니다. 출처: huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark/raw/main/README.md.
모델 카드에는 MLX-VLM v0.7.2 이상에서 타깃과 초안을 함께 전달하는 실행 예가 있으며, 현재 DSpark 디코딩에는 온도 0을 지정하라고 적혀 있습니다. SGLang은 v0.5.19 이상과 짝지은 초안 모델을 요구하고, 카드의 예제는 블록 9를 설정합니다. llama.cpp는 별도의 GGUF 체크포인트를 사용합니다. 각 런타임의 설치와 호환성은 변할 수 있으니 실제 적용 시 현재 문서와 사용하는 빌드를 다시 확인해야 합니다. 이 글에서는 실행 명령을 수행하지 않았습니다.
이 판단표는 Liquid AI의 공개 자료를 운영 질문으로 재구성한 것이며, 모델을 실행하거나 성능·정확도를 독립 재현한 결과가 아닙니다. 공개 자료에는 각 행의 반복 측정 횟수나 통계적 변동 폭이 제시되지 않았습니다. 특정 장치와 요청 분포에서의 이득을 확정하려면 동일한 타깃·입력·출력 조건에서 초안 유무를 비교하고, 디코드와 전체 지연을 둘 다 기록해야 합니다. 특히 짧은 답변과 긴 답변을 한 평균에 섞지 않으면 어디서 이득이 생겼는지 더 잘 보입니다.
원문과 적용 범위
- Liquid AI 발표문 — Accelerating vision-language models with LFM2.5-VL-DSpark: 작동 방식, 비전 인코딩·프리필 한계와 발표 수치. 일부 H100 문구는 아래 모델 카드와 불일치합니다.
- Liquid AI LFM2.5-VL-3B-DSpark 모델 카드: 여섯 작업별 디코드/엔드투엔드 표, 하드웨어·블록 크기·정밀도·런타임 조건. 라이선스는 카드에
lfm1.0으로 표기됩니다. 발표문의 자유로운 배포 문구를 법적 허용 범위의 결론으로 대신하지 마세요.
이 주제와 직접 연결되는 검증된 내부 글을 억지로 삽입하지 않았습니다. 이 글의 핵심은 추측 디코딩의 단계별 지연과 같은 모델 기준 비교이므로, 다른 캐시 관리나 GPU 실행 계획 글을 같은 주제의 재현 근거로 취급하지 않습니다.




댓글
댓글 쓰기