Liquid AI는 엣지 디바이스와 H100 GPU에서 LFM2.5-VL-3B 디코딩을 가속하는 2억 8천만 파라미터 drafter인 LFM2.5-VL-DSpark를 공개했다.

Liquid AI는 자사의 비전-언어 모델 LFM2.5-VL-3B를 가속하기 위해 설계된 실험적 speculative-decoding 모델을 공개했다. 이는 멀티모달 추론의 핵심 병목, 즉 이미지와 프롬프트가 처리된 뒤 빠르게 응답을 생성하는 문제를 겨냥한다.
LFM2.5-VL-DSpark라는 이름의 이 모델은 30억 파라미터의 타깃 모델에 2억 8천만 파라미터의 draft model을 추가한다. Liquid AI는 내부 평가에서 이 조합이 Apple M5 Max에서 최대 3.13x, Nvidia H100에서 최대 2.66x의 디코딩 속도 향상을 보였다고 밝혔다. 엔드투엔드 지연 시간 개선은 더 작았으며, M5 Max에서 2.62x, H100에서 2.27x에 이르렀다.
이번 출시는 응답 지연과 메모리 제약이 대형 추론 클러스터보다 더 엄격할 수 있는 로컬 하드웨어에 비전-언어 모델을 배포하는 팀에게 특히 중요하다. 또한 Liquid AI의 DSpark 접근 방식을 텍스트 모델에서 멀티모달 워크로드로 확장하면서도 별도의 speculative-decoding 알고리즘을 요구하지 않는다.
Speculative decoding은 더 작은 모델이 여러 토큰을 한꺼번에 제안하도록 한다. 그다음 더 큰 타깃 모델이 해당 제안을 검증하여, 자신의 다음 토큰 분포와 일치하는 토큰을 수락하고 필요할 경우 대체 토큰을 생성한다. 이 방식은 정확한 검증 하에서 타깃 모델의 출력을 바꾸지 않으면서 비용이 큰 타깃 모델 단계 수를 줄일 수 있다.
Liquid AI의 Hugging Face 릴리스에 따르면, LFM2.5-VL-DSpark drafter는 LFM2.5-VL-3B의 선택된 레이어에서 hidden states를 받아 후보 토큰 블록을 제안한다. 이미지와 텍스트는 먼저 공통 표현으로 투영되며, 이를 통해 입력 모달리티와 관계없이 drafter가 같은 차원의 벡터를 받게 된다.
Liquid AI는 비전 drafter가 학습 중에 attention-only 레이어 4개와 블록 크기 9를 사용했다고 밝혔다. 추론 시에는 하드웨어에 따라 블록 크기 8 또는 9를 권장한다. drafter는 배포된 모델의 파라미터 수를 약 8.9% 늘릴 뿐으로, 같은 작업을 위해 별도의 대형 모델을 실행하는 것에 비해 비교적 작은 메모리 증가다.
이 모델은 Liquid AI가 제공할 것으로 예상하는 워크로드에 가중치를 둔 비전-언어 supervised fine-tuning 데이터 혼합으로 학습됐다. 회사는 3층, 4층, 5층 설계를 테스트하고 선택한 구성을 10 epoch 동안 학습했으며, 추가 토큰에 대한 수용률이 향상되다가 수확 체감에 도달했다고 보고했다.
Liquid AI는 MMSpec 벤치마크를 사용해 6개의 비전 기반 워크로드에서 시스템을 평가했다. 작업에는 일반적인 시각 질의응답, 텍스트 중심 시각 질의응답, 이미지 캡셔닝, 차트 질의응답, 복잡한 추론, 멀티턴 대화가 포함됐다.
온디바이스 결과는 M5 Max에서 MLX를 사용해, M3 Ultra에서 llama.cpp를 사용해 측정됐다. Liquid AI에 따르면 MLX 디코딩은 작업에 따라 2.30x~3.13x 더 빨랐고, 엔드투엔드 지연 시간은 1.56x~2.62x 개선됐다. llama.cpp에서는 디코딩 향상이 1.57x~2.14x였고, 엔드투엔드 지연 시간은 1.30x~1.77x 개선됐다.
회사에 따르면 H100 평가에서는 디코딩 향상이 최대 2.66x, 엔드투엔드 개선이 최대 2.27x였다. 소스 자료에는 H100 디코딩 범위의 하한값에 대해 일관되지 않은 수치가 포함되어 있어, 이 결과는 일관된 성능 기대치가 아니라 벤더가 보고한 최대값으로 보는 것이 적절하다.
이 수치들은 독립 벤치마크가 아니라 Liquid AI의 측정값이다. 또한 특정 하드웨어, 소프트웨어 구성, 작업 조합, 그리고 DSpark 블록 크기 8을 설명한다. 실제 성능 향상은 제안된 토큰의 수용률, 프롬프트 길이, 이미지 복잡도, 양자화, 배치 크기, 그리고 전체 지연 시간 중 이미지 처리와 프롬프트 수용에 사용되는 비중에 따라 달라질 것이다.
Liquid AI는 타깃 모델이 제안된 모든 토큰을 검증하므로 speculative decoding이 exact하다고 말한다. 따라서 구현상 greedy 출력은 speculative 없이 실행한 타깃 모델과 일치해야 한다. 이 특성은 가속 기법의 주요 배포 우려 중 하나, 즉 모델 동작을 몰래 바꾸지 않고 속도를 개선할 수 있는가에 답한다.
디코딩 속도와 총 지연 시간의 차이는 제품 팀에 중요하다. Speculative decoding은 토큰 생성을 빠르게 하지만, 비전 인코더나 이미지 토큰과 텍스트 프롬프트를 처리하는 prefill 단계는 가속하지 않는다.
비전-언어 모델은 첫 토큰을 생성하기 전 상당한 시간을 보낼 수 있다. 이미지는 비전 인코더를 거친 뒤, 언어 모델이 수백 개의 시각 토큰을 텍스트 입력과 함께 처리한다. 엣지 하드웨어에서는 낮은 연산 예산 때문에 이러한 단계가 전체 응답 시간에서 더 큰 비중을 차지할 수 있다. 따라서 디코딩이 세 배 빨라져도 사용자에게 보이는 지연 시간이 세 배 줄어들지는 않는다.
이 한계는 암달의 법칙의 한 예다. 변하지 않는 워크로드 부분이 전체 향상 폭을 제한한다. 이미지 채팅, 문서 분석, 차트 해석 같은 애플리케이션의 경우, 팀은 첫 토큰까지 걸리는 시간과 전체 응답 시간을 별도로 측정해야 한다. 더 빠른 디코드 경로는 특히 긴 답변, 반복되는 턴, 또는 이미지가 이미 인코딩된 뒤 출력 생성이 지배적인 워크플로우에서 가장 가치가 있을 수 있다.
결과는 또한 하드웨어 선택이 가치 제안을 좌우할 것임을 시사한다. Liquid AI가 가장 강한 디코딩 범위로 보고한 것은 Apple Silicon이었고, H100은 회사 테스트에서 더 낮지만 여전히 의미 있는 향상을 보였다. 이는 이번 출시에 로컬 추론과 GPU 기반 서비스 모두에서 의미가 있음을 보여주지만, 모든 배포가 같은 향상을 얻을 것이라는 뜻은 아니다.
LFM2.5-VL-DSpark는 llama.cpp, MLX-VLM, SGLang 통합을 통해 사용할 수 있다. Liquid AI는 draft model을 Hugging Face에서 Safetensors와 GGUF 형식으로 제공해, 개발자들이 네이티브 및 양자화 배포 워크플로우로 갈 수 있는 경로를 마련했다고 밝혔다.
SGLang 통합은 LFM2 타깃에 대한 DSpark 지원이 포함된 빌드를 필요로 하며, llama.cpp와 MLX-VLM도 관련 구현 변경이 포함된 버전이 필요하다. SGLang에서는 운영자가 drafter를 타깃 모델에 연결하고 OpenAI 호환 엔드포인트를 조회한다. 블록 크기는 모델 구성에서 읽히며, 응답 타이밍을 통해 얼마나 많은 draft 토큰이 제안되고 수락되었는지 확인할 수 있다.
빌더에게 이 통합 모델은 중요하다. 이번 출시는 타깃 비전-언어 모델을 교체하거나 애플리케이션 인터페이스를 다시 설계할 필요가 없기 때문이다. 팀은 같은 타깃 모델로 speculative decoding을 사용한 기본 배포와 비교해 수용률, 지연 시간, 메모리 사용량, 출력 일치 여부를 측정할 수 있다. 다만 추가된 2억 8천만 파라미터는 여전히 메모리와 로딩 비용을 수반하므로, 작은 엣지 디바이스에서는 중요할 수 있다.
가장 분명한 후속 신호는 더 다양한 이미지 크기, 양자화 수준, 배치 크기, 실제 운영 환경 스타일의 프롬프트에서 LFM2.5-VL-DSpark를 독립적으로 테스트하는 것이다. 독립 결과는 Liquid AI가 선택한 6개 작업 평가 밖에서도 보고된 향상이 유지되는지 확인하는 데 도움이 될 것이다.
개발자는 헤드라인 디코딩 배수만 보지 말고 수용률과 엔드투엔드 지연 시간을 주시해야 한다. llama.cpp, MLX-VLM, SGLang 지원은 구현이 성숙함에 따라 추적이 중요하며, 특히 Apple Silicon이나 제약이 있는 로컬 하드웨어에 배포하는 사용자에게 그렇다.
다른 비전-언어 모델을 위한 추가 DSpark 출시가 이어진다면, 이 아키텍처가 LFM2.5-VL-3B를 넘어 일반화되는지 알 수 있다. 반대로 향상이 모델 아키텍처나 워크로드에 매우 민감하다면, 이 방법은 널리 이식 가능한 추론 계층이 아니라 특정 목적의 최적화로 남을 수 있다.
Liquid AI의 출시는 새로운 능력 모델이라기보다 실용적인 추론 업데이트다. 핵심 기여는 추가 모델을 상대적으로 작게 유지하면서, speculative decoding을 멀티모달 타깃에 맞게 적응시키고 정확한 검증을 유지하는 방법을 보여준 데 있다.
상업적 중요성은 최대 디코딩 수치가 아니라 사용자 체감 총 지연 시간에 달려 있다. 비전-언어 워크로드를 로컬에서 실행하는 팀이라면, 공개 가중치, 기존 런타임 통합, 측정 가능한 향상의 조합이 시험할 이유가 될 수 있다. 다만 구매자는 현재 성능 주장들을 벤더 보고치로 취급하고, 자신들의 이미지, 프롬프트, 하드웨어, 지연 시간 목표에 맞춰 검증해야 한다.