Liquid AI выпустила LFM2.5-VL-DSpark — drafter с 280 млн параметров, который ускоряет декодирование LFM2.5-VL-3B на edge-устройствах и GPU H100.

Liquid AI выпустила экспериментальную модель speculative decoding, предназначенную для ускорения своей vision-language модели LFM2.5-VL-3B, нацелившись на ключевое узкое место в мультимодальном выводе: быстрое формирование ответов после обработки изображения и промпта.
Модель под названием LFM2.5-VL-DSpark добавляет draft-модель с 280 миллионами параметров к целевой модели с 3 миллиардами параметров. По словам Liquid AI, в ходе внутренней оценки это сочетание обеспечило ускорение декодирования до 3,13x на Apple M5 Max и до 2,66x на Nvidia H100. Выигрыш по сквозной задержке был меньше: до 2,62x на M5 Max и 2,27x на H100.
Этот релиз особенно важен для команд, разворачивающих vision-language модели на локальном оборудовании, где задержка ответа и ограничения по памяти могут быть более жесткими, чем в крупных inference-кластерах. Он также расширяет подход DSpark от Liquid AI от текстовых моделей к мультимодальным нагрузкам без необходимости другого алгоритма speculative decoding.
Speculative decoding использует более маленькую модель, чтобы предложить сразу несколько токенов. Затем более крупная целевая модель проверяет эти предложения, принимая токены, которые совпадают с ее собственным распределением следующего токена, и генерируя замены при необходимости. Такой подход может сократить число дорогих шагов целевой модели без изменения ее вывода при точной верификации.
Согласно релизу Liquid AI на Hugging Face, drafter LFM2.5-VL-DSpark берет скрытые состояния из выбранных слоев LFM2.5-VL-3B и предлагает блоки кандидатов-токенов. Изображения и текст сначала проецируются в общее представление, что позволяет drafter получать векторы одинаковой размерности независимо от модальности входа.
Liquid AI сообщает, что vision-drafter использует четыре attention-only слоя и размер блока девять во время обучения. Для инференса компания рекомендует размер блока восемь или девять в зависимости от оборудования. Drafter добавляет примерно 8,9% к числу параметров развернутой модели, что является относительно небольшим ростом памяти по сравнению с запуском отдельной большой модели для той же задачи.
Модель обучалась на смеси данных supervised fine-tuning для vision-language, с весами, смещенными в сторону рабочих нагрузок, которые, как ожидает Liquid AI, она будет обслуживать. Компания тестировала трех-, четырех- и пятислойные варианты и обучала выбранную конфигурацию в течение 10 эпох, сообщив, что приемлемость повышалась с добавлением токенов, прежде чем наступало убывание отдачи.
Liquid AI оценила систему на шести визуальных рабочих нагрузках с использованием бенчмарка MMSpec. Задачи включали общее визуальное question answering, тексто-ориентированное визуальное question answering, генерацию подписей к изображениям, question answering по диаграммам, сложные рассуждения и многоходовой диалог.
Результаты на устройстве измерялись с помощью MLX на M5 Max и llama.cpp на M3 Ultra. По данным Liquid AI, декодирование в MLX было быстрее на 2,30x–3,13x в зависимости от задачи, а сквозная задержка улучшилась на 1,56x–2,62x. В llama.cpp прирост декодирования составил 1,57x–2,14x, а сквозная задержка улучшилась с 1,30x до 1,77x.
Оценка на H100 дала ускорение декодирования до 2,66x и улучшение сквозной производительности до 2,27x, согласно компании. В исходных материалах есть несогласованная нижняя граница диапазона декодирования для H100, поэтому более широкий результат следует рассматривать как максимальное значение, заявленное поставщиком, а не как единообразное ожидание производительности.
Это измерения Liquid AI, а не независимый бенчмарк. Они также описывают конкретное оборудование, программные конфигурации, смеси задач и размер блока DSpark, равный восьми. Реальные выигрыши будут зависеть от доли принятых предложенных токенов, длины промпта, сложности изображения, квантования, размера батча и доли общей задержки, приходящейся на обработку изображения и ввод промпта.
Liquid AI утверждает, что speculative decoding является exact, потому что целевая модель проверяет каждый предложенный токен. В ее реализации greedy-вывод должен, следовательно, совпадать с результатом целевой модели без speculation. Это свойство отвечает на одну из главных проблем внедрения ускоряющих техник: улучшать скорость, не изменяя молча поведение модели.
Заявленная разница между скоростью декодирования и общей задержкой важна для продуктовых команд. Speculative decoding ускоряет генерацию токенов, но не ускоряет vision encoder или фазу prefill, которая обрабатывает токены изображения и текстовый промпт.
Vision-language модели могут тратить значительное время до появления первого токена. Изображение проходит через vision encoder, после чего языковая модель обрабатывает сотни визуальных токенов вместе с текстовым вводом. На edge-оборудовании более скромный вычислительный бюджет может сделать эти этапы большей долей общего времени ответа. В результате трехкратное улучшение декодирования не превращается в трехкратное снижение видимой пользователю задержки.
Это ограничение — пример закона Амдала: части нагрузки, которые остаются неизменными, ограничивают общий выигрыш. Для таких приложений, как чат по изображениям, анализ документов или интерпретация диаграмм, командам придется отдельно измерять время до первого токена и полное время ответа. Более быстрый путь декодирования может быть особенно ценен для длинных ответов, повторяющихся ходов или рабочих процессов, где генерация вывода доминирует после того, как изображение уже закодировано.
Результаты также указывают на то, что выбор оборудования будет определять ценность решения. Самый сильный заявленный диапазон декодирования Liquid AI пришелся на Apple Silicon, тогда как H100 дала меньший, но все же ощутимый выигрыш в тестах компании. Это делает релиз значимым как для локального инференса, так и для GPU-ориентированных сервисов, но не доказывает, что каждое развертывание увидит одинаковое улучшение.
LFM2.5-VL-DSpark доступна через интеграции для llama.cpp, MLX-VLM и SGLang. Liquid AI сообщает, что draft-модель доступна на Hugging Face в форматах Safetensors и GGUF, предоставляя разработчикам пути для нативных и квантованных сценариев развертывания.
Интеграция SGLang требует сборки с поддержкой DSpark для целевых LFM2, а llama.cpp и MLX-VLM также требуют версий с соответствующими изменениями реализации. В SGLang операторы подключают drafter к целевой модели и обращаются к endpoint, совместимому с OpenAI. Размер блока считывается из конфигурации модели, а по времени ответа можно увидеть, сколько draft-токенов было предложено и принято.
Для разработчиков такая модель интеграции важна, поскольку релиз не требует заменять целевую vision-language модель или переделывать интерфейс приложения. Команды могут сравнить базовое развертывание с speculative decoding на той же целевой модели и измерить приемлемость, задержку, использование памяти и эквивалентность вывода. Однако дополнительные 280 миллионов параметров все еще несут затраты по памяти и загрузке, что может быть важно на небольших edge-устройствах.
Самым ясным сигналом станет независимое тестирование LFM2.5-VL-DSpark на большем числе размеров изображений, уровней квантования, размеров батчей и production-подобных промптов. Независимые результаты помогут понять, сохраняются ли заявленные выигрыши за пределами выбранной Liquid AI оценки по шести задачам.
Разработчикам также следует следить за acceptance rate и сквозной задержкой, а не полагаться только на заголовочные коэффициенты декодирования. Поддержка в llama.cpp, MLX-VLM и SGLang будет важна по мере зрелости реализаций, особенно для пользователей, разворачивающих решения на Apple Silicon или ограниченном локальном оборудовании.
Дальнейшие релизы DSpark для других vision-language моделей могут показать, распространяется ли архитектура за пределы LFM2.5-VL-3B. Напротив, если выигрыш сильно зависит от архитектуры модели или рабочей нагрузки, метод может остаться целевой оптимизацией, а не широко переносимым слоем инференса.
Релиз Liquid AI — это практическое обновление инференса, а не новая модель возможностей. Его главный вклад — показать, как speculative decoding можно адаптировать к мультимодальной цели, сохранив точную верификацию и относительно небольшую дополнительную модель.
Коммерческая значимость будет зависеть от общей воспринимаемой пользователем задержки, а не от максимального показателя декодирования. Для команд, работающих с vision-language нагрузками локально, сочетание открытых весов, существующих runtime-интеграций и измеримых выигрышей может оправдать тестирование. Но покупателям следует воспринимать текущие заявления о производительности как данные поставщиком и проверять их на своих изображениях, промптах, оборудовании и целевых показателях задержки.