Liquid AI adiciona speculative decoding ao LFM2.5-VL-3B para inferência visão-linguagem mais rápida

A Liquid AI lançou o LFM2.5-VL-DSpark, um drafter de 280 milhões de parâmetros que acelera a decodificação do LFM2.5-VL-3B em dispositivos de borda e GPUs H100.

AI News

A Liquid AI lançou um modelo experimental de speculative decoding projetado para acelerar seu modelo visão-linguagem LFM2.5-VL-3B, mirando um gargalo central na inferência multimodal: gerar respostas rapidamente depois que uma imagem e um prompt foram processados.

O modelo, chamado LFM2.5-VL-DSpark, adiciona um modelo draft de 280 milhões de parâmetros ao modelo alvo de 3 bilhões de parâmetros. A Liquid AI afirma que a combinação entregou acelerações de decodificação de até 3,13x em um Apple M5 Max e de até 2,66x em uma Nvidia H100 em sua avaliação interna. Os ganhos de latência de ponta a ponta foram menores, chegando a 2,62x no M5 Max e 2,27x na H100.

O lançamento é mais importante para equipes que implantam modelos visão-linguagem em hardware local, onde a latência de resposta e os limites de memória podem ser mais restritivos do que em grandes clusters de inferência. Ele também estende a abordagem DSpark da Liquid AI de modelos de texto para cargas de trabalho multimodais sem exigir um algoritmo diferente de speculative decoding.

Um drafter construído para entradas multimodais

O speculative decoding usa um modelo menor para propor vários tokens de uma vez. O modelo alvo maior então verifica essas propostas, aceitando os tokens que correspondem à sua própria distribuição do próximo token e gerando substituições quando necessário. A abordagem pode reduzir o número de etapas caras do modelo alvo sem alterar a saída do modelo alvo sob verificação exata.

De acordo com o lançamento da Liquid AI no Hugging Face, o drafter LFM2.5-VL-DSpark pega estados ocultos de camadas selecionadas do LFM2.5-VL-3B e propõe blocos de tokens candidatos. Imagens e texto são primeiro projetados em uma representação compartilhada, permitindo que o drafter receba vetores com a mesma dimensionalidade independentemente da modalidade de entrada.

A Liquid AI diz que o drafter de visão usa quatro camadas apenas de atenção e um tamanho de bloco de nove durante o treinamento. Para inferência, a empresa recomenda um tamanho de bloco de oito ou nove, dependendo do hardware. O drafter adiciona aproximadamente 8,9% ao número de parâmetros do modelo implantado, um aumento de memória relativamente pequeno em comparação com executar um modelo grande separado para a mesma tarefa.

O modelo foi treinado com uma mistura de dados de fine-tuning supervisionado de visão-linguagem ponderados para as cargas de trabalho que a Liquid AI espera atender. A empresa testou projetos de três, quatro e cinco camadas e treinou a configuração selecionada por 10 épocas, relatando que a aceitação melhorou com tokens adicionais antes de atingir retornos decrescentes.

Ganhos relatados variam por hardware e tarefa

A Liquid AI avaliou o sistema em seis cargas de trabalho baseadas em visão usando o benchmark MMSpec. As tarefas incluíram perguntas e respostas visuais gerais, perguntas e respostas visuais focadas em texto, geração de legendas para imagens, perguntas e respostas sobre gráficos, raciocínio complexo e conversa multi-turno.

Os resultados no dispositivo foram medidos com MLX em um M5 Max e com llama.cpp em um M3 Ultra. A Liquid AI informa que a decodificação com MLX foi de 2,30x a 3,13x mais rápida dependendo da tarefa, enquanto a latência de ponta a ponta melhorou de 1,56x a 2,62x. Com llama.cpp, os ganhos de decodificação variaram de 1,57x a 2,14x, e a latência de ponta a ponta melhorou de 1,30x a 1,77x.

A avaliação no H100 produziu ganhos de decodificação de até 2,66x e melhorias de ponta a ponta de até 2,27x, segundo a empresa. O material de origem inclui uma cifra inconsistente de limite inferior para a faixa de decodificação do H100, então o resultado mais amplo deve ser tratado como um máximo reportado pelo fornecedor, e não como uma expectativa uniforme de desempenho.

Essas são medições da Liquid AI, não um benchmark independente. Elas também descrevem hardware específico, configurações de software, misturas de tarefas e um tamanho de bloco DSpark de oito. Os ganhos reais dependerão da taxa de aceitação dos tokens propostos, do comprimento do prompt, da complexidade da imagem, da quantização, do tamanho do lote e da proporção da latência total gasta em processamento de imagem e ingestão do prompt.

A Liquid AI diz que o speculative decoding é exato porque o modelo alvo verifica cada token proposto. Na implementação da empresa, a saída greedy deve, portanto, corresponder ao modelo alvo executado sem especulação. Essa propriedade aborda uma das principais preocupações de implantação em torno das técnicas de aceleração: melhorar a velocidade sem mudar silenciosamente o comportamento do modelo.

Por que a latência de ponta a ponta continua sendo a métrica mais difícil

A diferença relatada entre velocidade de decodificação e latência total é importante para equipes de produto. O speculative decoding acelera a geração de tokens, mas não acelera o codificador de visão nem a fase de prefill que processa os tokens da imagem e o prompt de texto.

Modelos visão-linguagem podem gastar um tempo considerável antes de produzir o primeiro token. Uma imagem passa por um codificador de visão, após o qual o modelo de linguagem processa centenas de tokens visuais junto com a entrada textual. Em hardware de borda, o menor orçamento de computação pode fazer com que essas etapas representem uma fatia maior do tempo total de resposta. Como resultado, uma melhoria de três vezes na decodificação não se traduz em uma redução de três vezes na latência visível para o usuário.

Essa limitação é um exemplo da lei de Amdahl: as partes de uma carga de trabalho que permanecem inalteradas limitam o ganho total. Para uma aplicação como chat com imagens, análise de documentos ou interpretação de gráficos, as equipes precisarão medir separadamente o tempo até o primeiro token e o tempo total de resposta. Um caminho de decodificação mais rápido pode ser mais valioso para respostas longas, turnos repetidos ou fluxos de trabalho em que a geração da saída domina depois que a imagem já foi codificada.

Os resultados também sugerem que a escolha do hardware moldará a proposta de valor. A faixa de decodificação mais forte relatada pela Liquid AI veio do Apple Silicon, enquanto a H100 entregou ganhos menores, mas ainda relevantes, no teste da empresa. Isso torna o lançamento relevante tanto para inferência local quanto para serviços com GPU, mas não estabelece que toda implantação verá a mesma melhoria.

Integrações reduzem a barreira de teste

O LFM2.5-VL-DSpark está disponível por meio de integrações para llama.cpp, MLX-VLM e SGLang. A Liquid AI diz que o modelo draft é oferecido no Hugging Face nos formatos Safetensors e GGUF, dando aos desenvolvedores caminhos para fluxos de trabalho de implantação nativos e quantizados.

A integração com SGLang requer uma build com suporte DSpark para alvos LFM2, enquanto llama.cpp e MLX-VLM também exigem versões contendo as mudanças de implementação relevantes. No SGLang, os operadores conectam o drafter ao modelo alvo e consultam um endpoint compatível com OpenAI. O tamanho do bloco é lido da configuração do modelo, e o tempo de resposta pode revelar quantos tokens draft foram propostos e aceitos.

Para os construtores, esse modelo de integração é significativo porque o lançamento não exige substituir o modelo visão-linguagem alvo nem redesenhar a interface do aplicativo. As equipes podem comparar uma implantação base com speculative decoding usando o mesmo modelo alvo e medir aceitação, latência, uso de memória e equivalência de saída. Os 280 milhões de parâmetros extras ainda trazem custo de memória e carregamento, porém, o que pode importar em dispositivos de borda menores.

O que observar a seguir

O sinal de acompanhamento mais claro será o teste independente do LFM2.5-VL-DSpark em mais tamanhos de imagem, níveis de quantização, tamanhos de lote e prompts no estilo produção. Resultados independentes ajudariam a estabelecer se os ganhos relatados persistem fora da avaliação de seis tarefas escolhida pela Liquid AI.

Os desenvolvedores também devem observar taxas de aceitação e latência de ponta a ponta em vez de depender apenas dos multiplicadores de decodificação das manchetes. O suporte em llama.cpp, MLX-VLM e SGLang será importante de acompanhar à medida que as implementações amadurecem, especialmente para usuários que implantam em Apple Silicon ou hardware local restrito.

Novos lançamentos DSpark para outros modelos visão-linguagem podem indicar se a arquitetura se generaliza além do LFM2.5-VL-3B. Por outro lado, se os ganhos forem altamente sensíveis à arquitetura do modelo ou à carga de trabalho, o método pode permanecer uma otimização direcionada em vez de uma camada de inferência amplamente portátil.

Perspectiva da Creati.ai

O lançamento da Liquid AI é uma atualização prática de inferência, não um novo modelo de capacidades. Sua principal contribuição é mostrar como o speculative decoding pode ser adaptado a um alvo multimodal mantendo a verificação exata e mantendo o modelo adicional relativamente pequeno.

A importância comercial dependerá da latência total percebida pelo usuário, não da cifra máxima de decodificação. Para equipes que executam cargas de trabalho visão-linguagem localmente, a combinação de pesos abertos, integrações de runtime existentes e ganhos mensuráveis pode justificar testes. Mas os compradores devem tratar as alegações de desempenho atuais como informadas pelo fornecedor e validá-las com suas próprias imagens, prompts, hardware e metas de latência.

Anúncios