Pular para o conteúdo

Liquid AI LFM2.5-VL-DSpark acelera seu modelo de visão 3B

O modelo de rascunho LFM2.5-VL-DSpark da Liquid AI, com 280M de parâmetros, decodifica seu modelo de visão 3B até 3.13x mais rápido em um M5 Max, com saída idêntica.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
Liquid AI's diagram of the DSpark method in three steps: the target model prefills, the draft model proposes a block of tokens, and the target model verifies them.
Foto: Liquid AI

Em números

parameters in the DSpark draft model
279.5M
added on top of the 3B target model
8.9%
best decode speedup, Apple M5 Max
3.13x
LFM2.5-VL-DSpark best decode speedup by hardware
Apple M5 Max (MLX)
3.13x
Nvidia H100
2.66x
Apple M3 Ultra (llama.cpp)
2.14x

A Liquid AI lançou o LFM2.5-VL-DSpark em 24 de setembro de 2026, um pequeno modelo complementar que faz seu modelo de visão e linguagem de 3 bilhões de parâmetros responder mais rápido. No chip M5 Max da Apple, ele decodifica até 3.13 vezes mais rápido, segundo a publicação da Liquid AI no Hugging Face. A saída continua exatamente a mesma, o que importa para quem roda modelos de compreensão de imagens em hardware local.

Um modelo de visão e linguagem lê imagens e texto e responde em texto. O modelo da Liquid AI para isso é o LFM2.5-VL-3B. O DSpark não o substitui. Ele funciona ao lado dele e o ajuda a escrever respostas mais rápido.

Como um modelo de rascunho acelera as respostas

A técnica se chama decodificação especulativa. Um pequeno modelo de "rascunho" adivinha rapidamente as próximas palavras, chamadas tokens. O grande modelo "alvo" então verifica todos esses palpites em uma única passada. Ele mantém os que aprova e descarta o resto.

Verificar um lote de palpites de uma vez é muito mais barato do que escrever cada token um por um. Em sua publicação anterior sobre o DSpark, a Liquid AI explica o motivo: "A maior parte da latência vem da transferência dos pesos da DRAM para a SRAM, não de computação intensa." Em termos simples, a parte lenta é mover o modelo pela memória, não a conta em si.

Como o modelo alvo aprova cada token, a resposta final não muda. A Liquid AI diz que o método "troca um aumento mínimo no uso de memória por uma aceleração maior, sem alterar a qualidade da saída."

O que há dentro do LFM2.5-VL-DSpark

O RuntimeWire estima o modelo de rascunho em 279.5 milhões de parâmetros, cerca de 8.9% do tamanho do modelo alvo. Ele usa quatro camadas só de atenção e propõe blocos de oito a nove tokens por vez.

A publicação da Liquid AI detalha ainda mais o rascunho: uma pilha de decodificador de 193.0M, uma camada de projeção de 21.0M e uma "cabeça de Markov" de 65.5M. O rascunho trabalha sobre as representações internas do modelo alvo, então trata entradas de imagem e de texto da mesma forma.

Aceleração por hardware

Os ganhos dependem da máquina. A velocidade de decodificação é a rapidez com que o modelo escreve sua resposta. A velocidade de ponta a ponta também inclui a leitura da imagem e do prompt.

HardwareAceleração na decodificaçãoAceleração de ponta a ponta
Apple M5 Max (MLX)2.30x-3.13x1.56x-2.62x
Apple M3 Ultra (llama.cpp)1.57x-2.14x1.30x-1.77x
Nvidia H100 GPU2.04x-2.66x1.64x-2.27x

O RuntimeWire informa que o modelo alvo aceita de 3.2 a 4.5 tokens de rascunho por verificação. Esses testes usaram tamanho de lote um e pesos de 16 bits.

Os limites apontados pela Liquid AI

A decodificação especulativa "acelera apenas a decodificação, não a codificação visual nem o prefill", diz a publicação no Hugging Face. A codificação visual transforma a imagem em números que o modelo pode usar. O prefill lê o prompt antes de a resposta começar. Em dispositivos pequenos, essas etapas tomam boa parte do tempo, então os ganhos de ponta a ponta são menores que os da decodificação.

O rascunho também não roda sozinho. Ele só funciona em par com o LFM2.5-VL-3B.

O que isso significa para desenvolvedores

Se você roda o LFM2.5-VL-3B localmente, experimente o rascunho agora. A Liquid AI diz que ele já está integrado ao llama.cpp, ao MLX-VLM e ao SGLang, então deve se encaixar em uma configuração existente.

Meça sua própria carga de trabalho, não o número da manchete. Respostas curtas sobre imagens grandes terão os menores ganhos, porque a codificação da imagem domina. Respostas longas em texto, como descrever um gráfico em detalhes, terão os maiores.

Reserve memória. O rascunho acrescenta menos de 9% ao tamanho do modelo, o que é pouco, mas não zero em um celular ou notebook com pouca RAM.

Observe também o padrão. A Liquid AI já lançou em agosto rascunhos DSpark para seus modelos de texto, com uma aceleração média de 2.67x relatada em uma H100 para o LFM2.5-2.6B. Um rascunho equivalente para o modelo de visão sugere que esses pequenos modelos auxiliares estão se tornando parte padrão dos lançamentos de pesos abertos, não um extra.

Fontes

  1. Accelerating vision-language models with LFM2.5-VL-DSpark - Hugging Face
  2. Liquid AI adds a 280M draft model to speed up its 3B vision model - RuntimeWire
  3. LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook - Liquid AI

Artigos relacionados

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
IA e LLMs

As decisões tipadas do Laya, explicadas

Um modelo de decisões tipadas preenche perguntas fixas com respostas tipadas e um número de confiança. Os pesos abertos do Laya, 421M, permitem que você mesmo confira isso.

A GeForce graphics card with two fans standing on a plain gray studio backdrop, the GeForce logo on its shroud.
IA e LLMs

Qwen3.5-9B gasta 32 KB por token no cache KV

O Qwen3.5-9B usa atenção completa em apenas 8 das suas 32 camadas, então o cache KV custa 32 KB por token. Essa proporção decide se ele cabe em 8 GB.