Pular para o conteúdo

IA e LLMs - Página 2 de 3

Novos modelos de IA, frameworks de agentes e artigos de pesquisa, lidos da cadeira de um desenvolvedor. Contamos o que mudou na API, quanto custa o milhão de tokens e o que quebra no seu pipeline, sem o ângulo do investidor. Cada notícia termina com o que testar, verificar ou esperar nesta semana.

A GeForce graphics card with two fans standing on a plain gray studio backdrop, the GeForce logo on its shroud.
IA e LLMs

Qwen3.5-9B gasta 32 KB por token no cache KV

O Qwen3.5-9B usa atenção completa em apenas 8 das suas 32 camadas, então o cache KV custa 32 KB por token. Essa proporção decide se ele cabe em 8 GB.

O brief diário

De três a cinco notícias por dia, e o que cada uma significa para quem constrói software. Grátis, sem spam.