Pular para o conteúdo

Strands Decider 2B toma decisões de agentes em 115 ms

O Strands Decider 2B, da AWS, é um modelo de código aberto que escolhe em uma lista em vez de escrever texto. Ele responde em 115 ms em uma RTX 3090 e marca 72,3% no JevBench.

Por Tech AI Wire Team

4 min de leitura

XLinkedIn
Screenshot of the Strands Agents blog post Introducing Strands Decider 2B: a small, open source, decision model, dated October 1, 2026.

Em números

median latency on an RTX 3090
115 ms
accuracy on JevBench v1's 231 tasks
72.3%
parameters in the pointer head that replaces text output
1M
license, per Tech Times
Apache 2.0

A equipe Strands Labs, da AWS, lançou o Strands Decider 2B em 1º de outubro de 2026, um modelo de código aberto que toma decisões para agentes de IA sem escrever texto. Dada uma pergunta e uma lista de opções, ele pontua cada opção e devolve sua escolha com um valor de confiança. O anúncio da Strands informa um tempo de resposta mediano de 115 milissegundos em uma placa de vídeo RTX 3090. Isso o torna barato o bastante para rodar antes de cada chamada cara a um modelo de linguagem grande.

O que um modelo de decisão faz

A maioria dos agentes de IA pede a um modelo de linguagem grande, ou LLM, que faça pequenas escolhas o dia todo. Qual ferramenta deve rodar em seguida? Qual modelo deve responder? Esta solicitação é permitida? O LLM escreve a resposta como texto, token por token. Isso é lento e custa dinheiro.

Um modelo de decisão pula a escrita. Ele lê a pergunta e a lista de respostas permitidas e dá uma pontuação a cada resposta. As opções são fornecidas no momento em que você pergunta. Assim, o mesmo modelo pode escolher entre ferramentas em uma chamada e entre políticas na seguinte.

A Strands lista estas tarefas:

  • roteamento de modelos, que envia cada solicitação ao modelo certo
  • seleção de ferramentas
  • avaliações
  • guardrails, que bloqueiam solicitações que violam uma política
  • gerenciamento de memória e contexto

Os limites são igualmente claros. A AWS diz que o modelo «não consegue escrever código, resumir documentos, manter uma conversa nem se destacar em tarefas de raciocínio complexo», informa o Techstrong.ai.

Como ele é construído

O Decider 2B parte do modelo Qwen3.5-2B-Base, da Alibaba. A Strands removeu a cabeça de modelagem de linguagem, a camada final que transforma o estado interno do modelo em palavras. No lugar dela há uma «cabeça de ponteiros» com cerca de 1 milhão de parâmetros, segundo o SiliconANGLE.

O Tech Times explica como a cabeça funciona. Ela compara a leitura que o modelo faz da entrada com cada opção candidata, usando um produto escalar, uma pontuação simples de similaridade. O resultado é uma lista ordenada de opções com probabilidades. A própria publicação da Strands diz que o modelo foi adaptado com um adaptador LoRA de posto 16, um pequeno complemento treinado em vez do conjunto completo de pesos.

Os relatos dão o tamanho como cerca de 1,9 bilhão de parâmetros. A Strands arredonda para 2 bilhões no nome.

Os números

MedidaResultadoInformado por
Latência mediana, RTX 3090115 msStrands, Tech Times
Latência no percentil 95299 msTech Times
Latência, MacBook Apple M3153 msStrands
Precisão no JevBench v172,3% (167 de 231 tarefas)Tech Times, Techstrong.ai
Tarefas do nível fácil100%Techstrong.ai
Tarefas do nível difícil50,5%Techstrong.ai
Erro de calibração esperado0,052Tech Times

O JevBench é um conjunto de testes público para modelos de decisão. A Strands diz que o Decider 2B ficou em terceiro entre 33 modelos da classe 2B. Sem contar os modelos um pouco acima de 2 bilhões de parâmetros, ele fica em primeiro entre 30.

O erro de calibração mede o quanto a confiança de um modelo corresponde à realidade. Um valor baixo como 0,052 significa que, quando o modelo diz ter 90% de certeza, ele acerta perto dessa frequência. Isso importa mais aqui do que a precisão bruta, como a próxima seção explica.

O modelo e seu código podem ser baixados de graça. O Tech Times informa a licença Apache 2.0. Os pesos estão no Hugging Face, na organização StrandsAgents, e o código de treinamento está no GitHub, em strands-labs/strands-decider.

Uma classe de modelos em crescimento

Os modelos de decisão estão virando uma categoria própria. Segundo o Techstrong.ai, a Strands credita ao Jev, da TypeSafe AI, lançado em setembro, o mérito de chamar a atenção para essa abordagem. Um rival de pesos abertos, o Laya, respondeu ao Jev no mesmo mês. A Cloudflare veio em seguida, em 4 de outubro, com o Clef, modelos de pesos abertos que devolvem decisões.

A AWS apresenta a troca em termos de velocidade. O modelo «elimina a necessidade de gerar texto, que consome enormes quantidades de tokens e aumenta a latência da resposta», disse a empresa ao SiliconANGLE.

O que isso significa para os desenvolvedores

  • Coloque-o na frente do seu LLM, não no lugar dele. Use o Decider 2B para as etapas de escolha fixa de um agente: roteamento, escolha de ferramentas e verificações de política. Deixe a escrita e o raciocínio para o modelo grande.
  • Use a pontuação de confiança como um filtro. Como o modelo é bem calibrado, você pode definir um limite. Acima dele, aja com base na escolha. Abaixo, passe a decisão a um modelo maior ou a uma pessoa.
  • Mantenha-o longe das decisões difíceis. Uma pontuação de 50,5% nas tarefas difíceis fica perto de um cara ou coroa com duas opções. Teste suas próprias decisões e separe-as por dificuldade antes de confiar nele.
  • Escreva opções que o modelo consiga distinguir. A cabeça de ponteiros compara a entrada com o texto de cada opção. Rótulos claros e distintos dão a ele mais material do que rótulos quase iguais.
  • Rode-o localmente. Com cerca de 2 bilhões de parâmetros, ele cabe em uma GPU de consumo ou em um notebook. Assim, as decisões de rotina ficam fora do medidor e fora da rede.

Primeiro, monte um pequeno conjunto de testes a partir dos logs reais do seu agente. Depois, compare as escolhas do Decider 2B com as do seu LLM e meça com que frequência elas coincidem.

Fontes

  1. Introducing Strands Decider 2B: a small, open source, decision model - Strands Agents
  2. AWS debuts Strands Decider 2B, a first lightweight decision model for accelerate agentic workflows - SiliconANGLE
  3. AWS Releases Decision Model for AI Agents That Routes Without Generating Any Text - Tech Times
  4. AWS Explores Decision Models With Strands Decider 2B - Techstrong.ai

Artigos relacionados

A GeForce graphics card with two fans standing on a plain gray studio backdrop, the GeForce logo on its shroud.
IA e LLMs

Qwen3.5-9B gasta 32 KB por token no cache KV

O Qwen3.5-9B usa atenção completa em apenas 8 das suas 32 camadas, então o cache KV custa 32 KB por token. Essa proporção decide se ele cabe em 8 GB.

Screenshot of the google/embeddinggemma-2 model page on Hugging Face, with the EmbeddingGemma 2 banner and an Apache 2.0 license link.
IA e LLMs

EmbeddingGemma 2 leva a busca multimodal para o celular

O EmbeddingGemma 2, do Google DeepMind, coloca texto, código, imagens, vídeo e áudio em um só espaço vetorial, com 740M de parâmetros. O uso só de texto precisa de cerca de 191 MB de RAM.