Strands Decider 2B toma decisiones de agentes en 115 ms
Strands Decider 2B de AWS es un modelo de código abierto que elige de una lista en lugar de escribir texto. Responde en 115 ms en una RTX 3090 y obtiene un 72,3 % en JevBench.
4 min de lectura

En cifras
- median latency on an RTX 3090
- 115 ms
- accuracy on JevBench v1's 231 tasks
- 72.3%
- parameters in the pointer head that replaces text output
- 1M
- license, per Tech Times
- Apache 2.0
El equipo de Strands Labs de AWS lanzó Strands Decider 2B el 1 de octubre de 2026, un modelo de código abierto que toma decisiones para agentes de IA sin escribir texto. Dada una pregunta y una lista de opciones, puntúa cada opción y devuelve su elección con un valor de confianza. El anuncio de Strands sitúa su tiempo de respuesta mediano en 115 milisegundos en una tarjeta gráfica RTX 3090. Eso lo hace lo bastante barato como para ejecutarlo antes de cada llamada costosa a un modelo de lenguaje grande.
Qué hace un modelo de decisión
La mayoría de los agentes de IA piden a un modelo de lenguaje grande, o LLM, que tome pequeñas decisiones todo el día. ¿Qué herramienta se ejecuta a continuación? ¿Qué modelo debe responder? ¿Está permitida esta solicitud? El LLM escribe su respuesta como texto, token a token. Eso es lento y cuesta dinero.
Un modelo de decisión se salta la escritura. Lee la pregunta y la lista de respuestas permitidas, y luego da una puntuación a cada respuesta. Las opciones se suministran en el momento de preguntar, así que el mismo modelo puede elegir entre herramientas en una llamada y entre políticas en la siguiente.
Strands enumera estas tareas:
- enrutamiento de modelos, que envía cada solicitud al modelo adecuado
- selección de herramientas
- evaluaciones
- barreras de seguridad, que bloquean solicitudes que incumplen una política
- gestión de memoria y contexto
Los límites son igual de claros. AWS dice que el modelo «no puede escribir código, resumir documentos, mantener una conversación ni destacar en tareas de razonamiento complejo», informa Techstrong.ai.
Cómo está construido
Decider 2B parte del modelo Qwen3.5-2B-Base de Alibaba. Strands eliminó la cabeza de modelado del lenguaje, la capa final que convierte el estado interno del modelo en palabras. En su lugar hay una «cabeza de punteros» de unos 1 millón de parámetros, según SiliconANGLE.
Tech Times explica cómo funciona la cabeza. Compara la lectura que el modelo hace de la entrada con cada opción candidata, mediante un producto escalar, una puntuación de similitud sencilla. El resultado es una lista ordenada de opciones con probabilidades. La propia publicación de Strands dice que el modelo se adaptó con un adaptador LoRA de rango 16, un pequeño complemento que se entrena en lugar del conjunto completo de pesos.
Los informes dan un tamaño de unos 1,9 mil millones de parámetros. Strands lo redondea a 2 mil millones en el nombre.
Las cifras
| Medida | Resultado | Informado por |
|---|---|---|
| Latencia mediana, RTX 3090 | 115 ms | Strands, Tech Times |
| Latencia del percentil 95 | 299 ms | Tech Times |
| Latencia, MacBook Apple M3 | 153 ms | Strands |
| Precisión en JevBench v1 | 72,3 % (167 de 231 tareas) | Tech Times, Techstrong.ai |
| Tareas de nivel fácil | 100 % | Techstrong.ai |
| Tareas de nivel difícil | 50,5 % | Techstrong.ai |
| Error de calibración esperado | 0,052 | Tech Times |
JevBench es un conjunto de pruebas público para modelos de decisión. Strands dice que Decider 2B quedó tercero entre 33 modelos de la clase 2B. Si se excluyen los modelos que superan por poco los 2 mil millones de parámetros, queda primero de 30.
El error de calibración mide cuánto se ajusta la confianza de un modelo a la realidad. Un valor bajo como 0,052 significa que, cuando el modelo dice estar seguro al 90 %, acierta casi con esa frecuencia. Eso importa aquí más que la precisión bruta, como explica la siguiente sección.
El modelo y su código se pueden descargar gratis. Tech Times informa de la licencia Apache 2.0. Los pesos están en Hugging Face, en la organización StrandsAgents, y el código de entrenamiento está en GitHub, en strands-labs/strands-decider.
Una clase de modelos en crecimiento
Los modelos de decisión se están convirtiendo en una categoría propia. Según Techstrong.ai, Strands atribuye a Jev de TypeSafe AI, lanzado en septiembre, haber llamado la atención sobre este enfoque. Un rival de pesos abiertos, Laya, respondió a Jev ese mismo mes. Cloudflare siguió el 4 de octubre con Clef, modelos de pesos abiertos que devuelven decisiones.
AWS plantea el equilibrio en términos de velocidad. El modelo «elimina la necesidad de generar texto, que consume enormes cantidades de tokens y aumenta la latencia de respuesta», dijo a SiliconANGLE.
Qué significa para los desarrolladores
- Póngalo delante de su LLM, no en su lugar. Use Decider 2B para los pasos de un agente con opciones fijas: enrutamiento, elección de herramientas y comprobaciones de políticas. Deje la escritura y el razonamiento al modelo grande.
- Use la puntuación de confianza como filtro. Como el modelo está bien calibrado, puede fijar un umbral. Por encima, actúe según la elección. Por debajo, pase la decisión a un modelo mayor o a una persona.
- Manténgalo lejos de las decisiones difíciles. Un 50,5 % en tareas difíciles se parece mucho a lanzar una moneda con dos opciones. Pruebe sus propias decisiones y clasifíquelas por dificultad antes de confiar en él.
- Escriba opciones que el modelo pueda distinguir. La cabeza de punteros compara la entrada con el texto de cada opción. Unas etiquetas claras y distintas le dan más información que unas casi idénticas.
- Ejecútelo en local. Con unos 2 mil millones de parámetros, cabe en una GPU de consumo o en un portátil. Así las decisiones rutinarias quedan fuera del contador y fuera de la red.
Primero cree un pequeño conjunto de pruebas con los registros reales de su agente. Después compare las elecciones de Decider 2B con las de su LLM y mida con qué frecuencia coinciden.
Fuentes
- Introducing Strands Decider 2B: a small, open source, decision model - Strands Agents
- AWS debuts Strands Decider 2B, a first lightweight decision model for accelerate agentic workflows - SiliconANGLE
- AWS Releases Decision Model for AI Agents That Routes Without Generating Any Text - Tech Times
- AWS Explores Decision Models With Strands Decider 2B - Techstrong.ai
Artículos relacionados

Cloudflare Clef: modelos de pesos abiertos que devuelven decisiones
Clef (27B) y Clef-flash (9B) de Cloudflare responden preguntas tipadas en lugar de escribir texto, con una latencia mediana de 209 ms y 39 ms, bajo Apache 2.0.

Qwen3.5-9B gasta 32 KB por token en la caché KV
Qwen3.5-9B usa atención completa en solo 8 de sus 32 capas, así que su caché KV cuesta 32 KB por token. Esa proporción decide si cabe en 8 GB.

EmbeddingGemma 2 lleva la búsqueda multimodal al teléfono
EmbeddingGemma 2 de Google DeepMind sitúa texto, código, imágenes, vídeo y audio en un solo espacio vectorial, con 740M de parámetros. El uso solo de texto necesita unos 191 MB de RAM.