Google y Meta lanzaron esta semana nuevos modelos para programar
Gemini 3.8 Flash de Google y Muse Spark 1.3 de Meta llegaron con un día de diferencia, ambos centrados en código y tareas de agentes, y con precios de gama media.
2 min de lectura

En cifras
- Gemini 3.8 Flash's per-million-token input/output price through 2026
- $0.75 / $3.75
- Muse Spark 1.3's per-million-token input/output price
- $1.25 / $4.25
- token context window both new models share
- 1M
Google lanzó Gemini 3.8 Flash el 2 de septiembre, y Meta lo siguió en menos de un día con Muse Spark 1.3. Ambos apuntan al mismo nicho: modelos de gama media con precios pensados para código y trabajo de agentes de alto volumen, no solo para lucir en los benchmarks.
Gemini 3.8 Flash: barato, y pensado para sesiones largas de código
Gemini 3.8 Flash cuesta 0,75 $ por millón de tokens de entrada y 3,75 $ por millón de salida hasta finales de 2026, según el propio anuncio de Google. Google dice que supera a la mayoría de los modelos de frontera más grandes en DeepSWE v1.1, un benchmark para resolver de principio a fin problemas largos y complejos de ingeniería de software.
En Terminal-Bench 2.1, una prueba de finalización real de tareas en línea de comandos, DataCamp reporta que Gemini 3.8 Flash obtiene un 90,8 %, frente al 81,6 % de 3.7 Flash. El razonamiento general, medido por Humanity's Last Exam, apenas se movió: 45,4 % frente al 45,7 % de la versión anterior. Google está invirtiendo su presupuesto de mejora en habilidades de código y agentes, no en conocimiento puro.
Google también lanzó una variante Cyber restringida a través de su programa Fairwind, limitada a defensores verificados. Google informa una tasa de éxito superior al 70 % en un benchmark interno de descubrimiento de vulnerabilidades, y un 47,2 % en CWE-Bench, un benchmark público para parchear automáticamente fallos de seguridad conocidos.
Muse Spark 1.3: un salto grande, pero no es un modelo abierto
Muse Spark 1.3 obtiene 61 puntos en el Intelligence Index de Artificial Analysis, según Trending Topics. Eso queda justo detrás de Claude Opus 5 y GPT-5.6 Sol, y por delante de los 59 puntos que el medio atribuye a Gemini 3.8 Flash en la misma escala. Las mejoras que reporta el propio Meta son notables: la precisión en tareas bancarias subió del 35 % al 47 %, y la de operaciones de terminal del 80 % al 85 %.
Pese a cómo lo ha presentado parte de la cobertura, Muse Spark 1.3 no es un modelo de peso abierto. LLM Stats lo describe como "un modelo de razonamiento multimodal propietario", disponible solo a través de la propia API de Meta. Trending Topics señala que Meta se había comprometido a publicar los pesos del anterior Muse Spark 1.2, pero no ha decidido si los de 1.3 la seguirán. Los precios son de 1,25 $ por millón de tokens de entrada y 4,25 $ por millón de salida.
Qué significa esto para los desarrolladores
Si está eligiendo un modelo para un agente que escribe y ejecuta código, compare estos dos entre sí sobre su propia carga de trabajo. No se limite a compararlos con los modelos insignia de los que todo el mundo habla; ambos están construidos y tarifados precisamente para esta tarea.
No asuma que puede alojar Muse Spark 1.3 usted mismo. A diferencia de anteriores lanzamientos de Muse en Meta, este es solo por API por ahora, así que cualquier dependencia de él es una dependencia de la infraestructura y los precios de Meta, no de los suyos.
Fíjese en el patrón detrás de estos lanzamientos, no solo en las puntuaciones. Que dos grandes laboratorios lancen con un día de diferencia modelos de gama media optimizados para código, a precios similares, revela hacia dónde se ha movido la competencia real: no a la cima de la clasificación, sino al segmento que los desarrolladores usan de verdad, a diario y en gran volumen.
Fuentes
Artículos relacionados

Thomson Reuters construyó su propio modelo de frontera por 40 millones
Thomson Reuters dice que su modelo interno, Thomson, iguala a los laboratorios de frontera en trabajo jurídico por una fracción del coste. Las notas al pie de los benchmarks merecen una lectura atenta.

GPT-6 Astra logra un 95% en una tarea robótica y un 10% en otra
Robocurve probó GPT-6 Astra y Claude Fable 5.1 con brazos robóticos reales. Astra acertó 19 de 20 en la tarea fácil y 2 de 20 en la difícil.

GPT-6 Astra saca 99,9% o 62,7% en ARC-AGI-3, según cómo se le pregunte
El GPT-6 Astra de OpenAI logró 99,9% en ARC-AGI-3 con el montaje de prueba propio de OpenAI, y 62,7% con el montaje neutral de ARC Prize. La diferencia está en lo que se le permite recordar al modelo.