Qwen3.8-Omni-Flash baja un 98 % el costo del audio
El nuevo modelo omnimodal de Alibaba lee texto, imágenes, audio y video en un contexto de un millón de tokens, y baja más de 98 % el precio del audio de entrada.
3 min de lectura

En cifras
- token context window, with up to 991K input tokens
- 1M
- per million text input tokens
- $0.15
- languages supported
- 113
- Audio
- 98%
- Audio-visual
- 93%
- Video
- 89%
Alibaba publicó Qwen3.8-Omni-Flash el 18 de septiembre de 2026, un modelo que acepta texto, imágenes, audio y video, y responde en texto. El precio es el titular. Frente a Qwen3.5-Omni-Plus, el audio de entrada cuesta más de 98 % menos por hora, la entrada audiovisual más de 93 % menos y el video cerca de 89 % menos, según MarkTechPost y AlphaSignal.
Omnimodal significa que un solo modelo maneja varios tipos de entrada de forma nativa, en lugar de una cadena que primero transcribe el audio y luego lee la transcripción. El texto cuesta 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de salida, con la entrada en caché a 0,016 dólares por millón.
Qué acepta
| Límite | Valor |
|---|---|
| Ventana de contexto | 1M de tokens, hasta 991K de entrada y 131K de salida |
| Longitud de razonamiento | Hasta 262K tokens |
| Video | Hasta 2 horas, 2 GB, muestreado hasta 15 cuadros por segundo |
| Audio | Hasta 3 horas |
| Idiomas | 113 |
La disponibilidad es el punto incómodo para quien disfrutó la versión anterior. Esta llega solo por API, a través de QwenCloud, Alibaba Cloud Model Studio y Qwen Studio, sin pesos abiertos anunciados. Es un cambio de postura respecto de Qwen3.8-Flash-Next, que salió con pesos abiertos en agosto de 2026 y aporta aquí la arquitectura.
Esa arquitectura es una mezcla de expertos. La red tiene unos 125.000 millones de parámetros repartidos en 512 expertos, pero activa solo unos 6.000 millones por token, junto a una tabla de embeddings de 51.000 millones de parámetros. Ese diseño explica que un modelo tan grande pueda tener precio de uno pequeño.
Percepción agéntica y ahorro de tokens
Lo más interesante es cómo mira el video. En lugar de muestrear cuadros a intervalos fijos, inspecciona la fuente en dos pasadas: un barrido grueso para hallar el tramo relevante y luego una mirada cercana a ese tramo. AlphaSignal lo describe como percepción agéntica y cita a Qwen, que lo llama "el primer modelo de su familia que integra la percepción omnimodal en un flujo de trabajo de agente".
Los ahorros informados varían según la prueba, así que conviene citar ambos números. MarkTechPost reporta una tarea que bajó de 145.736 a 79.117 tokens, una reducción del 45,7 %. AlphaSignal cita 51,8 % menos tokens en OmniVideoBench, con una mejora agéntica media de 19,5 puntos frente al modelo anterior. BenchLM, que sigue los resultados publicados, señala que solo tiene datos de 19 de sus 446 pruebas y aún no publica una puntuación global.
Alibaba también publicó Qwen-MM-Plugins bajo licencia Apache 2.0. El conjunto añade memoria, conversión de video a notas y funciones de edición, y busca conectar la entrada multimodal con marcos de agentes existentes como Claude Code y Gemini CLI. El razonamiento extendido viene activo por defecto en el nivel más alto y se puede desactivar.
Qué significa esto para los desarrolladores
Cambios de precio de este tamaño cambian qué vale la pena construir. Transcribir una llamada de soporte, resumir una reunión grabada o revisar grabaciones de seguridad eran proyectos donde la factura del modelo decidía el diseño. Con menos de un dólar por un lote grande de tokens de texto, y el audio un 98 % más barato, el cálculo se inclina a enviar el material directamente.
Aun así, revise la cuenta de tokens antes de confiar en un presupuesto. El audio y el video consumen tokens a ritmos que dependen de la duración, la cadencia de cuadros y cuánto de la fuente decide mirar de cerca el modelo. La percepción agéntica implica que el conteo varía con el contenido, así que mida su propio peor caso y no un promedio.
La entrega solo por API es la restricción real para equipos con reglas sobre dónde van los datos. El audio y el video son justo las entradas que llevan información personal, y este modelo corre en la nube de Alibaba. Si su último despliegue de Qwen dependía de pesos locales, este no es un reemplazo directo. La cobertura de pruebas sigue siendo escasa, así que trate las cifras agénticas como datos del proveedor hasta que lleguen evaluaciones independientes.
Fuentes
- Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use - MarkTechPost
- Alibaba's Qwen3.8-Omni-Flash Cuts Video AI Costs by 89% With Agent Tool Use - AlphaSignal
- Qwen3.8-Omni-Flash Benchmarks & Context (September 2026) - BenchLM
Artículos relacionados

Jev, de TypeSafe, devuelve decisiones tipadas, no texto
Jev responde en 70 a 500 milisegundos y cuesta 0,042 dólares por millón de tokens de entrada, con salida gratis. No sabe generar texto en absoluto.

GPT-6 Astra ya está disponible de forma general en Bedrock y Copilot
GPT-6 Astra está disponible de forma general en Amazon Bedrock a 10 dólares por millón de tokens de entrada, y en GitHub Copilot para los planes Pro+, Max, Business y Enterprise.

DeepSeek avisa a los desarrolladores de una subida significativa del precio de su API
DeepSeek avisó a los desarrolladores el 6 de agosto de que los precios de su API subirán 'significativamente' pronto, sin cifras ni fechas, mientras V4-Flash es el modelo conocido más barato de ejecutar.