Skip to content

Qwen3.8-Omni-Flash baja un 98 % el costo del audio

El nuevo modelo omnimodal de Alibaba lee texto, imágenes, audio y video en un contexto de un millón de tokens, y baja más de 98 % el precio del audio de entrada.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
Glass office blocks around a lawn in the courtyard of Alibaba Group's headquarters campus in Hangzhou, China.
Foto: Danielinblue

En cifras

token context window, with up to 991K input tokens
1M
per million text input tokens
$0.15
languages supported
113
Input price cuts versus Qwen3.5-Omni-Plus
Audio
98%
Audio-visual
93%
Video
89%

Alibaba publicó Qwen3.8-Omni-Flash el 18 de septiembre de 2026, un modelo que acepta texto, imágenes, audio y video, y responde en texto. El precio es el titular. Frente a Qwen3.5-Omni-Plus, el audio de entrada cuesta más de 98 % menos por hora, la entrada audiovisual más de 93 % menos y el video cerca de 89 % menos, según MarkTechPost y AlphaSignal.

Omnimodal significa que un solo modelo maneja varios tipos de entrada de forma nativa, en lugar de una cadena que primero transcribe el audio y luego lee la transcripción. El texto cuesta 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de salida, con la entrada en caché a 0,016 dólares por millón.

Qué acepta

LímiteValor
Ventana de contexto1M de tokens, hasta 991K de entrada y 131K de salida
Longitud de razonamientoHasta 262K tokens
VideoHasta 2 horas, 2 GB, muestreado hasta 15 cuadros por segundo
AudioHasta 3 horas
Idiomas113

La disponibilidad es el punto incómodo para quien disfrutó la versión anterior. Esta llega solo por API, a través de QwenCloud, Alibaba Cloud Model Studio y Qwen Studio, sin pesos abiertos anunciados. Es un cambio de postura respecto de Qwen3.8-Flash-Next, que salió con pesos abiertos en agosto de 2026 y aporta aquí la arquitectura.

Esa arquitectura es una mezcla de expertos. La red tiene unos 125.000 millones de parámetros repartidos en 512 expertos, pero activa solo unos 6.000 millones por token, junto a una tabla de embeddings de 51.000 millones de parámetros. Ese diseño explica que un modelo tan grande pueda tener precio de uno pequeño.

Percepción agéntica y ahorro de tokens

Lo más interesante es cómo mira el video. En lugar de muestrear cuadros a intervalos fijos, inspecciona la fuente en dos pasadas: un barrido grueso para hallar el tramo relevante y luego una mirada cercana a ese tramo. AlphaSignal lo describe como percepción agéntica y cita a Qwen, que lo llama "el primer modelo de su familia que integra la percepción omnimodal en un flujo de trabajo de agente".

Los ahorros informados varían según la prueba, así que conviene citar ambos números. MarkTechPost reporta una tarea que bajó de 145.736 a 79.117 tokens, una reducción del 45,7 %. AlphaSignal cita 51,8 % menos tokens en OmniVideoBench, con una mejora agéntica media de 19,5 puntos frente al modelo anterior. BenchLM, que sigue los resultados publicados, señala que solo tiene datos de 19 de sus 446 pruebas y aún no publica una puntuación global.

Alibaba también publicó Qwen-MM-Plugins bajo licencia Apache 2.0. El conjunto añade memoria, conversión de video a notas y funciones de edición, y busca conectar la entrada multimodal con marcos de agentes existentes como Claude Code y Gemini CLI. El razonamiento extendido viene activo por defecto en el nivel más alto y se puede desactivar.

Qué significa esto para los desarrolladores

Cambios de precio de este tamaño cambian qué vale la pena construir. Transcribir una llamada de soporte, resumir una reunión grabada o revisar grabaciones de seguridad eran proyectos donde la factura del modelo decidía el diseño. Con menos de un dólar por un lote grande de tokens de texto, y el audio un 98 % más barato, el cálculo se inclina a enviar el material directamente.

Aun así, revise la cuenta de tokens antes de confiar en un presupuesto. El audio y el video consumen tokens a ritmos que dependen de la duración, la cadencia de cuadros y cuánto de la fuente decide mirar de cerca el modelo. La percepción agéntica implica que el conteo varía con el contenido, así que mida su propio peor caso y no un promedio.

La entrega solo por API es la restricción real para equipos con reglas sobre dónde van los datos. El audio y el video son justo las entradas que llevan información personal, y este modelo corre en la nube de Alibaba. Si su último despliegue de Qwen dependía de pesos locales, este no es un reemplazo directo. La cobertura de pruebas sigue siendo escasa, así que trate las cifras agénticas como datos del proveedor hasta que lleguen evaluaciones independientes.

Fuentes

  1. Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use - MarkTechPost
  2. Alibaba's Qwen3.8-Omni-Flash Cuts Video AI Costs by 89% With Agent Tool Use - AlphaSignal
  3. Qwen3.8-Omni-Flash Benchmarks & Context (September 2026) - BenchLM

Artículos relacionados