Qwen 3.8-Omni-Flash: nuevo modelo de Qianwen con soporte para entradas multimodales y procesamiento de contextos largos

El nuevo modelo nativo de próxima generación Qwen 3.8-Omni-Flash se lanzó oficialmente el 18 de septiembre. Según se informa, este modelo admite entradas de texto, imágenes, audio y video, y puede manejar contextos de hasta 1M, siendo capaz de planificar tareas de forma autónoma, invocar herramientas y completar creaciones y entregas basadas en la comprensión del contenido.

Qwen 3.8-Omni-Flash mejora la capacidad de procesamiento de audio y video

Desde el punto de vista funcional, Qwen 3.8-Omni-Flash, al continuar con las capacidades de programación, procesamiento de texto y operación de GUI, ha ampliado aún más su capacidad para manejar tareas relacionadas con audio y video. En cuanto a la comprensión de videos largos, este modelo puede enfrentar contenidos de video de varias horas, determinando qué imágenes y sonidos son relevantes a partir de las preguntas planteadas, y localizando contenido clave a través de múltiples rondas de verificación. Combinado con herramientas, el modelo también puede extraer resúmenes, tareas pendientes e información de riesgos de reuniones, y continuar ejecutando tareas posteriores como enviar correos electrónicos, escribir código o recuperar datos multimodales para generar informes.

En cuanto a la creación de audio y video, este modelo puede aplicarse a la producción de videos musicales, traducción de cortometrajes y narración de películas largas, entre otros escenarios. Por ejemplo, en la creación de videos musicales, el modelo puede entender la estructura de la canción, el ritmo y la emoción, produciendo letras a nivel de frase con marcas de tiempo; en la traducción de cortometrajes, puede realizar identificación de personajes, traducción coloquial, clonación de voz, remezcla de pistas de audio y control de calidad del producto final; en el procesamiento de películas largas, puede llevar a cabo la extracción de tramas, planificación de narraciones, doblaje, música de fondo, edición y renderizado, así como control de calidad final.

Además, el modelo puede convertir el contenido de videos largos en activos informativos reutilizables, incluyendo la organización automática de puntos de conocimiento, descomposición de pasos, generación de notas en PDF con correspondencia de texto e imagen, y su posterior transformación en habilidades de agente verificadas y evaluadas. La versión de interacción en tiempo real Qwen 3.8-Omni-Flash-Realtime puede completar simultáneamente la percepción y respuesta durante el proceso de entrada de audio y video, siendo adecuada para prácticas de conversación, percepción de audio espacial y atención al cliente inteligente, entre otros escenarios.

En términos de soporte, la compañía también ha ampliado Qwen-MM-Plugins, añadiendo múltiples capacidades orientadas a la comprensión y creación de audio y video, y ha hecho open source Qwen-Live Harness, para interacciones y ejecución de tareas de audio y video continuas y en tiempo real. Según datos oficiales, en un total de 30 evaluaciones, Qwen 3.8-Omni-Flash ha mejorado su puntuación promedio en más del 26% en comparación con la generación anterior Qwen 3.5-Omni-Plus; al mismo tiempo, el precio de entrada de audio por hora a través de API ha disminuido en más del 98%, y el precio de entrada de video por hora ha disminuido en más del 93%.

Actualmente, este modelo ya está disponible en la plataforma de inteligencia artificial Qwen.

Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep