La plataforma de IA de Alibaba, Qwen3-Max-Flash, lanza un nuevo modelo con arquitectura de atención híbrida.

La plataforma de inteligencia artificial Qwen de Alibaba lanzó oficialmente el modelo Qwen3-Max-Flash el 27 de agosto, posicionándose como una arquitectura de expertos híbridos multimodal (MoE) con un enfoque en la relación calidad-precio. El precio más reciente anunciado por la compañía es: RMB¥0.80 por cada millón de Tokens de entrada (aproximadamente HK$0), RMB¥2.70 por cada millón de Tokens de salida (aproximadamente HK$2), y RMB¥0.10 por cada millón de Tokens de aciertos en caché (aproximadamente HK$0).

Qwen3-Max-Flash utiliza una nueva arquitectura de atención híbrida

Qwen3-Max-Flash adopta una arquitectura de próxima generación (Next) que es completamente diferente de los modelos grandes anteriores de Qwen, con un total de parámetros que alcanza el nivel de cientos de miles de millones, pero activa solo 6 mil millones (6B) de parámetros en cada inferencia, afirmando establecer un nuevo estándar de eficiencia para modelos a nivel mundial. En términos de mecanismo de atención, el modelo introduce un mecanismo de atención dispersa único llamado QSA (Qwen Sparse Attention), que se fusiona eficientemente con GDN para formar una arquitectura de atención híbrida, logrando una velocidad de cálculo más de 8 veces superior a las soluciones tradicionales en escenarios de alta tasa de aciertos en caché y contextos largos de 1M Tokens, manteniendo al mismo tiempo la precisión.

En cuanto a la comunicación interna en capas, el modelo utiliza un método de Gated Residual desarrollado internamente, que divide el canal principal de información único del Transformer en 4 canales independientes, permitiendo que el modelo decida dinámicamente las rutas de lectura y escritura según sea necesario, lo que hace que la transmisión de información sea más eficiente y mejora simultáneamente la estabilidad del entrenamiento. Este diseño elimina los cuellos de botella causados por el canal único anterior, facilitando un flujo de gradientes más suave durante el entrenamiento a gran escala.

51B N-gram Embedding mejora la eficiencia de expansión de parámetros

En el ámbito de la expansión de parámetros, el modelo introduce además 51B de parámetros de N-gram Embedding, proporcionando una función de localización de búsqueda eficiente para el núcleo del Transformer. Estos parámetros no necesitan ser activados en tiempo real durante cada cálculo de Token, sino que se «conectan» con un manual de memoria a gran escala con un consumo de recursos extremadamente bajo, mejorando significativamente la eficiencia de expansión de parámetros del modelo y reduciendo los costos de entrenamiento. A través de este diseño desacoplado, el modelo puede mantener la velocidad de inferencia mientras carga más conocimiento del mundo en parámetros estáticos.

En cuanto a la optimización de parámetros, Qwen3-Max-Flash adopta una estrategia de avance conjunto de la estructura del modelo y la optimización posterior, lo que resulta en un aumento significativo en la eficiencia de convergencia y el rendimiento del entrenamiento. En resumen, con estas tecnologías, el nuevo modelo puede ofrecer servicios de inferencia eficientes a un costo unitario más bajo en escenarios de tareas reales como programación y agentes, proporcionando opciones más rentables para aplicaciones empresariales.

Ítem Especificaciones
Tipo de arquitectura Expertos híbridos multimodal (MoE)
Total de parámetros Cientos de miles de millones
Parámetros activados 6 mil millones (6B)
Parámetros de N-gram Embedding 51B
Mecanismo de atención Arquitectura híbrida de atención dispersa QSA + GDN
Aumento de velocidad en contextos largos Aumento de más de 8 veces en escenarios de alta tasa de aciertos de 1M Tokens
Precio de entrada RMB¥0.80 (aproximadamente HK$0)
Precio de salida RMB¥2.70 (aproximadamente HK$2)
Precio de aciertos en caché RMB¥0.10 (aproximadamente HK$0)
Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep