La plataforma de inteligencia artificial Qwen de Alibaba lanzó oficialmente el modelo Qwen3-Max-Flash el 27 de agosto, posicionándose como una arquitectura de expertos híbridos multimodal (MoE) con un enfoque en la relación calidad-precio. El precio más reciente anunciado por la compañía es: RMB¥0.80 por cada millón de Tokens de entrada (aproximadamente HK$0), RMB¥2.70 por cada millón de Tokens de salida (aproximadamente HK$2), y RMB¥0.10 por cada millón de Tokens de aciertos en caché (aproximadamente HK$0).
Qwen3-Max-Flash utiliza una nueva arquitectura de atención híbrida
Qwen3-Max-Flash adopta una arquitectura de próxima generación (Next) que es completamente diferente de los modelos grandes anteriores de Qwen, con un total de parámetros que alcanza el nivel de cientos de miles de millones, pero activa solo 6 mil millones (6B) de parámetros en cada inferencia, afirmando establecer un nuevo estándar de eficiencia para modelos a nivel mundial. En términos de mecanismo de atención, el modelo introduce un mecanismo de atención dispersa único llamado QSA (Qwen Sparse Attention), que se fusiona eficientemente con GDN para formar una arquitectura de atención híbrida, logrando una velocidad de cálculo más de 8 veces superior a las soluciones tradicionales en escenarios de alta tasa de aciertos en caché y contextos largos de 1M Tokens, manteniendo al mismo tiempo la precisión.
En cuanto a la comunicación interna en capas, el modelo utiliza un método de Gated Residual desarrollado internamente, que divide el canal principal de información único del Transformer en 4 canales independientes, permitiendo que el modelo decida dinámicamente las rutas de lectura y escritura según sea necesario, lo que hace que la transmisión de información sea más eficiente y mejora simultáneamente la estabilidad del entrenamiento. Este diseño elimina los cuellos de botella causados por el canal único anterior, facilitando un flujo de gradientes más suave durante el entrenamiento a gran escala.
51B N-gram Embedding mejora la eficiencia de expansión de parámetros
En el ámbito de la expansión de parámetros, el modelo introduce además 51B de parámetros de N-gram Embedding, proporcionando una función de localización de búsqueda eficiente para el núcleo del Transformer. Estos parámetros no necesitan ser activados en tiempo real durante cada cálculo de Token, sino que se «conectan» con un manual de memoria a gran escala con un consumo de recursos extremadamente bajo, mejorando significativamente la eficiencia de expansión de parámetros del modelo y reduciendo los costos de entrenamiento. A través de este diseño desacoplado, el modelo puede mantener la velocidad de inferencia mientras carga más conocimiento del mundo en parámetros estáticos.
En cuanto a la optimización de parámetros, Qwen3-Max-Flash adopta una estrategia de avance conjunto de la estructura del modelo y la optimización posterior, lo que resulta en un aumento significativo en la eficiencia de convergencia y el rendimiento del entrenamiento. En resumen, con estas tecnologías, el nuevo modelo puede ofrecer servicios de inferencia eficientes a un costo unitario más bajo en escenarios de tareas reales como programación y agentes, proporcionando opciones más rentables para aplicaciones empresariales.
| Ítem | Especificaciones |
|---|---|
| Tipo de arquitectura | Expertos híbridos multimodal (MoE) |
| Total de parámetros | Cientos de miles de millones |
| Parámetros activados | 6 mil millones (6B) |
| Parámetros de N-gram Embedding | 51B |
| Mecanismo de atención | Arquitectura híbrida de atención dispersa QSA + GDN |
| Aumento de velocidad en contextos largos | Aumento de más de 8 veces en escenarios de alta tasa de aciertos de 1M Tokens |
| Precio de entrada | RMB¥0.80 (aproximadamente HK$0) |
| Precio de salida | RMB¥2.70 (aproximadamente HK$2) |
| Precio de aciertos en caché | RMB¥0.10 (aproximadamente HK$0) |

