Zhiyu lanzó oficialmente el 18 de septiembre el modelo grande GLM-5.3-FlashX, cuyo máximo velocidad de inferencia puede alcanzar 200 tokens/s, diseñado para ofrecer a empresas y desarrolladores una experiencia de modelo más rápida y fluida. Actualmente, la API de GLM-5.3-FlashX ya está en línea. Según se informa, para hacer frente a la rápida creciente demanda de usuarios, Zhiyu ha incrementado aún más su inversión en Infra y optimización de inferencia sobre la base de la potencia de cálculo de chips nacionales existentes. GLM-5.3-Flash sigue manteniendo el nivel de inteligencia más fuerte en su tamaño, y ofrece una relación calidad-precio extremadamente alta; esta mejora de velocidad refuerza aún más su competitividad integral en inteligencia, precio y velocidad.
Se entiende que el GLM-5.3-Flash, lanzado anteriormente por Zhiyu, realizó pruebas a gran escala con el modelo anónimo «Ox Alpha» dirigido a desarrolladores de todo el mundo antes de su lanzamiento oficial, obteniendo un amplio reconocimiento. El volumen de llamadas después de su lanzamiento ha seguido aumentando, alcanzando el primer lugar en la lista de uso de la plataforma OpenRouter, y estableciendo nuevos récords de volumen de llamadas en las plataformas OpenCode y OpenRouter. Zhiyu ha indicado que se han invertido 100,000 chips nacionales para manejar todas las solicitudes de llamadas en línea de GLM-5.3-Flash.
Aunque no se han hecho públicos los fabricantes de chips específicos, algunos analistas de la industria especulan que es muy probable que utilicen chips de la serie Ascend de Huawei.
Zhiyu GLM-5.3-FlashX cuenta con capacidades de inferencia eficientes
A nivel de clúster, Zhiyu utiliza una arquitectura separada EPD de nivel de producción, dividiendo la codificación multimodal, el prellenado de prompts y la decodificación token por token en grupos de trabajo con programación independiente y escalado independiente, logrando un rendimiento de servicio de extremo a extremo tres veces superior a la línea base inicial, con eficiencia de hardware y costo por token alcanzando niveles comparables a los de las GPU de NVIDIA de gama alta. Zhiyu ha indicado que esta optimización ha validado la capacidad de los chips nacionales para soportar de manera eficiente y económica las demandas de inferencia de modelos de vanguardia en escenarios a gran escala.

