DeepSeek recientemente lanzó su nueva generación de modelo de IA V4.1-Flash. Según la presentación oficial, aunque el tamaño total de parámetros y los parámetros de activación de V4.1-Flash son inferiores a los de V4-Pro, su rendimiento, velocidad de inferencia y control de costos son más destacados, especialmente en tareas relacionadas con agentes inteligentes y programación, donde algunos resultados de pruebas de referencia superan a los modelos de vanguardia como V4-Pro y GPT-5.6 Sol.
DeepSeek V4.1-Flash destaca en rendimiento y costos
DeepSeek señala que V4.1-Flash utiliza una arquitectura de mezcla de expertos, con un total de 552 mil millones de parámetros, 8 mil millones de parámetros de activación en la fase de entrada y 16 mil millones en la fase de salida. En comparación, la generación anterior V4-Flash tenía un total de 284 mil millones de parámetros, mientras que V4-Pro alcanzaba los 1.6 billones de parámetros. Una de las principales mejoras de este modelo es la compresión significativa de la caché KV, que se reduce a aproximadamente 890 bytes por token, mientras que la velocidad de salida alcanza aproximadamente 214.4 tokens por segundo, con un tiempo de respuesta para el primer token de 1.13 segundos.
La agencia de evaluación independiente AA otorgó una calificación de «velocidad significativamente más rápida».
En términos de rendimiento, DeepSeek indica que V4.1-Flash, en configuraciones de alta intensidad de inferencia, supera a GPT 5.6 Sol y Claude Opus 5 en pruebas de operaciones finales, reparación de código y tareas de automatización. Sin embargo, en tareas de inferencia general de alta dificultad más amplias, el rendimiento de este modelo es relativamente promedio. Los datos de AA muestran que el índice de inteligencia general de V4.1-Flash es de 40 puntos, superior al nivel medio de la mayoría de los modelos de pesos de código abierto similares, pero aún por debajo de los modelos de vanguardia.
Es importante señalar que AA ha actualizado recientemente su sistema de evaluación, y los criterios de puntuación general se han endurecido notablemente, lo que ha llevado a una disminución en las puntuaciones de varios modelos de alta puntuación.
En cuanto a precios, los datos de AA indican que el costo de V4.1-Flash es de US$0.30 por cada millón de tokens de entrada (aproximadamente HK$2), y de US$1.20 por cada millón de tokens de salida (aproximadamente HK$9), con un costo total aproximado de US$0.18 (aproximadamente HK$1), que es inferior a la mediana de modelos similares. Si se utiliza la caché, el precio puede bajar aún más a US$0.01 por cada millón de tokens (aproximadamente HK$0). AA también señala que este modelo tiende a generar respuestas más largas, y la cantidad total de tokens de salida en las evaluaciones es significativamente mayor que la de modelos similares, lo que podría afectar el tiempo y los costos en el uso práctico.
En el aspecto técnico, V4.1-Flash introduce una nueva estructura llamada CED, que divide las 40 capas de Transformer en 20 capas de codificadores causales y 20 capas de decodificadores, reduciendo los cálculos redundantes causados por la atención cruzada tradicional, y combinando métodos como CSA2 y cuantificación FP4 para comprimir la caché y el uso de memoria. En general, la actualización de DeepSeek se centra en la optimización de la ejecución de agentes, la capacidad de codificación y los costos de implementación.

