DeepSeek ha anunciado oficialmente que el precio de su API adoptará una estructura de precios de pico y valle, donde el precio en los períodos de baja demanda será igual a la mitad del precio en los períodos de alta demanda, y entrará en vigor hoy. Esta medida ofrece flexibilidad a las empresas y desarrolladores frente a la presión de costos en diferentes ritmos de trabajo, al tiempo que mantiene el nombre del modelo de API y el modo de uso originales, facilitando a los usuarios una experiencia coherente en la APP, en la web o a través de la interfaz API. Los períodos de alta demanda están definidos como de 9:00 a 12:00 y de 14:00 a 18:00, mientras que el resto del tiempo se considera período de baja demanda. Este cambio en la estructura de precios significa que el costo de las solicitudes durante el mediodía de los días laborables podría experimentar cambios significativos, lo cual es especialmente crítico para aplicaciones que requieren una gran cantidad de tokens.
CNMO Tecnología, en un informe desde múltiples ángulos, señala que la distribución de costos de la serie DeepSeek V4 también varía en diferentes momentos. En el caso de la versión V4-Flash, el costo de aciertos en caché de entrada durante los períodos de baja demanda es de aproximadamente 0.05 yuanes, 1.5 yuanes para fallos en caché de entrada y 4.5 yuanes para costos de salida; en períodos de alta demanda, los costos son de 0.10 yuanes, 3.0 yuanes y 9.0 yuanes, respectivamente. La curva de costos de V4-Pro es aún más notable, con 0.15 yuanes para aciertos en caché de entrada, 4.5 yuanes para fallos en caché y 13.5 yuanes para costos de salida en períodos de baja demanda, y 0.30 yuanes, 9.0 yuanes y 27.0 yuanes en períodos de alta demanda. Estos números específicos proporcionan una referencia clave para los desarrolladores al evaluar costos, especialmente en escenarios que requieren inferencias continuas durante largos períodos o alta concurrencia.
Es importante destacar que, antes del lanzamiento de la nueva estructura de precios, la versión comercial de DeepSeek V4 Pro ya se había actualizado simultáneamente en el mercado para la APP, la web y la API. Los usuarios pueden seleccionar el «modo experto» a través de la APP o la web para utilizar el nuevo modelo oficial V4 Pro; el nombre del modelo API se mantiene sin cambios, asegurando que los costos de integración para los desarrolladores existentes se minimicen. Al mismo tiempo, DeepSeek también enfatiza que, en el proceso de inferencia moderna, el cálculo de costos se basará en la cantidad real de llamadas y la tasa de aciertos en caché, lo que impulsa a las empresas a mantener un nivel de servicio estable durante los períodos de alta demanda. Si estás considerando migrar a V4 Pro para obtener una mayor calidad de generación, pero te preocupa la fluctuación de costos, esta estructura de precios de pico y valle podría ofrecer una previsión de costos relativamente controlable.
Estrategias comerciales y riesgos bajo el nuevo mecanismo de precios
Desde la perspectiva de la estrategia comercial, la estructura de precios de pico y valle puede ofrecer a los usuarios una estructura de costos más flexible en diferentes momentos de los días laborables, especialmente para proveedores de SaaS cuyo enfoque principal son la producción de contenido, la inferencia de modelos de lenguaje o los servicios de preguntas y respuestas, permitiendo reducir costos operativos en horarios no pico y, a su vez, estimular la demanda de los usuarios a través de promociones o ventanas de tiempo de amortiguamiento. Para DeepSeek, esto también significa que la empresa necesita informes de costos y uso más transparentes, permitiendo a los clientes empresariales optimizar sus flujos de trabajo según sus patrones de uso reales, como programar grandes lotes de trabajo en períodos de baja demanda para reducir el gasto total. Al mismo tiempo, para los desarrolladores, familiarizarse con la distribución de costos de las diferentes versiones en períodos de alta y baja demanda ayudará a diseñar estrategias de caché y de inferencia distribuida más efectivas.
Además, aunque la empresa aún no ha hecho públicos los detalles de SLA a largo plazo, los observadores del mercado están atentos al posible aumento en los costos durante los períodos de alta demanda, que podría afectar a las aplicaciones de interacción en tiempo real. Para escenarios que requieren respuestas de baja latencia y alta estabilidad, las empresas podrían considerar el uso combinado de diferentes modelos y estrategias de programación, como activar el modo experto durante las concentraciones de solicitudes de los usuarios y volver a modelos más rentables durante los períodos de baja demanda, para mantener un equilibrio entre costos y rendimiento. Según la experiencia pasada con cambios de precios, la transparencia en las fechas de actualización de versiones, la estabilidad de los nombres de API y un buen soporte documental son clave para reducir los costos y riesgos de migración. En cuanto a la estabilidad del modelo y las actualizaciones a largo plazo, la respuesta oficial de DeepSeek indica que, aunque fenómenos como «apodos» son motivo de atención, en realidad son marcadores de contexto en el proceso de inferencia y no se memorizarán a largo plazo. Este punto tiene importantes implicaciones para la confianza del usuario y la protección de la privacidad.
En términos de detalles técnicos, el cambio más importante en el mercado radica en la definición del mecanismo de caché y los costos de salida. Un acierto en caché de entrada significa que el contenido previamente almacenado se puede utilizar rápidamente por el modelo, reduciendo el costo total de las llamadas; un fallo en caché requiere un nuevo cálculo, lo que naturalmente incrementa el costo. Los costos de salida están relacionados con la longitud del texto y la complejidad del contenido generado, lo que afecta especialmente a las aplicaciones que requieren respuestas largas o diálogos en múltiples rondas. Para DeepSeek, estos puntos de datos proporcionan una base para optimizar la programación durante los períodos de baja y alta demanda, y ayudan a los desarrolladores a realizar previsiones de costos más precisas al diseñar estrategias de llamadas a la API. Si en el futuro se publican más especificaciones de versiones, los desarrolladores podrán establecer modelos de costos más rigurosos basados en indicadores de rendimiento reales.

