
En este artículo (4)
Análisis de DeepSeek V4 Flash 0731: puntuación de 50, 60% más barato
Puntos Clave
- Compara los modelos por el costo total de la tarea, no solo por la puntuación en benchmarks, especialmente para cargas de trabajo repetidas de contexto largo.
- Prueba las tasas de acierto de caché con tus propios prompts, porque la ventaja de precio de DeepSeek depende en gran medida de la economía de la caché.
- Espera a ver los pesos completos y datos independientes de latencia antes de comprometer cargas de trabajo de producción.
Artificial Analysis afirma que DeepSeek ganó 10 puntos en el Índice de Inteligencia mientras reducía el costo de una tarea comparable de Luna mediante una política agresiva de precios de caché.
Artificial Analysis dice que DeepSeek ganó 10 puntos en el Índice de Inteligencia mientras reducía el costo de una tarea comparable de Luna mediante precios de caché agresivos.
Lo más divertido de los benchmarks de IA es que el número del que todo el mundo hace capturas de pantalla a menudo no es el número que aparece en tu factura de la nube. DeepSeek V4 Flash 0731 acaba de darnos ambos números, lo cual es desconsiderado con los vendedores de humo, pero útil para las personas que implementan cosas a propósito. Artificial Analysis informa que el modelo obtiene 50 en su Índice de Inteligencia, un salto de 10 puntos respecto al DeepSeek V4 Flash de abril de 2026, mientras que el costo por tarea de la API propia de DeepSeek queda alrededor de un 60% por debajo de GPT-5.6 Luna. En algún lugar, una hoja de cálculo acaba de aclararse la garganta.
Artificial Analysis sitúa a Flash 0731 cerca de Luna
Artificial Analysis dice que DeepSeek V4 Flash 0731 obtiene 50 en su Índice de Inteligencia, frente a 40 del DeepSeek V4 Flash anterior lanzado en abril de 2026. Eso también lo coloca 6 puntos por delante de DeepSeek V4 Pro, según el mismo informe de Artificial Analysis. Lo interesante no es solo el salto, porque los benchmarks son confeti si no están ligados a la realidad del despliegue. Es que Artificial Analysis coloca el modelo un punto del Índice de Inteligencia por detrás de GPT-5.6 Luna, que tiene 51, lo suficientemente cerca como para que los equipos de compras empiecen a comportarse como mapaches en un contenedor de basura de precios. Artificial Analysis también enmarca el modelo frente a competidores cercanos: GLM-5.2 con 51, Gemini 3.6 Flash con 50, Muse Spark 1.1 con 51 y Kimi K3 con 57 como la frontera de pesos abiertos. Ese contexto importa porque una puntuación de 50 no gana toda la competición de levantamiento de pesas, pero de repente está en la misma plataforma que modelos que muchos desarrolladores considerarían para cargas de trabajo serias de agentes, codificación y razonamiento. El informe dice que DeepSeek V4 Flash 0731 conserva una ventana de contexto de 1M de tokens y que su tamaño sigue sin cambios respecto a DeepSeek V4 Flash. En palabras sencillas: esto se parece menos a una criatura nueva gigantesca y más a la misma criatura después de un fin de semana muy productivo con posentrenamiento.
La historia del precio es en realidad una
historia de caché Artificial Analysis dice que DeepSeek V4 Flash 0731 comparte arquitectura y precios idénticos con el DeepSeek V4 Flash anterior, mientras aterriza en su frontera de Pareto de Inteligencia frente a costo por tarea. El mismo informe dice que, incluso después del recorte de precio del 80% de OpenAI en GPT-5.6 Luna, el costo por tarea de DeepSeek V4 Flash 0731 en la API propia de DeepSeek es aproximadamente un 60% más bajo que el de GPT-5.6 Luna. Ese es el tipo de frase que hace que los gráficos de benchmarks se sientan menos como charla deportiva y más como una factura con opiniones. Si dos modelos son más o menos comparables en un conjunto de tareas, el más barato no necesita ganar cada gráfico de barras para ganar un puesto en el despliegue. El ingrediente secreto, según Artificial Analysis, es el descuento de acierto de caché de aproximadamente el 98% de DeepSeek en su API propia, en comparación con el descuento de acierto de caché del 90% que ofrece la mayoría de la industria. Aquí es donde los precios de IA dejan de ser simples matemáticas de menú y se convierten en acumular cupones en una tienda de comestibles dirigida por álgebra lineal. La entrada en caché puede importar mucho para aplicaciones con prompts repetidos, instrucciones de sistema, estructuras de recuperación, reutilización de contexto largo o bucles de agentes que siguen arrastrando la misma mochila de tokens. Los datos de proveedores de Artificial Analysis listan a DeepSeek como el proveedor disponible para DeepSeek V4 Flash 0731 y muestran un precio combinado de $0.06 por 1M de tokens, mientras señalan que los benchmarks de proveedor, como la velocidad de salida y el tiempo de respuesta de extremo a extremo, no están disponibles para esa página.
DeepSeek dice que la ruta de
la API sigue siendo aburrida, y eso es bueno El registro de cambios de la API de DeepSeek dice que la API oficial DeepSeek-V4-Flash entró en beta pública el 2026-07-31, y que el método de llamada permanece sin cambios: establece el nombre del modelo como deepseek-v4-flash para usar la versión más reciente. La compatibilidad aburrida está infravalorada. Todo el mundo quiere magia hasta que su capa de orquestación empieza a gritar porque un proveedor renombró el libro de hechizos. El mismo registro de cambios de DeepSeek informa resultados de benchmarks de agentes para el lanzamiento oficial, incluyendo Terminal Bench 2.1 con 82.7, NL2Repo con 54.2, Cybergym con 76.7, DeepSWE con 54.4, Toolathlon verified con 70.3, Agent Last Exam con 25.2, Automation Bench Public con 25.1, DSBench-FullStack con 68.7 y DSBench-Hard con 59.6. DeepSeek dice que el V4-Flash oficial admite de forma nativa el formato de la Responses API y está adaptado específicamente para Codex. También dice que DeepSeek-V4-Flash-0731 mantiene la misma arquitectura y tamaño de modelo que DeepSeek-V4-Flash-Preview, y que solo fue re-posentrenado. Esa última cláusula es el verdadero caramelo para nerds: no toda mejora significativa de un modelo requiere hacer la cosa más grande, más caliente y más cara, como un rack de GPU haciendo cosplay de horno de pizza.
Qué deberían probar ahora los desarrolladores Artificial Analysis dice que se
espera que DeepSeek publique los pesos completos del modelo en las próximas semanas, así que las evaluaciones locales y autoalojadas podrían volverse más relevantes si eso ocurre. Hasta entonces, el movimiento práctico es probar tu propia carga de trabajo tanto frente a la calidad como al comportamiento de la caché. Un modelo que parece barato en una calculadora genérica puede volverse caro si tus prompts son todos copos de nieve únicos, y un modelo más caro puede volverse tolerable si su calidad evita reintentos. La caché de tokens no es un adorno aquí: es la salsa, el plato y posiblemente el camarero. Para los desarrolladores, DeepSeek V4 Flash 0731 es un recordatorio de que la competencia entre modelos frontera trata cada vez más del costo total por tarea, no solo de quién puede levantar el benchmark más alto. Observa los datos de latencia, el rendimiento real en codificación y agentes, las tasas de acierto de caché y si la esperada publicación de pesos cambia las opciones de despliegue. El marcador se ajustó, pero la factura es donde la trama aprendió a programar.