DeepSeek-V4-Pro ya está disponible de forma general y se orienta más a aplicaciones de agentes en producción. El modelo ofrece un esfuerzo de razonamiento configurable, integración con Codex a través de la Responses API compatible con OpenAI y un nuevo modelo de precios de API con tarifas punta y valle.
Disponibilidad y enfoque de uso
DeepSeek-V4-Pro se puede usar en la app y en la web mediante Expert Mode. Además, el modelo está disponible a través de la API. Los nombres de los modelos se mantienen sin cambios, algo que puede simplificar las integraciones existentes.
El foco está en los flujos de trabajo con agentes. Es decir, aplicaciones que procesan tareas en varios pasos, revisan resultados intermedios y, cuando hace falta, llaman a herramientas o funciones externas.
- Acceso: V4-Pro está disponible mediante app, web y API.
- Compatibilidad: Los nombres de los modelos existentes deberían mantenerse sin cambios.
- Ámbito de uso: DeepSeek posiciona V4-Pro sobre todo para aplicaciones de agentes con mayores exigencias de planificación y ejecución.
Esfuerzo de razonamiento configurable e integración con la API
DeepSeek incorpora en V4-Pro y V4-Flash un Reasoning Effort configurable. Con esto, los desarrolladores pueden definir cuánta capacidad de cálculo debe dedicar el modelo a resolver problemas internamente.
El nivel low encaja con tareas sencillas. High está pensado para flujos de agentes del día a día. Max se dirige a tareas más complejas, en las que importan más unos pasos intermedios bien trabajados que obtener la respuesta lo antes posible.
Además, DeepSeek admite de forma nativa la Responses API compatible con OpenAI. Para Codex hay una configuración optimizada que debería facilitar integraciones con muy poco ajuste.
Resultados de benchmark en comparación
Los datos de benchmark muestran mejoras claras frente a las versiones Preview. La diferencia se nota especialmente en tareas que ponen a prueba agentes, desarrollo de software o resolución de problemas en varios pasos.
| Benchmark | V4-Pro 0813 | V4-Pro Preview | V4-Flash 0813 | V4-Flash Preview |
|---|---|---|---|---|
| HLE sin y con herramientas | 42,7 / 60,0 | 37,7 / 48,2 | 37,8 / 51,5 | 34,8 / 45,1 |
| Terminal Bench 2.1 | 87,9 | 72,1 | 82,7 | 61,8 |
| NL2Repo | 61,5 | 38,5 | 54,2 | 39,4 |
| Cybergym | 83,3 | 52,7 | 76,7 | 38,7 |
| DeepSWE | 62,7 | 12,8 | 54,4 | 7,3 |
| Toolathlon-Verified | 74,1 | 55,9 | 70,3 | 49,7 |
| Agents‘ Last Exam | 25,7 | 16,5 | 25,2 | 15,8 |
| AutomationBench Public | 31,8 | 12,8 | 25,1 | 10,8 |
| DSBench-FullStack | 71,1 | 41,8 | 68,7 | 37,0 |
| DSBench-Hard | 67,2 | 31,1 | 59,6 | 25,8 |
Los mayores saltos se ven en DeepSWE, AutomationBench Public y DSBench-Hard. Estos datos apuntan a que DeepSeek quiere mejorar sobre todo el uso práctico en escenarios de desarrollo y de agentes.

