Abstrakte Darstellung eines KI-Modells mit API

DeepSeek V4 Pro llega con agentes más potentes

DeepSeek-V4-Pro ya está disponible de forma general y se orienta más a aplicaciones de agentes en producción. El modelo ofrece un esfuerzo de razonamiento configurable, integración con Codex a través de la Responses API compatible con OpenAI y un nuevo modelo de precios de API con tarifas punta y valle.

Disponibilidad y enfoque de uso

DeepSeek-V4-Pro se puede usar en la app y en la web mediante Expert Mode. Además, el modelo está disponible a través de la API. Los nombres de los modelos se mantienen sin cambios, algo que puede simplificar las integraciones existentes.

El foco está en los flujos de trabajo con agentes. Es decir, aplicaciones que procesan tareas en varios pasos, revisan resultados intermedios y, cuando hace falta, llaman a herramientas o funciones externas.

  • Acceso: V4-Pro está disponible mediante app, web y API.
  • Compatibilidad: Los nombres de los modelos existentes deberían mantenerse sin cambios.
  • Ámbito de uso: DeepSeek posiciona V4-Pro sobre todo para aplicaciones de agentes con mayores exigencias de planificación y ejecución.

Esfuerzo de razonamiento configurable e integración con la API

DeepSeek incorpora en V4-Pro y V4-Flash un Reasoning Effort configurable. Con esto, los desarrolladores pueden definir cuánta capacidad de cálculo debe dedicar el modelo a resolver problemas internamente.

El nivel low encaja con tareas sencillas. High está pensado para flujos de agentes del día a día. Max se dirige a tareas más complejas, en las que importan más unos pasos intermedios bien trabajados que obtener la respuesta lo antes posible.

Además, DeepSeek admite de forma nativa la Responses API compatible con OpenAI. Para Codex hay una configuración optimizada que debería facilitar integraciones con muy poco ajuste.

Resultados de benchmark en comparación

Los datos de benchmark muestran mejoras claras frente a las versiones Preview. La diferencia se nota especialmente en tareas que ponen a prueba agentes, desarrollo de software o resolución de problemas en varios pasos.

Benchmark V4-Pro 0813 V4-Pro Preview V4-Flash 0813 V4-Flash Preview
HLE sin y con herramientas 42,7 / 60,0 37,7 / 48,2 37,8 / 51,5 34,8 / 45,1
Terminal Bench 2.1 87,9 72,1 82,7 61,8
NL2Repo 61,5 38,5 54,2 39,4
Cybergym 83,3 52,7 76,7 38,7
DeepSWE 62,7 12,8 54,4 7,3
Toolathlon-Verified 74,1 55,9 70,3 49,7
Agents‘ Last Exam 25,7 16,5 25,2 15,8
AutomationBench Public 31,8 12,8 25,1 10,8
DSBench-FullStack 71,1 41,8 68,7 37,0
DSBench-Hard 67,2 31,1 59,6 25,8

Los mayores saltos se ven en DeepSWE, AutomationBench Public y DSBench-Hard. Estos datos apuntan a que DeepSeek quiere mejorar sobre todo el uso práctico en escenarios de desarrollo y de agentes.


Publicado

en

por

Etiquetas: