¿DeepSeek o ChatGPT: qué modelo resuelve mejor las tareas cotidianas en alemán? Hemos enfrentado a DeepSeek-V4.1-Flash y DeepSeek-V4-Pro (ambos con modo Thinking) contra GPT-5.6 Sol de OpenAI, con cinco tareas idénticas: una trampa de cálculo, un correo comercial, una función de Python, una pregunta factual con referencia temporal y un resumen. Obtendrá las respuestas reales (abreviadas), una valoración comprensible, tiempos de respuesta medidos y la comparativa de contexto: pesos abiertos, ubicación de los servidores, imágenes, ventana de contexto y apps. A Claude y Gemini los situamos brevemente, sin pruebas propias.
Contenido
- Resumen
- Diseño de la prueba: modelos, modo, valoración
- Las cinco tareas con respuestas reales
- Tiempo de respuesta y consumo de tokens
- Comparativa de contexto: licencia, privacidad, imágenes, contexto, apps
- Dónde se sitúan Claude y Gemini
- Conclusión: para quién es adecuado cada uno
- Preguntas frecuentes
- Fuentes y cambios
Resumen
- Los tres modelos resolvieron correctamente en cuanto al contenido las cinco tareas en alemán; la calidad lingüística es equivalente.
- El único error factual: V4-Pro deja pasar diéresis en un IBAN en la prueba de Python (
isalnum()sin comprobación ASCII). - Los tres indicaron «junio de 2024» como fecha de conocimiento; OpenAI documenta para GPT-5.6 Sol el 16 de febrero de 2026. Las autodeclaraciones sobre la fecha de conocimiento no sirven.
- V4.1-Flash fue el más rápido en tres de las cinco tareas, pero razona mucho ante preguntas abiertas (una vez casi 5.000 tokens); en ese caso GPT-5.6 Sol quedó por delante. V4-Pro no fue mejor en ningún caso y fue más lento en todos.
- Las diferencias reales están en el contexto: DeepSeek es abierto (licencia MIT), pero procesa en China; ChatGPT es cerrado, genera imágenes y ofrece a clientes empresariales alojamiento de datos en la UE.
Diseño de la prueba: modelos, modo, valoración
Probado el 17 de septiembre de 2026 a través de las interfaces de los proveedores, sin prompt de sistema, cada tarea una vez por modelo:
| Modelo | Estado | Modo en la prueba | Probar |
|---|---|---|---|
DeepSeek-V4.1-Flash (deepseek-flash) |
publicado el 10/09/2026 | Thinking activado, effort «high» (predeterminado) | Chat en la página de inicio (allí sin Thinking, las respuestas llegan al instante) |
DeepSeek-V4-Pro (deepseek-v4-pro) |
disponible de forma general desde el 13/08/2026 | Thinking activado, effort «high» (predeterminado) | Chat con V4-Pro |
| GPT-5.6 Sol | buque insignia de la familia GPT-5.6 | Responses API, reasoning-effort «low» | ChatGPT, API de OpenAI |
Se valoraron la corrección, el cumplimiento de las indicaciones (tono, longitud, formato), el tiempo de respuesta y los tokens de salida, incluido el razonamiento. Limitación: el reasoning-effort no es idéntico («low» en GPT-5.6 Sol, predeterminado «high» en DeepSeek); eso favorece a OpenAI en velocidad y a DeepSeek en tareas difíciles. Contexto: DeepSeek V4: la nueva generación de modelos.
Escollo con el modo Thinking: En la primera ronda, el límite de salida era de 1.500 tokens. En tres tareas, V4.1-Flash y V4-Pro lo consumieron por completo razonando y entregaron una respuesta vacía, pues la API de DeepSeek cuenta reasoning_content dentro de los tokens de salida. Ajuste max_tokens con generosidad en el modo Thinking. Repetimos estas seis llamadas con 8.000 tokens; las citas proceden de la repetición.
Las cinco tareas con respuestas reales
Tarea 1: problema de cálculo con trampa
Prompt: «Una panadería vende panecillos a 0,45 € la unidad. A partir de 10 unidades hay un 10 % de descuento sobre la compra total. La señora Meier compra 9 panecillos, el señor Schulz compra 10 panecillos. ¿Quién paga menos y cuál es la diferencia en céntimos? Responde brevemente con el procedimiento de cálculo.» La trampa: ambos pagan 4,05 €.
V4-Pro, Thinking activado: «Sra. Meier: 9 × 0,45 € = 4,05 € = 405 céntimos / Sr. Schulz: 10 × 0,45 € = 4,50 € − 10 % de descuento = 4,05 € = 405 céntimos / Ambos pagan lo mismo. Diferencia: 0 céntimos.»
Valoración: Los tres correctos y concisos; V4.1-Flash («Ambos pagan 4,05 €. La diferencia es 0 céntimos.») y GPT-5.6 Sol calcularon de forma idéntica, pero lo formatearon como LaTeX, lo que molesta en texto plano. V4-Pro escribió texto sencillo y convirtió a céntimos como se pedía. Tiempos: V4.1-Flash 1,3 segundos, GPT-5.6 Sol 5,2, V4-Pro 5,3.
Tarea 2: correo comercial con indicación de tono
Prompt (abreviado): Segundo recordatorio de pago con asunto, remitente Müller Bürotechnik GmbH, destinatario el señor Krause, factura n.º 2026-0417 por 1.240,00 €, vencida desde el 15 de agosto de 2026, primer recordatorio del 1 de septiembre sin respuesta, nuevo plazo el 24 de septiembre de 2026. «Tono: cortés, pero firme, sin amenazas; tratamiento de usted; ortografía alemana con ß; máximo 120 palabras.»
V4.1-Flash, Thinking activado: «Asunto: Segundo recordatorio de pago – Factura n.º 2026-0417 / Estimado señor Krause, lamentablemente no hemos recibido respuesta a nuestro primer recordatorio de pago del 1 de septiembre de 2026. Por ello, le recordamos de nuevo la factura pendiente n.º 2026-0417 por 1.240,00 €. Esta está vencida desde el 15 de agosto de 2026. Le rogamos que transfiera el importe a más tardar el 24 de septiembre de 2026 a nuestra cuenta conocida. Si ya ha realizado el pago, considere este correo sin efecto. […] Atentamente, Müller Bürotechnik GmbH»
Valoración: Los tres textos están libres de errores, escriben «Grüßen» con ß, reproducen correctamente cada cifra, no amenazan y se mantienen por debajo del límite: GPT-5.6 Sol 91 palabras, V4.1-Flash 89, V4-Pro 79. GPT-5.6 Sol acierta con mayor precisión la jerga del cobro de deudas («leider konnten wir […] noch keinen Zahlungseingang feststellen»), V4.1-Flash queda a la par, V4-Pro es el más escueto y algo torpe con «wir erinnern höflich an unsere Rechnung». Más sobre prompts en alemán: Usar DeepSeek en alemán.
Tarea 3: función de Python con casos límite
Prompt (abreviado): Función iban_formatieren(iban: str) -> str que formatee un IBAN en grupos de cuatro, elimine espacios y convierta las minúsculas en mayúsculas; una cadena vacía o solo con espacios da como resultado una cadena vacía; los caracteres que no sean letras ni cifras provocan un ValueError. Solo código con docstring y dos llamadas de ejemplo.
La respuesta de V4.1-Flash (Thinking activado), completa:
def iban_formatieren(iban: str) -> str:
"""Formatiert eine IBAN in Vierergruppen; entfernt Leerzeichen und prüft Zeichen."""
iban = iban.replace(" ", "").upper()
if not iban:
return ""
if not all(c.isascii() and c.isalnum() for c in iban):
raise ValueError("IBAN darf nur Buchstaben und Ziffern enthalten")
return " ".join(iban[i:i + 4] for i in range(0, len(iban), 4))
print(iban_formatieren("de89 3704 0044 0532 0130 00"))
print(iban_formatieren(" "))
Ejecutamos las tres funciones con siete entradas; los casos normales, la entrada vacía y el guion fueron tratados correctamente por todas. Con "DE89ä370", V4-Pro devolvió «DE89 Ä370» en lugar de un error: str.isalnum() cuenta en Python también las diéresis como letras. V4.1-Flash y GPT-5.6 Sol comprueban además el ASCII y lo rechazan. V4.1-Flash eligió como segundo ejemplo, de forma deliberada, el caso límite «solo espacios»; los otros dos solo casos normales. Velocidad: GPT-5.6 Sol 4,7 segundos, V4.1-Flash 10,5 (2.219 tokens de razonamiento), V4-Pro 26,7.
Tarea 4: pregunta factual con referencia temporal
Prompt (abreviado): Tres preguntas: ¿qué fecha es hoy o hasta cuándo llega tu fecha de conocimiento? ¿Quién es el canciller federal de Alemania? ¿Cuál es el modelo de IA más reciente que conoces de OpenAI y de DeepSeek? En cada caso con indicación del grado de certeza, máximo 120 palabras.
V4.1-Flash, Thinking activado: «1. Hoy es 9 de mayo de 2026 (fecha del sistema; certeza alta). Mi fecha de conocimiento llega hasta junio de 2024 (alta). 2. Canciller federal: según el estado actual, Friedrich Merz; mi conocimiento fiable hasta junio de 2024 menciona a Olaf Scholz. Por tanto, certeza media. 3. OpenAI: GPT-4o (mayo de 2024; certeza alta). DeepSeek: DeepSeek-V2 o DeepSeek-Coder-V2 […].»
GPT-5.6 Sol, effort low: «1. La fecha de hoy no puedo indicarla de forma fiable sin la hora del sistema. Mi fecha de conocimiento llega hasta junio de 2024. Certeza: alta. 2. Según ese conocimiento, Olaf Scholz es el canciller federal de Alemania. […] 3. […] GPT-4o de OpenAI (mayo de 2024) y DeepSeek-Coder-V2 de DeepSeek (junio de 2024 […]).»
Valoración: V4-Pro respondió como GPT-5.6 Sol (Olaf Scholz, GPT-4o, DeepSeek-V2). Ninguno de los tres conoce su propia generación, y todos indican «junio de 2024», aunque OpenAI documenta para GPT-5.6 Sol el 16 de febrero de 2026: las autodeclaraciones son frases estándar aprendidas, no información. Al menos V4.1-Flash nombró con Friedrich Merz (canciller desde mayo de 2025) al jefe de Gobierno correcto y señaló la contradicción por sí mismo; los otros dos advirtieron correctamente de su incertidumbre. La «fecha del sistema 9 de mayo de 2026» no procede de nuestro prompt; no pudimos aclarar su origen. Consecuencia: para todo lo posterior a 2025, los tres necesitan una búsqueda web o información en el prompt. Cronología de los modelos DeepSeek: Un año de DeepSeek.
Tarea 5: resumen en tres puntos
Prompt (abreviado): Un párrafo de la empresa municipal de servicios sobre un corte total de seis semanas de la Bahnhofstraße a partir del 1 de octubre de 2026 (calefacción urbana, desvío de las líneas de autobús 3 y 7, teléfono ciudadano, reserva por condiciones meteorológicas) debe resumirse en exactamente tres puntos de un máximo de 15 palabras cada uno.
V4.1-Flash, Thinking activado: «– A partir del 1 de octubre de 2026: Bahnhofstraße entre Marktplatz y Ringstraße cortada seis semanas por calefacción urbana. – Residentes por Gartenstraße; autobuses 3/7 por Ringstraße, parada sustitutiva Rathaus; comercios accesibles a pie. – Teléfono ciudadano 0800 123456 en días laborables de 8 a 16 h; el calendario puede variar con mal tiempo.»
Valoración: V4-Pro y GPT-5.6 Sol respondieron prácticamente igual. Los tres cumplen las indicaciones con exactitud: tres puntos, de 12 a 14 palabras, toda la información clave. Velocidad: V4.1-Flash 3,7 segundos, GPT-5.6 Sol 11,7, V4-Pro 14,0.
Tiempo de respuesta y consumo de tokens
Duración total de la llamada hasta la respuesta completa; «tokens de salida» incluye los tokens de razonamiento.
| Tarea | V4.1-Flash (segundos / tokens de salida) | V4-Pro | GPT-5.6 Sol |
|---|---|---|---|
| 1 Trampa de cálculo | 1,3 s / 205 | 5,3 s / 309 | 5,2 s / 80 |
| 2 Correo electrónico | 4,5 s / 1.031 | 21,8 s / 1.403 | 10,1 s / 203 |
| 3 Python | 10,5 s / 2.381 | 26,7 s / 1.684 | 4,7 s / 152 |
| 4 Pregunta factual | 23,0 s / 5.104 | 22,2 s / 1.268 | 11,7 s / 451 |
| 5 Resumen | 3,7 s / 815 | 14,0 s / 903 | 11,7 s / 337 |
V4.1-Flash es claramente el más rápido en tareas breves y claras, pero razona mucho ante preguntas abiertas: en la pregunta factual fueron 4.958 tokens de razonamiento para 120 palabras de respuesta. Quien no lo necesite, ajusta el effort a «low» o desactiva el Thinking (instrucciones: API de DeepSeek: primeros pasos). V4-Pro fue más lento en todo y mejor en nada. Esto coincide con la afirmación de DeepSeek de que V4.1-Flash supera al modelo anterior en rendimiento, costes y velocidad, y explica por qué V4-Pro solo sigue funcionando a petición de los usuarios.
Comparativa de contexto: licencia, privacidad, imágenes, contexto, apps
| Criterio | DeepSeek (V4.1-Flash, V4-Pro) | ChatGPT (GPT-5.6 Sol) |
|---|---|---|
| Pesos del modelo | abiertos, licencia MIT (Hugging Face); se puede alojar uno mismo, también con terceros en la UE | cerrados; solo son abiertos los modelos pequeños gpt-oss (120b, 20b) |
| Ubicación de los servidores de la API | China (api.deepseek.com) | EE. UU.; para clientes de API con acuerdo adicional, Europa (eu.api.openai.com) |
| Generar imágenes | no | sí, mediante los modelos GPT-Image separados en ChatGPT |
| Ventana de contexto | 1 millón de tokens | 1.050.000 tokens |
| Salida máxima | 384.000 tokens | 128.000 tokens |
| Fecha de conocimiento documentada | no indicada | 16 de febrero de 2026 |
| Acceso sin API | app y web de DeepSeek (V4-Pro como «Expert Mode»); chat en esta página | apps y web de ChatGPT |
Pesos abiertos y privacidad: DeepSeek pone V4.1-Flash y V4-Pro a disposición bajo licencia MIT en Hugging Face, con informe técnico y código de inferencia; OpenAI mantiene GPT-5.6 Sol cerrado. Para usuarios particulares esto es irrelevante, para empresas con requisitos de protección de datos es el argumento central: a través de la API o la app oficiales, las entradas van a servidores de DeepSeek en China, pero un proveedor europeo puede alojar por sí mismo el modelo abierto, y entonces rigen sus condiciones. OpenAI procesa en EE. UU. y ofrece a los clientes de API, tras aprobación y anexo contractual, el procesamiento y almacenamiento en la región «Europe (EEA + Switzerland)».
Aviso sobre deepseek.de: Sus consultas en el chat con V4.1-Flash y en el chat con V4-Pro van por API a DeepSeek, es decir, a servidores en China. No introduzca allí datos sensibles. Detalles en la política de privacidad.
Imágenes y contexto: Ningún modelo de DeepSeek puede generar imágenes; ChatGPT las genera mediante los modelos GPT-Image integrados. En cuanto al contexto, ambos documentan alrededor de un millón de tokens; en la salida, DeepSeek va por delante con 384.000 tokens frente a los 128.000 de GPT-5.6 Sol.
Apps y disponibilidad: Ambos tienen apps y chat web; en DeepSeek, V4-Pro es seleccionable allí como «Expert Mode» (app de DeepSeek). A los desarrolladores, DeepSeek les ofrece un formato compatible con OpenAI y otro compatible con Anthropic, de modo que herramientas como Claude Code, Codex u OpenCode pueden usar DeepSeek. La facturación es por tokens, con tarifas más económicas en horas de menor uso y aciertos de caché (página oficial de precios).
Dónde se sitúan Claude y Gemini
Sin pruebas propias, según las documentaciones oficiales (a fecha de 17 de septiembre de 2026):
- Claude (Anthropic): Actualmente Claude Fable 5.1, Opus 5, Sonnet 5 y Haiku 4.5. Los tres grandes tienen 1 millón de tokens de contexto y 128.000 tokens de salida, entienden imágenes, no las generan y razonan de forma «adaptativa». Fecha de conocimiento documentada: junio de 2026 (Fable 5.1), mayo de 2026 (Opus 5), enero de 2026 (Sonnet 5). Pesos cerrados; disponibles también a través de Amazon Bedrock, Google Cloud y Microsoft Foundry. En la propia tabla de benchmarks de DeepSeek, Claude Opus 5 supera a V4.1-Flash con la mayor claridad en las tareas de agente más difíciles.
- Gemini (Google): Buque insignia Gemini 3.1 Pro (vista previa), modelo Flash más reciente Gemini 3.8 Flash. Ambos aceptan 1.048.576 tokens de entrada y devuelven 65.536 tokens, bastante menos que DeepSeek. Su rasgo distintivo es la amplitud de entrada: texto, imagen, vídeo, audio y PDF. Generación de imágenes mediante modelos separados (Nano Banana 2, Nano Banana Pro). Google no indica una fecha de conocimiento en las páginas de los modelos; pesos cerrados.
Conclusión: para quién es adecuado cada uno
- Tareas cotidianas en alemán: Calidad equivalente; decida según velocidad, costes y privacidad. V4.1-Flash suele ser la opción más rápida, para probar en el chat en la página de inicio.
- Programar: V4.1-Flash y GPT-5.6 Sol entregaron código más robusto que V4-Pro. Los benchmarks de DeepSeek sitúan a V4.1-Flash por delante de GPT-5.6 Sol y por detrás de Claude Opus 5 en tareas de agente; datos del fabricante que nuestra prueba no puede verificar.
- Generar imágenes, un ecosistema todo en uno: ChatGPT o Gemini. DeepSeek no genera imágenes.
- Privacidad con control propio: DeepSeek autoalojado o a través de un proveedor europeo; OpenAI en la UE para clientes de API con anexo contractual.
- Conocimiento actualizado: Ningún modelo sustituye a la búsqueda web.
- V4-Pro: No es mejor que V4.1-Flash en nada, pero es más lento; visión general en Modelos.
Preguntas frecuentes
¿Es DeepSeek en alemán tan bueno como ChatGPT?
En nuestras cinco tareas, sí: ortografía, ß, tratamiento de usted, tono e indicaciones de longitud fueron respetados por V4.1-Flash y V4-Pro igual que por GPT-5.6 Sol.
¿Por qué GPT-5.6 Sol indica junio de 2024 como fecha de conocimiento si OpenAI documenta febrero de 2026?
Porque los modelos no «saben» su fecha de conocimiento, sino que reproducen frases de los datos de entrenamiento. Fíese de la documentación del proveedor; en DeepSeek no la hay.
¿Puedo usar DeepSeek sin que los datos vayan a China?
Solo si aloja usted mismo el modelo abierto o elige un proveedor que lo aloje en la UE. La API, la app y el chat en deepseek.de envían a DeepSeek.
¿Merece la pena V4-Pro todavía frente a V4.1-Flash?
Según nuestras pruebas y los propios datos de DeepSeek, no: V4.1-Flash fue más rápido, igual de bueno o mejor. DeepSeek mantiene V4-Pro a petición de los usuarios hasta que aparezca V4.1-Pro.
Fuentes y cambios
- DeepSeek: DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient (10/09/2026), DeepSeek-V4-Pro GA Release (13/08/2026), DeepSeek V4 Preview Release (24/04/2026)
- DeepSeek: Models & Pricing, Thinking Mode
- Hugging Face: DeepSeek-V4.1-Flash (licencia MIT, arquitectura, tabla de benchmarks)
- OpenAI: Visión general de modelos, GPT-5.6 Sol, Data residency
- Anthropic: Models overview
- Google: Gemini models con las páginas de Gemini 3.1 Pro y Gemini 3.8 Flash
- Pruebas propias del 17/09/2026: 15 llamadas evaluadas (5 tareas × 3 modelos); respuestas en bruto, tokens y tiempos en el protocolo de pruebas
07-deepseek-vs-chatgpt-tests.txt
Cambios: 17/09/2026 – Artículo creado de nuevo, sin texto anterior. Todas las tareas, respuestas, mediciones y la verificación del código se realizaron expresamente para esta versión; la comparativa de contexto se basa en las documentaciones de DeepSeek, OpenAI, Anthropic y Google consultadas el mismo día.

