Tu app de DeepSeek ya está tronada: guía de emergencia para migrar a V4 (el deadline pasó hace 10 días)
El corte de la API legacy de DeepSeek fue el 24 de julio y si no migraste, ya tienes errores en producción. Guía técnica para devs en México: qué cambiar, cómo migrarlo en 10 minutos y por qué V4-Flash sale más barato que V3.
Si abriste tu dashboard hoy y tus llamadas a la API de DeepSeek están retornando errores, no es un problema de tu servidor: es que no migraste al modelo V4 antes del 24 de julio. El deadline pasó hace 10 días y deepseek-chat y deepseek-reasoner ya no existen como identificadores válidos. Desde el 24 de julio a las 15:59 UTC, el puente se cayó sin vuelta atrás.
La buena noticia: el fix es literalmente cambiar una línea de código. La mala: si llevas 10 días con tu app caída y apenas lo estás viendo, hay que hacer revisiones de monitoreo más seguidas, wey.
Qué pasó exactamente
DeepSeek lanzó V4 el 24 de abril de 2026. Ya lo habíamos cubierto cuando DeepSeek V4 anunció sus primeros detalles con 1 trillón de parámetros y licencia Apache 2.0. Desde ese día, los identificadores legacy empezaban a redirigir temporalmente a V4-Flash para darte 3 meses de transición sin drama.
El anuncio oficial en la documentación de DeepSeek fue claro desde el principio: deepseek-chat y deepseek-reasoner se discontinuarían el 24 de julio. No hubo sorpresa. El que no migró, simplemente no migró.
La migración: qué cambia en tu código
El base URL no cambió. Sigue siendo https://api.deepseek.com. Lo que cambia son los identificadores de modelo:
| Antes usabas | Ahora usa | Notas |
|---|---|---|
deepseek-chat | deepseek-v4-flash | thinking desactivado por default |
deepseek-reasoner | deepseek-v4-flash | thinking activado en el body |
| - | deepseek-v4-pro | modelo flagship premium |
Si usabas deepseek-chat (chat normal)
# Antes
resp = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": prompt}],
)
# Ahora
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": prompt}],
extra_body={"thinking": {"type": "disabled"}},
)
Si usabas deepseek-reasoner (razonamiento extendido)
# Ahora
resp = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": prompt}],
extra_body={"thinking": {"type": "enabled"}},
)
El gran cambio conceptual: antes el modelo determinaba si había razonamiento o no. Ahora es un parámetro de la llamada. Esto te da más control, pero también significa que puedes activar thinking por error y multiplicar tu costo de tokens de salida hasta 3 veces sin darte cuenta.
Flash vs Pro: cuál te conviene
DeepSeek V4 tiene dos sabores y la elección importa para tu factura:
V4-Flash para el 90% de los casos de uso:
- 284B parámetros totales, 13B activos (arquitectura MoE)
- Contexto de 1 millón de tokens
- $0.14/M tokens de entrada | $0.28/M de salida
- Cache hit: $0.0028/M (prácticamente gratis si cacheas bien)
V4-Pro para tareas complejas de código o razonamiento profundo:
- 1.6T parámetros totales, 49B activos
- Contexto de 1 millón de tokens
- $0.435/M tokens de entrada | $0.87/M de salida
- Cache hit: $0.003625/M
La comparación vs V3 es donde está la sorpresa buena: V3.2 costaba $0.28/M en entrada y $0.42/M en salida con contexto de apenas 128K tokens. V4-Flash es 50% más barato en entrada y viene con 8x más contexto. Si migras a Flash, pagas menos y procesas más texto por llamada. Con el tipo de cambio actual, un millón de tokens de salida en V4-Flash sale alrededor de $5 pesos mexicanos. Para proyectos de mediana escala sigue siendo la opción de modelos frontier más barata del mercado.
El peligro del thinking mode activado por error
Esto aplica con todos los modelos de razonamiento y como hemos visto en el comparativo honesto de modelos de IA para empresas mexicanas, el costo del razonamiento extendido puede dispararse rápido: cuando thinking está activo, los tokens de salida pueden multiplicarse 3x porque el modelo incluye su cadena interna de razonamiento en la respuesta.
Si tu app no necesita razonamiento extendido (la mayoría no lo necesita), siempre pasa "thinking": {"type": "disabled"} explícitamente. No lo dejes implícito.
Rendimiento vs V3: la diferencia real
En benchmarks de código, el salto de V3 a V4 es visible:
| Benchmark | V3.2 | V4-Flash | V4-Pro |
|---|---|---|---|
| HumanEval | ~82% | ~86% | ~90% |
| SWE-bench Verified | 67.8% | ~79% | ~81% |
| MMLU-Pro | 85.0 | ~84 | ~89 |
Para la mayoría de las apps de producción: chatbots, extractores de datos, clasificadores, V4-Flash iguala o supera a V3.2 con menor costo. V4-Pro brilla en agentes de código autónomo: un 13 puntos porcentuales más en SWE-bench es una diferencia real si tu producto hace generación o revisión de código.
Checklist antes de deployar el fix
Según la guía técnica de migración publicada por Developers Digest, estos son los puntos que más tronan en producción:
- Cambia todos los
model: "deepseek-chat"→deepseek-v4-flash - Cambia todos los
model: "deepseek-reasoner"→deepseek-v4-flash+ thinking enabled - Si tienes multi-turn conversations, limpia el campo
reasoning_contentantes de reutilizar mensajes del asistente en el historial - Ajusta
max_tokenssi lo tenías hardcodeado al límite viejo de 64K (ahora el tope es 384K) - Prueba tus tool calls en modo thinking activado: el reasoner viejo no soportaba function calling, V4 sí, pero puede comportarse diferente
- Revisa tu estrategia de prompt caching: con el descuento de cache hit en V4, vale la pena estructurar tus prompts para maximizarlo
¿Y si usas un proveedor intermediario?
La mayoría de los proxies populares como OpenRouter ya actualizaron sus alias automáticamente. Pero si usas un gateway propio o un proveedor menos conocido, puede que todavía tengan los alias viejos y el error esté del lado del proxy, no del tuyo. Revisa la documentación del intermediario antes de lanzarte a debuggear tu propio código.
Disponibilidad desde México
La API de DeepSeek es una chimba de accesible: sin bloqueos geográficos para México, registro directo en platform.deepseek.com, y pago con tarjeta internacional o crédito de cuenta. Nada de distribuidores locales ni trámites raros.
Para los devs que todavía están evaluando si vale la pena apostar por DeepSeek vs otras opciones de IA disponibles en el mercado mexicano, nuestra guía de herramientas de IA para devs, diseñadores y marketers en 2026 tiene el panorama completo con precios actualizados.
Si ya tienes producción caída
- Hotfix inmediato: cambia el model name en tu config y redeploya, literalmente 2 minutos
- Activa monitoring de errores en tus llamadas a la API si no lo tenías
- Revisa logs de los últimos 10 días para saber exactamente desde cuándo empezaron los errores
El fix es simple pero el daño ya está hecho si tenías clientes activos durante estos 10 días. Tómalo como excusa para implementar alertas en tus integraciones: cuando un modelo se depreca, normalmente dan aviso con meses de anticipación como hizo DeepSeek desde abril. Si tienes un sistema de monitoreo que detecta errores 4xx/5xx en llamadas a APIs externas, este tipo de incidente se habría resuelto en horas, no días.
¿Ya migraste sin pedos o te agarró el deadline con la guardia baja? ¿Cuál parte del código fue más cabrona de encontrar y cambiar? Cuéntanos en los comentarios.
Fuentes
- DeepSeek V4 API Migration Guide: What Breaks on July 24 (Rohit Raj)
- DeepSeek V3 vs V4: Benchmarks & Pricing 2026 (CoderSera)
- DeepSeek Retires deepseek-chat and deepseek-reasoner: Migration Guide (Developers Digest)
- DeepSeek V4 Migration: Flash, Pro and API Updates (4sAPI Blog)
- Change Log, DeepSeek API Docs
Comentarios
No te pierdas ningún post
Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.
También te puede interesar
Claude Opus 5 cuesta lo mismo que Opus 4.8 pero le gana a Fable 5 en los benchmarks que importan: cuánto te ahorras en pesos como dev en México
Anthropic lanzó Claude Opus 5 el 24 de julio a $5/$25 por millón de tokens, mismo precio que su antecesor pero con resultados que superan a Fable 5 en coding, razonamiento y automatización. Todo lo que necesitas saber para decidir si te migras.
Gemini 3.5 Flash ya le ganó a Gemini 3.1 Pro siendo más barato: lo que los devs en México necesitan saber hoy
Google lanzó en el I/O 2026 un modelo Flash que supera al Pro en coding y agentes, corre a 289 tokens/segundo y cuesta la tercera parte que GPT-5.5. Aquí los números reales.
OpenAI levantó $122 mil millones: en qué va a gastar ese dinero y por qué los devs en México deben estar atentos al roadmap 2026
OpenAI cerró la ronda de inversión más grande de la historia con $122B a una valuación de $852B. Desglosamos en qué se va a ir ese dinero y qué significa para los desarrolladores mexicanos que usan su API.