Volver al Blog
Modelos de IA 17 de agosto de 2026 5 min read

DeepSeek lanza V4-Pro fuera de vista previa — un MoE de 1.6 billones de parámetros con compatibilidad nativa con las API de Anthropic y OpenAI

DeepSeek-V4-Pro 0813 salió de vista previa tras casi cuatro meses, con un 80.6% en SWE-bench Verified y una arquitectura mixture-of-experts que recorta el cómputo de inferencia un 73% en contexto de un millón de tokens.

DeepSeek lanza V4-Pro fuera de vista previa — un MoE de 1.6 billones de parámetros con compatibilidad nativa con las API de Anthropic y OpenAI

DeepSeek-V4-Pro 0813 ya no está en vista previa. El modelo alcanzó disponibilidad general el 12 de agosto, cerrando una ventana de casi cuatro meses que comenzó con el debut del 24 de abril, y DeepSeek lo confirmó en un changelog de su API publicado el 13 de agosto.

La arquitectura es un sistema mixture-of-experts con 1.6 billones de parámetros totales y 49.000 millones activos por token — un recuento de parámetros activos menor que el de la mayoría de sus rivales insignia pese al enorme total. La gran baza de eficiencia de DeepSeek son sus variantes “Compressed Sparse Attention” y “Heavily Compressed Attention”, que recortan el cómputo de inferencia al 27% y la caché KV a apenas el 10% de lo que requería V3.2 en contexto de un millón de tokens. Ese es el dato que importa para quien ejecute cargas de trabajo de documentos largos o agentes multipaso: inferencia de contexto largo más barata sin renunciar a la ventana de un millón de tokens.

Los benchmarks de la configuración tope, V4-Pro-Max: 80.6% en SWE-bench Verified, 93.5% pass@1 en LiveCodeBench, 90.1% en GPQA Diamond y 87.5% en MMLU-Pro. Esas cifras lo sitúan en la misma conversación que los otros lanzamientos insignia de este mes — Gemini 3.7 Flash, Grok 4.6 — en benchmarks de código y razonamiento, con el pricing característicamente agresivo de DeepSeek.

El precio actual de la API es de $0.435 por millón de tokens de entrada con fallo de caché (baja a $0.003625 con acierto de caché) y $0.87 por millón de tokens de salida, con un máximo de salida de 384.000 tokens y soporte para tres modos de razonamiento: sin pensar, razonamiento alto y esfuerzo máximo. El endpoint habla nativamente el formato ChatCompletions de OpenAI, el formato Messages de Anthropic y la propia Responses API de DeepSeek — una decisión deliberada para que cambiar de proveedor sea un ajuste de configuración, no una reescritura. La coincidencia temporal es notable: llega la misma semana en que Stripe acordó comprar la startup de gateway de IA OpenRouter por exactamente la misma razón — nadie quiere seguir atado a la API de un solo modelo.

DeepSeek también ha anunciado “un aumento significativo” en el precio general de su API, sin detalles concretos — una señal de que las tarifas agresivas que hicieron famosos a V3 y R1 por abaratar costos frente a los laboratorios occidentales podrían no durar mucho más a medida que crece el uso.

La estrategia de lanzamiento repite la de V3: sacar primero la variante Flash, más pequeña y barata (31 de julio), como opción por defecto para cargas de agentes, y llevar el modelo Pro completo a disponibilidad general una vez validado. Pro tiene un límite de concurrencia de 500 solicitudes frente a 2.500 de Flash, lo que refuerza que Flash — no Pro — está pensado como el caballo de batalla para pipelines de agentes de alto volumen, dejando Pro para tareas que necesitan margen extra de razonamiento.

Los pesos de las versiones de vista previa de abril siguen en Hugging Face; DeepSeek aún no ha publicado por separado los pesos de la GA 0813, así que quienes autoalojan el modelo están por ahora ejecutando una versión anterior a la que está en vivo en la API.

Fuentes

DeepSeek AI Models MoE API Pricing Open Source