DeepSeek: La IA china gratis

Análisis profundo sobre DeepSeek, la startup china que ha desafiado a Silicon Valley con modelos de IA de frontera a una fracción del coste. Arquitectura técnica, economía disruptiva y guía práctica.

DeepSeek: La IA china gratis

Qué ha cambiado con DeepSeek, por qué el “cuanto más grande, mejor” ya no vale y qué significa todo esto para quien construye productos con IA.


1. El momento “Sputnik” de la inteligencia artificial

2025 no pasará a la historia de la tecnología por un dispositivo nuevo ni por una compra multimillonaria. Pasará por el día en que una startup de Hangzhou desafió a Silicon Valley con un presupuesto que en las cuentas de Google o Microsoft parecería un error de redondeo. Hablamos de DeepSeek, la empresa detrás de lo que muchos analistas han llamado el “momento Sputnik” de la IA generativa.

Para nosotros, como agencia de inteligencia artificial, DeepSeek no es una noticia más. Es un cambio de reglas. Durante años, la narrativa dominante, la de las “leyes de escalado”, decía que la única manera de conseguir una inteligencia superior era con clústeres de computación enormes, un consumo eléctrico desorbitado y presupuestos de entrenamiento cercanos a los cien millones de dólares. DeepSeek ha demostrado que no es la única manera.

El impacto fue inmediato. Cuando DeepSeek lanzó su modelo de razonamiento R1 en enero de 2025, los mercados reaccionaron con una volatilidad histórica. Se estima que el lanzamiento y la adopción masiva de esta herramienta “gratuita” borraron temporalmente cerca de un billón de dólares de valor bursátil de las tecnológicas estadounidenses. NVIDIA cayó cerca de un 17% en una sola sesión, la mayor pérdida de capitalización en un día registrada hasta entonces. No fue pánico irracional: fue Wall Street reconociendo de golpe que el “foso defensivo” de la infraestructura masiva ya no era inexpugnable. La eficiencia algorítmica había llegado para competir con la fuerza bruta del hardware.

La propuesta de DeepSeek es tan disruptiva como sencilla: modelos de frontera que rivalizan con GPT-4o y la serie o1 de OpenAI en razonamiento, matemáticas y programación, con un coste de entrenamiento e inferencia varios órdenes de magnitud inferior. Mientras los gigantes occidentales doblaban la apuesta por los superclústeres, DeepSeek reescribía la arquitectura de los Transformers para hacer más con menos. En este artículo explicamos cómo lo ha conseguido una empresa nacida de un fondo de inversión cuantitativo, qué tecnología lo hace posible y qué implica para la privacidad, la geopolítica y el desarrollo de software.


2. Orígenes: del trading de alta frecuencia a la AGI

Para entender cómo diseña DeepSeek hay que mirar su ADN, que se parece poco al de las startups de IA salidas de la universidad o del capital riesgo californiano. DeepSeek no es una spin-off académica: es la criatura de High-Flyer Capital Management, uno de los grandes fondos de inversión cuantitativa de China.

2.1. El factor High-Flyer y Liang Wenfeng

High-Flyer la fundó en 2016 Liang Wenfeng, ingeniero informático formado en la Universidad de Zhejiang, con una misión clara: aplicar la inteligencia artificial a las finanzas. En el trading algorítmico y de alta frecuencia, la eficiencia computacional no es un lujo, es una cuestión de supervivencia. La diferencia entre ganar y perder se mide en microsegundos y en la capacidad de procesar terabytes de datos de mercado con la menor latencia posible.

Esa cultura de optimización extrema pasó directamente a DeepSeek cuando nació como filial. A diferencia de los laboratorios que suelen priorizar el rendimiento académico sobre la viabilidad económica, el equipo de DeepSeek abordó la inteligencia artificial general (AGI) con mentalidad de trader: ¿cómo maximizamos el retorno (inteligencia) minimizando el coste (cómputo)? Liang Wenfeng y su equipo, que en sus inicios trabajaban desde un modesto apartamento en Chengdu, aplicaron al entrenamiento de modelos de lenguaje las lecciones aprendidas prediciendo precios de acciones, un problema con mucho ruido y poca señal.

2.2. Innovación nacida de la restricción geopolítica

El contexto geopolítico ha sido decisivo. Las sanciones de Estados Unidos, que restringieron con dureza la exportación de chips de IA punteros (como las NVIDIA H100) a China, obligaron a la compañía a innovar por necesidad. Mientras sus competidores de San Francisco o Londres resolvían los cuellos de botella añadiendo más GPU de última generación, DeepSeek tuvo que apañarse con hardware más limitado: chips H800 (versiones recortadas de las H100) y clústeres de A100.

Esa restricción actuó como catalizador. DeepSeek no podía permitirse la ineficiencia. Tuvo que replantear cómo los modelos usan la memoria y el cómputo, y desarrollar algoritmos que exprimieran cada GPU y redujeran el consumo energético para entrenar modelos enormes con una fracción de los recursos habituales. Se estima que el entrenamiento completo de DeepSeek-V3 costó unos 5,6 millones de dólares en tiempo de GPU, frente a los 100 millones o más que se calculan para modelos como GPT-4.

La historia de DeepSeek es, por tanto, la del ingenio frente a la adversidad. Al no poder escalar “hacia arriba” con hardware más potente, escalaron “hacia dentro” con arquitecturas más inteligentes. Esa filosofía se concreta en innovaciones como la atención latente multicabezal (MLA) y una arquitectura Mixture-of-Experts (MoE) muy granular, que veremos en las secciones técnicas.


3. La familia de modelos: una cronología de la disrupción (2024-2025)

El catálogo de DeepSeek ha evolucionado a toda velocidad, sobre todo en el último año. Para una agencia de IA es importante distinguir cada versión y aplicar la herramienta adecuada a cada problema. Repasamos la familia.

3.1. DeepSeek-V3: el caballo de batalla (lanzamiento: finales de 2024)

DeepSeek-V3 es la culminación de la arquitectura eficiente para tareas generales. Es un modelo Mixture-of-Experts (MoE) con 671.000 millones de parámetros en total, de los que solo 37.000 millones se activan para cada token.

Se diseñó como motor principal de inferencia, equilibrando un conocimiento enciclopédico con una velocidad de respuesta excelente. Se entrenó con un corpus de 14,8 billones de tokens, una cantidad enorme que asegura una cobertura lingüística y cultural muy amplia. A diferencia de sus predecesores, V3 mostró una estabilidad de entrenamiento notable: el equipo reportó que en todo el proceso no hubo picos de pérdida irrecuperables, un problema habitual al entrenar modelos de este tamaño.

Posicionamiento: DeepSeek-V3 compite de tú a tú con GPT-4o y Claude 3.5 Sonnet en chat general, generación de contenido y tareas auxiliares de programación. Su gran ventaja es el coste: entre un 90% y un 95% más barato que sus equivalentes occidentales.

3.2. DeepSeek-R1: el desafío al razonamiento (lanzamiento: enero de 2025)

Si V3 fue una mejora de eficiencia, R1 fue un cambio de categoría. Lanzado el 20 de enero de 2025, DeepSeek-R1 es un modelo especializado en razonamiento, diseñado para competir con la serie o1 de OpenAI (y en muchos casos igualarla).

La “R” viene de reasoning, razonamiento. El modelo usa aprendizaje por refuerzo (RL) para desarrollar cadenas de pensamiento internas antes de responder. En lugar de predecir la siguiente palabra de inmediato, como hacen los modelos estándar, R1 se toma un tiempo para “pensar”, planificar y verificar su lógica paso a paso.

Hay dos variantes principales:

  • DeepSeek-R1-Zero: entrenado casi exclusivamente con RL, sin una fase previa extensa de ajuste supervisado (SFT). Demostró que el razonamiento complejo puede surgir solo con incentivos de refuerzo, aunque sufría problemas de legibilidad y mezclaba idiomas.
  • DeepSeek-R1: la versión pulida. Añade una fase de “arranque en frío” con datos supervisados antes del RL, lo que corrige la coherencia lingüística y la facilidad de uso del modelo Zero. Su rendimiento es comparable al de OpenAI o1-1217.

3.3. DeepSeek-V3.2 y la variante Speciale (lanzamiento: diciembre de 2025)

Para cerrar el año, el 1 de diciembre de 2025 DeepSeek lanzó la actualización V3.2, dividiendo su oferta en dos líneas para cubrir necesidades distintas.

  • DeepSeek-V3.2: el sucesor directo de V3. Integra capacidades de razonamiento para tareas de agentes y es el primer modelo de la casa que admite llamadas a herramientas (tool calls) tanto en modo razonamiento como en modo estándar. Está optimizado para velocidad y uso diario, con un rendimiento cercano a GPT-5 en benchmarks públicos. Introduce DeepSeek Sparse Attention (DSA) para abaratar todavía más los contextos largos.
  • DeepSeek-V3.2-Speciale: el modelo de “fuerzas especiales”. Está pensado para llevar el razonamiento al límite y rivaliza con Gemini 3 Pro de Google. Es más denso y más caro de ejecutar, y se centra en problemas matemáticos de nivel olímpico y pruebas lógicas extremas. De momento no admite herramientas, porque su foco es el razonamiento puro. Ha obtenido resultados de medalla de oro en las olimpiadas internacionales de matemáticas (IMO) e informática (IOI) de 2025, un hito para un modelo de pesos abiertos.
ModeloLanzamientoArquitecturaFoco principalCoste relativo
DeepSeek-V3Dic. 2024MoE (671B/37B)General, chat, códigoMuy bajo
DeepSeek-R1Ene. 2025RL sobre MoERazonamiento, matemáticasBajo
DeepSeek-V3.2Dic. 2025MoE + DSAAgentes, herramientasMuy bajo
V3.2-SpecialeDic. 2025MoE densoRazonamiento extremoMedio/alto

4. Disección técnica: la ingeniería de la eficiencia

La ventaja de DeepSeek no es magia. Es ingeniería de sistemas y de algoritmos de muy alto nivel. Para una agencia técnica, entender estos mecanismos ayuda a decidir cuándo y cómo desplegar estos modelos. Veamos los tres pilares de su arquitectura: MLA, DeepSeekMoE y GRPO.

4.1. Multi-Head Latent Attention (MLA): compresión de la memoria

Uno de los mayores cuellos de botella al ejecutar modelos de lenguaje grandes es la caché de claves y valores (KV cache). En la atención multicabezal estándar (MHA), cada cabeza de atención tiene que guardar matrices grandes de claves y valores por cada token generado. A medida que el contexto crece (a 128.000 tokens, por ejemplo), la memoria de vídeo necesaria para esa caché crece de forma lineal y obliga a usar clústeres enormes de GPU solo para almacenar, no para calcular.

DeepSeek introdujo MLA (Multi-Head Latent Attention) para resolverlo. En vez de guardar las matrices completas, MLA proyecta claves y valores en un espacio latente comprimido de baja dimensión.

  • Mecanismo: aplica una compresión conjunta de bajo rango a claves y valores. Durante la inferencia, el modelo recupera lo que necesita de ese estado comprimido sin descomprimirlo del todo en memoria.
  • Impacto: reduce drásticamente el tamaño de la KV cache. DeepSeek-V3 puede servir contextos de 128.000 tokens con una fracción de la memoria que necesitaría un Llama 3 o un GPT-4 equivalente. Esta innovación es la que hace que el modelo sea tan barato de operar: caben lotes mucho más grandes de usuarios en el mismo hardware.

4.2. DeepSeekMoE: granularidad extrema

Modelos como Mixtral 8x7B popularizaron la arquitectura Mixture-of-Experts (MoE). DeepSeek la refinó con DeepSeekMoE.

  • Expertos granulares: en un MoE tradicional puede haber 8 expertos grandes, de los que se activan 2 por token. DeepSeek usa muchos más expertos, mucho más pequeños (64 expertos enrutados más expertos compartidos).
  • Expertos compartidos: aísla algunos expertos que siempre están activos para capturar el conocimiento común, mientras los expertos enrutados se ocupan de los matices específicos.
  • Activación: de los 671.000 millones de parámetros totales, solo se activan 37.000 millones por token. El modelo tiene la “capacidad cerebral” de un modelo gigante (para saber mucho) con el “coste metabólico” de uno pequeño (para responder rápido).

4.3. Balanceo de carga sin pérdidas auxiliares

Al entrenar un MoE es vital que todos los expertos trabajen por igual: si uno se vuelve demasiado popular, se crea un cuello de botella. Lo habitual es añadir una “pérdida auxiliar” a la función de entrenamiento para penalizar el desequilibrio. DeepSeek descubrió que esa pérdida auxiliar interfiere con el objetivo principal de aprendizaje y empeora el modelo.

La solución: una estrategia de balanceo de carga sin pérdidas auxiliares (auxiliary-loss-free load balancing). Ajustan dinámicamente un término de sesgo en las puntuaciones de enrutamiento para equilibrar la carga sin tocar los gradientes de la pérdida principal. El resultado es un modelo que aprende mejor y más rápido.

4.4. GRPO: reinforcement learning eficiente

Para el modelo de razonamiento R1, DeepSeek también tuvo que innovar en el aprendizaje por refuerzo. El método estándar, PPO (Proximal Policy Optimization), obliga a mantener en memoria un “modelo crítico” casi tan grande como el modelo principal, lo que duplica los requisitos de hardware.

GRPO (Group Relative Policy Optimization): DeepSeek eliminó el modelo crítico. En su lugar, el modelo genera un grupo de respuestas para la misma entrada y GRPO estima la línea base comparándolas entre sí (la media del grupo). Esto reduce muchísimo la memoria necesaria durante el entrenamiento por refuerzo y permitió a DeepSeek escalar el razonamiento con su infraestructura limitada.


5. Economía disruptiva: la guerra de precios

La eficiencia técnica no es solo un logro académico: se traduce en una ventaja de precio que ha roto el mercado. Para las agencias de IA, el coste de la API es un factor decisivo en el margen de los servicios que construimos.

5.1. Comparativa de precios actualizada (finales de 2025)

La diferencia de precio entre DeepSeek y sus competidores occidentales es tan grande que ha obligado a repensar la viabilidad de muchos modelos de negocio SaaS.

Proveedor / modeloEntrada (1M tokens)Salida (1M tokens)Acierto de cachéAhorro frente a GPT-4o
OpenAI GPT-4o2,50 $10,00 $1,25 $-
OpenAI o115,00 $60,00 $7,50 $-
Claude 3.5 Sonnet3,00 $15,00 $0,30 $-
DeepSeek-V30,14 $0,28 $0,014 $94-97%
DeepSeek-R10,55 $2,19 $0,14 $96% (frente a o1)

Tarifas publicadas a finales de 2025.

La conclusión es clara: usar DeepSeek-V3 sale casi 30 veces más barato que usar GPT-4o para tareas similares. Aplicaciones que antes eran inviables por coste (analizar repositorios de código completos o procesar bibliotecas jurídicas enteras en cada consulta) ahora son baratísimas.

5.2. Caché de contexto en disco: la “memoria infinita”

Una función que cambia las reglas para desarrolladores es la caché de contexto en disco (context caching on disk), activada por defecto.

  • Mecanismo: el sistema guarda automáticamente en una caché distribuida en disco los prefijos de prompt que se repiten (el manual de empleado de una empresa, una base de código, una constitución…).
  • Economía: cuando una petición nueva “acierta” en esa caché, el precio baja de 0,14 $ a 0,014 $ por millón de tokens. Es prácticamente gratis.
  • Aplicación: ideal para agentes que mantienen conversaciones largas o asistentes de programación que necesitan “leer” todo el proyecto en cada interacción. A diferencia de Anthropic, que cobra por escribir en caché y le da una vida útil (TTL) corta, DeepSeek lo gestiona de forma transparente y persistente.

5.3. Impacto en el ecosistema

La agresividad de precios de DeepSeek ha desatado una carrera a la baja. En China, competidores como Alibaba (Qwen) y ByteDance respondieron con recortes drásticos. En Occidente, OpenAI y Google mantienen sus márgenes gracias a sus ecosistemas cerrados (integración con Office, Workspace), pero la presión es innegable. Una startup tras otra migra su backend a DeepSeek o a modelos Llama alojados en local para sobrevivir, y eso erosiona la cuota de mercado de las API premium.


6. Rendimiento y benchmarks: calidad vs. coste

El escepticismo inicial decía que un modelo tan barato tenía que ser peor. Los benchmarks y la experiencia de finales de 2025 cuentan otra historia, sobre todo en programación y matemáticas.

6.1. Programación y desarrollo de software

En código, DeepSeek se ha posicionado como una alternativa pragmática a Claude 3.5 Sonnet.

  • Estilo: en los foros especializados los desarrolladores cuentan que DeepSeek tiende a generar código más simple, directo y funcional. Claude suele optar por soluciones orientadas a objetos, robustas y a veces sobrediseñadas (clases gestoras, manejo exhaustivo de errores); DeepSeek entrega scripts concisos que funcionan a la primera.
  • Preferencia: para refactorizaciones masivas o scripts rápidos, DeepSeek gana por velocidad y coste. Para arquitecturas complejas desde cero, Claude mantiene una ligera ventaja en la estructura lógica a largo plazo.
  • DeepSeek-Coder-V2: este modelo específico admite 338 lenguajes de programación y una ventana de contexto de 128.000 tokens. En su lanzamiento superó a GPT-4 Turbo en benchmarks de código y matemáticas.

6.2. Razonamiento matemático y lógico

Aquí es donde DeepSeek ha conseguido sus victorias más sonadas.

  • Dominio en matemáticas: DeepSeekMath-V2 logró 118 puntos sobre 120 en la competición Putnam, un examen universitario de dificultad legendaria, muy por encima de la media humana y de la mayoría de modelos rivales.
  • DeepSeek-V3.2-Speciale: en las pruebas de diciembre de 2025 alcanzó nivel de medalla de oro en las olimpiadas internacionales de matemáticas (IMO) e informática (IOI), a la altura de Gemini 3 Pro en resolución de problemas abstractos.
  • Comparativa: en benchmarks como AIME y MATH, DeepSeek-R1 y sus variantes superan a menudo a GPT-4o y se sitúan codo con codo con la serie o1.

6.3. Alucinaciones y fiabilidad

Un punto crítico es la tasa de alucinación, es decir, cuánto se inventa el modelo.

  • Evolución: las primeras versiones de R1 alucinaban más (en torno al 14% en algunas pruebas de resumen) que V3 (3,9%). La explicación es que el modelo, en su afán por “razonar”, a veces sobreinterpretaba el texto de origen.
  • Mejora: con V3.2 y los ajustes en R1, las tasas han bajado hasta situarse en niveles competitivos (0,8 en índices de alucinación, donde menos es mejor), comparables a Gemini 2.5 Flash y mejores que las versiones anteriores.

7. El elefante en la habitación: geopolítica, censura y seguridad

Como profesionales del sector no podemos ignorar el contexto. DeepSeek es una empresa china, sujeta a las leyes de la República Popular China. Eso añade capas de complejidad ética y operativa que cualquier agencia debe evaluar.

7.1. Soberanía de datos y privacidad

La política de privacidad de DeepSeek dice de forma explícita que los datos se almacenan en servidores dentro de China.

  • Riesgo corporativo: con la Ley de Ciberseguridad china, el gobierno tiene potestad para acceder a datos de empresas tecnológicas por motivos de seguridad nacional. Para empresas occidentales que manejan propiedad intelectual sensible, datos financieros o información de salud, usar la API pública de DeepSeek (api.deepseek.com) supone un riesgo de cumplimiento inaceptable.
  • La solución “open weights”: la gran ventaja estratégica de DeepSeek es que, a diferencia de OpenAI, libera los pesos de sus modelos. Cualquier empresa puede descargar V3 o R1 y ejecutarlos en su propia infraestructura (AWS, Azure o servidores locales con NVIDIA H100). Así desaparece por completo el riesgo de privacidad, porque ningún dato sale del perímetro de la empresa. Esta posibilidad de autoalojamiento es su argumento de venta más fuerte para el sector corporativo.

7.2. Censura y el informe “R1dacted”

Un estudio de investigadores de la Universidad Northeastern y otros grupos, titulado “R1dacted”, analizó a fondo la censura de DeepSeek.

  • Censura “de fábrica”: en otros modelos los filtros de seguridad son una capa superficial añadida al final. En DeepSeek R1, la censura de los temas sensibles para el gobierno chino (las protestas de Tiananmen de 1989, el estatus político de Taiwán o las críticas al liderazgo del PCCh) parece más arraigada en el propio proceso de alineación.
  • Comportamiento: el modelo a menudo se niega a responder sobre estos temas o da respuestas alineadas con la narrativa oficial del Estado chino.
  • Implicaciones: para tareas técnicas (código, matemáticas, ciencia) este sesgo es irrelevante. Para agencias que trabajen en análisis político, redacción histórica o periodismo, el modelo no es una fuente neutral y tiene “puntos ciegos” deliberados.

7.3. La controversia de la “destilación”

Hubo acusaciones y rumores de que DeepSeek había conseguido su rendimiento “copiando” o destilando datos de los modelos de OpenAI. DeepSeek cuenta otra cosa en sus publicaciones técnicas: usó su propio modelo potente (R1) para generar datos sintéticos de alta calidad y con ellos mejoró modelos más pequeños (eso es la destilación), e incluso liberó modelos destilados basados en Llama y Qwen para la comunidad. Su licencia es permisiva en este punto: permite de forma explícita usar sus salidas para entrenar otros modelos, lo que fomenta un ecosistema abierto que contrasta con los términos restrictivos de OpenAI.


8. Guía práctica para agencias y desarrolladores

¿Cómo aprovechamos todo esto en el día a día? Aquí va una guía operativa basada en el estado actual de la tecnología.

8.1. Estrategias de implementación

  • Migración de API: la API de DeepSeek es totalmente compatible con el formato de OpenAI. En la mayoría de casos basta con cambiar la BASE_URL a https://api.deepseek.com y actualizar la API_KEY. Puedes probar el modelo en una aplicación existente en cuestión de minutos.
  • Selección de modelo:
    • Usa deepseek-chat (V3/V3.2) para chatbots, resumen de textos, extracción de datos y tareas generales. Es la opción más rápida y barata.
    • Usa deepseek-reasoner (R1) para problemas lógicos complejos, análisis de causa raíz en logs de errores o generación de código de arquitectura.

8.2. Ingeniería de prompts para R1

El modelo de razonamiento R1 pide un enfoque de prompting distinto al de GPT-4:

  • Evita el system prompt complejo: R1 funciona mejor cuando las instrucciones van en el mensaje del usuario. No intentes forzar un rol rígido en el sistema.
  • Cero ejemplos (zero-shot): a diferencia de otros modelos, que mejoran con ejemplos (few-shot), R1 a menudo empeora con ellos, porque interfieren con su propia cadena de pensamiento. Pide lo que quieres directamente.
  • Temperatura: R1 ignora el parámetro de temperatura al generar su razonamiento.

8.3. Infraestructura propia (on-premise)

Para clientes con datos sensibles recomendamos desplegar las versiones destiladas de R1 (como DeepSeek-R1-Distill-Llama-70B) con herramientas como vLLM u Ollama. Un modelo de 70.000 millones de parámetros cuantizado corre con soltura en un servidor con dos GPU NVIDIA A100, o incluso en una estación de trabajo Mac Studio con chip M4 Ultra, con un equilibrio muy bueno entre privacidad, coste y rendimiento.


9. Conclusión: el futuro es eficiente y abierto

DeepSeek no es una anomalía pasajera. Es el anuncio de una nueva etapa en la inteligencia artificial. Ha demostrado que la barrera de entrada para crear IA de frontera no es tan alta como las grandes tecnológicas estadounidenses querían hacernos creer.

La combinación de innovación arquitectónica (MLA, MoE), eficiencia de capital y pesos abiertos ha democratizado el acceso a modelos de primer nivel. Para nosotros, como agencia, significa que podemos construir productos más complejos, procesar más datos y ofrecer mejores precios a nuestros clientes sin depender de un solo proveedor en California.

Eso sí, usar DeepSeek exige cabeza. Hay que tener presentes los sesgos de censura en temas políticos y ser estrictos con la soberanía de los datos, optando por despliegues locales cuando la privacidad sea prioritaria.

2025 nos enseñó que David puede vencer a Goliat o, como mínimo, obligarle a bajar los precios. La IA de alta calidad ya no es un bien de lujo. Gracias a DeepSeek, es un servicio público (casi) gratuito.

¿Te ha resultado útil?

Lleva tu negocio al siguiente nivel con IA

Descubre cómo podemos ayudarte a implementar soluciones de inteligencia artificial en tu empresa.