Skip to content
BotServBotServ
DeepSeekDeepSeek-R1DeepSeek-CoderReasoningOllamaIA local

Modelos DeepSeek: Reasoning y Coding

DeepSeek-V3, DeepSeek-R1, DeepSeek-Coder. Reasoning, coding y matemáticas. Requisitos de hardware y uso local.

S

schutzgeist

13 min read
Modelos DeepSeek: Reasoning y Coding

Modelos DeepSeek: Reasoning y programación desde China

Qué cubre este artículo

  • Qué es DeepSeek y qué modelos integran la familia
  • Cómo DeepSeek-R1 lleva el reasoning a un nivel completamente nuevo
  • Qué versiones destiladas funcionan bien en ejecución local
  • Cuánta VRAM necesitas para los distintos modelos DeepSeek
  • Dónde residen las fortalezas y debilidades de esta familia de modelos

Introducción

DeepSeek es una empresa de IA china que ha lanzado algunos de los modelos Open Source más notables en poco tiempo. La familia de modelos comprende tres líneas principales: DeepSeek-V3 como generalista, DeepSeek-R1 como especialista en reasoning y DeepSeek-Coder para tareas de programación. Lo que hace especiales estos modelos es su arquitectura como modelos Mixture-of-Experts (MoE), que combina enormes cantidades totales de parámetros con ejecución eficiente.

Para la ejecución local, son especialmente interesantes las versiones destiladas de DeepSeek-R1. Se basan en modelos base más pequeños como Qwen o Llama, pero fueron entrenados con las capacidades de reasoning de DeepSeek-R1. De esta manera obtienes calidad en reasoning en tamaños que funcionan en hardware consumer. En este artículo aprenderás qué modelos DeepSeek existen, cuál se ajusta a tu caso de uso y cómo iniciarlos localmente con Ollama.

Si aún eres nuevo en el tema, primero echa un vistazo a la descripción general de modelos y al artículo Encontrar un modelo.

¿Por qué necesito DeepSeek?

Imagina que necesitas resolver un problema matemático complejo o encontrar un bug difícil en el código. Los modelos de chat normales suelen darte una respuesta rápida, pero en tareas complejas puede ser incorrecta o incompleta. DeepSeek-R1 funciona diferente: piensa en voz alta, desglosa el problema en pasos intermedios y verifica su propia solución antes de responder. Esto se llama reasoning o chain-of-thought.

Si ya has utilizado modelos Llama o modelos Qwen para tareas de programación y has notado que encuentran límites en lógica compleja, entonces DeepSeek es exactamente el siguiente nivel. DeepSeek-Coder fue entrenado específicamente para tareas de programación y ofrece en muchos benchmarks de coding resultados que están a la altura de modelos comerciales.

Para la ejecución local, los modelos R1 destilados son particularmente atractivos. Un DeepSeek-R1 7B Distill en tu tarjeta gráfica puede resolver tareas para las que de otro modo necesitarías un modelo de 70B. Esto te ahorra costos de hardware y aún así proporciona mejores resultados en tareas lógicas.

Los modelos DeepSeek explicados brevemente

DeepSeek ha lanzado varias líneas de modelos que difieren en arquitectura y propósito. Aquí hay una visión general:

DeepSeek-V3 es el modelo insignia con 671 mil millones de parámetros. Utiliza una arquitectura Mixture-of-Experts donde solo 37 mil millones de parámetros están activos por token. Esto lo hace más eficiente que un modelo Dense comparable del mismo tamaño. DeepSeek-V3 es un generalista que muestra un rendimiento sólido en texto, código y matemáticas.

DeepSeek-R1 es el modelo de reasoning. Fue entrenado con Reinforcement Learning para resolver problemas complejos paso a paso. El modelo genera un proceso de pensamiento detallado antes de entregar la respuesta final. R1 se basa en DeepSeek-V3 y logra en benchmarks de matemáticas y coding resultados al nivel de OpenAI o1.

DeepSeek-R1 Distill son versiones comprimidas donde las capacidades de reasoning de R1 se han transferido a modelos base más pequeños. Existen en tamaños de 1,5B a 70B, basados en arquitecturas Qwen y Llama. Son los modelos más importantes para la ejecución local.

DeepSeek-Coder es una línea de modelos anterior entrenada específicamente para tareas de programación. Existen en tamaños de 1,3B a 33B. Para nuevos proyectos, los R1-Distills suelen ser la mejor opción, pero DeepSeek-Coder sigue siendo relevante para tareas de programación pura.

¿Para quién es este artículo?

Este artículo es para ti si:

  • buscas un modelo local para tareas matemáticas o lógicas
  • programas y quieres ejecutar un modelo de coding sólido localmente
  • te interesa aprender sobre modelos de reasoning y experimentar con chain-of-thought
  • quieres saber qué variante de DeepSeek funciona en tu hardware
  • ya tienes experiencia con Ollama y quieres explorar el siguiente nivel

No necesitas conocimientos previos profundos. Si sabes qué es un LLM y cómo usar Ollama, eso es completamente suficiente.

Términos importantes

TérminoSignificado
MoEMixture-of-Experts, arquitectura donde solo una parte de los parámetros está activa por token
ReasoningCapacidad de un modelo para resolver problemas en pasos intermedios
Chain-of-ThoughtProceso de pensamiento paso a paso que el modelo genera antes de responder
DistillTransferencia de capacidades de un modelo grande a uno más pequeño
Reinforcement LearningMétodo de entrenamiento donde el modelo aprende mediante recompensas
Active ParametersParámetros que se calculan realmente por token en un modelo MoE
Dense ModelModelo sin MoE donde todos los parámetros están activos en cada token
BenchmarkPrueba estandarizada para comparar capacidades de modelos
TokenUn fragmento de texto que el modelo procesa, aproximadamente una palabra o parte de una palabra
InferenceEjecución de un modelo para generar texto

DeepSeek-V3: El buque insignia MoE

DeepSeek-V3 es con 671 mil millones de parámetros uno de los modelos Open Source más grandes que existen. La particularidad es la arquitectura MoE: el modelo consiste en muchos expertos, pero por cada token solo se activan 37 mil millones de parámetros. Esto significa que la potencia computacional por token equivale a la de un modelo Dense de 37B, pero el modelo posee el conocimiento de un modelo de 671B.

Para la ejecución local en hardware consumer, DeepSeek-V3 no es apropiado. Incluso con cuantización fuerte, requiere más de 350 GB de almacenamiento. Esto solo es posible en hardware de servidor o en Macs Apple Silicon con 128 GB o más de Unified Memory. Para la mayoría de usuarios, DeepSeek-V3 es más bien un modelo que se usa a través de API, no localmente.

Aún así, DeepSeek-V3 es importante de entender porque DeepSeek-R1 se basa en él. Las capacidades de reasoning de R1 fueron entrenadas mediante Reinforcement Learning en la arquitectura de V3.

DeepSeek-R1: Reasoning de la próxima generación

DeepSeek-R1 es el modelo que llamó la atención del mundo de la IA. Resuelve problemas complejos no con una respuesta rápida, sino con un proceso de pensamiento detallado. El modelo escribe sus pensamientos, verifica resultados intermedios, se autocorrige y solo entonces llega a la respuesta final.

Un ejemplo: cuando le preguntas a R1 cuántas R hay en “Fresa”, no simplemente devuelve un número. Cuenta letra por letra, verifica el resultado y justifica su respuesta. Puede parecer complicado, pero es exactamente la razón por la que R1 es tan fuerte en matemáticas, lógica y programación.

DeepSeek-R1 logra en benchmarks como MMLU, HumanEval y tareas matemáticas resultados que compiten con modelos comerciales como OpenAI o1. Lo especial: el modelo es Open Source y puede usarse libremente.

El modelo R1 completo tiene como V3 671 mil millones de parámetros y es demasiado grande para la ejecución local en hardware consumer. Pero aquí es donde entran en juego las versiones destiladas.

DeepSeek-R1 Distill: Razonamiento para hardware de usuario

Las versiones destiladas son la parte más importante de la familia DeepSeek para usuarios locales. Durante la destilación, las capacidades de razonamiento de R1 se transferirieron a modelos más pequeños ya existentes. El resultado son modelos compactos con una calidad de razonamiento sorprendentemente buena.

Existen las siguientes versiones Distill:

ModeloBaseParámetrosVRAM (Q4_K_M)Adecuado para
DeepSeek-R1 1.5BQwen 2.51,5Baprox. 1,5 GBExperimentos, tareas muy simples
DeepSeek-R1 7BQwen 2.57Baprox. 5 GBPrincipiantes, tareas de razonamiento simples
DeepSeek-R1 8BLlama 3.18Baprox. 5,5 GBPrincipiantes, buena calidad general
DeepSeek-R1 14BQwen 2.514Baprox. 9 GBNivel medio, razonamiento sólido
DeepSeek-R1 32BQwen 2.532Baprox. 20 GBUsuarios avanzados, razonamiento potente
DeepSeek-R1 70BLlama 3.370Baprox. 40 GBGama alta, calidad cercana a R1

Las versiones 7B y 8B funcionan en tarjetas gráficas con 8 GB de VRAM y son el mejor punto de entrada. La versión 14B es un buen equilibrio entre rendimiento y requisitos de hardware. La versión 32B requiere una RTX 4090 o una Mac con 32 GB de memoria unificada. La versión 70B ya alcanza una calidad sorprendentemente cercana al R1 completo, aunque requiere hardware correspondiente.

Encontrarás más información sobre requisitos de memoria en el artículo Requisitos de RAM y VRAM y en Tamaño del modelo y necesidades de almacenamiento.

DeepSeek-Coder: Programación local

DeepSeek-Coder es una línea de modelos independiente entrenada específicamente para tareas de programación. Los modelos vienen en tamaños de 1,3B a 33B y soportan numerosos lenguajes de programación.

Para operación local, las versiones 6,7B y 33B son especialmente interesantes. La versión 6,7B funciona en una tarjeta gráfica de 8 GB y es un modelo de codificación sólido para tareas cotidianas. La versión 33B requiere aproximadamente 20 GB de VRAM en Q4_K_M y proporciona resultados significativamente mejores en tareas de programación complejas.

Sin embargo, si ya utilizas los R1 Distills, estos cubren muchas tareas de codificación. DeepSeek-Coder sigue siendo relevante si prefieres un modelo de codificación puro sin el largo resultado de razonamiento de R1. R1 reflexiona mucho, lo cual puede ser innecesario para preguntas rápidas de código. DeepSeek-Coder proporciona respuestas más directas.

Ejecutar DeepSeek localmente con Ollama

La forma más sencilla de ejecutar modelos DeepSeek localmente es a través de Ollama. Estos son los comandos más importantes:

# Iniciar DeepSeek-R1 7B Distill
ollama run deepseek-r1:7b

# Iniciar DeepSeek-R1 8B Distill (base Llama)
ollama run deepseek-r1:8b

# Iniciar DeepSeek-R1 14B Distill
ollama run deepseek-r1:14b

# Iniciar DeepSeek-R1 32B Distill
ollama run deepseek-r1:32b

# Iniciar DeepSeek-Coder 6.7B
ollama run deepseek-coder:6.7b

Ollama descarga automáticamente la variante Q4_K_M, que para la mayoría de usuarios es el mejor equilibrio entre calidad y necesidades de almacenamiento. Encontrarás más sobre cuantización en el artículo Cuantización.

Una particularidad de los modelos R1: la salida contiene un bloque de pensamiento que comienza con <think> y termina con </think>. En él, el modelo escribe su proceso de razonamiento. Después viene la respuesta real. En Ollama ves ambas partes en la terminal. Algunas interfaces como Open WebUI muestran el bloque de pensamiento de forma separada.

Obstáculos típicos

1. Confundir la salida de pensamiento con la respuesta: DeepSeek-R1 produce un largo proceso de razonamiento antes de la respuesta. Si tomas el bloque de pensamiento por la respuesta, parecerá que estás confundido. La respuesta real viene después de la etiqueta de cierre del bloque de pensamiento.

2. Elegir un modelo demasiado grande para tu hardware: El DeepSeek-R1 completo con 671B no funciona en hardware de usuario. En su lugar, elige una versión Distill que se ajuste a tu VRAM. Una RTX 3060 con 12 GB maneja sin problemas la versión 7B.

3. Usar razonamiento para tareas simples: R1 reflexiona sobre cada pregunta, incluso las simples. Si solo quieres resumir un texto corto, un modelo estándar como Llama 3 es más rápido y eficiente. Usa R1 para tareas complejas, no para todo.

4. Confundir DeepSeek-Coder con R1: DeepSeek-Coder es una línea de modelos independiente y más antigua. Los R1 Distills son más nuevos y mejores en la mayoría de tareas. Verifica cuál es el modelo que realmente necesitas.

5. Subestimar la longitud de contexto durante el razonamiento: El proceso de pensamiento de R1 puede volverse muy largo y consumir mucho contexto. Planifica suficiente VRAM para el caché KV, especialmente en tareas complejas. Más información en el artículo Longitud de contexto.

6. Respuestas en alemán más débiles que en inglés: Los modelos DeepSeek fueron entrenados principalmente en inglés y chino. Las respuestas en alemán son buenas, pero no tan sólidas como en modelos como Qwen, que están optimizados para multilingüismo. Para aplicaciones únicamente en alemán, prueba Qwen como alternativa.

7. Malinterpretar la arquitectura MoE: En DeepSeek-V3 y R1 hay 671B parámetros, pero solo 37B activos por token. Esto no significa que el modelo sea tan rápido como uno dense de 37B. Todos los parámetros deben estar en memoria, incluidos los inactivos.

Hardware, costos y seguridad

Hardware: Los modelos R1 destilados son sorprendentemente eficientes. La versión 7B funciona en una tarjeta gráfica con 8 GB de VRAM, la versión 14B requiere aproximadamente 12 GB. Para la versión 32B se recomienda una RTX 4090 con 24 GB o una Mac con 32 GB de memoria unificada. La versión 70B requiere 48 GB o más. El R1 completo con 671B solo funciona en hardware de servidor o Macs con 128 GB de memoria unificada.

Costos: Todos los modelos DeepSeek son código abierto y gratuitos. El uso de la API del modelo completo es relativamente económico. Para operación local solo incurren costos de hardware. Una RTX 3060 con 12 GB por menos de 300 EUR es suficiente para los Distills 7B y 14B.

Seguridad: Como con todos los modelos locales, tus datos permanecen en tu equipo. Esto es especialmente relevante para DeepSeek, porque muchos usuarios tienen preocupaciones sobre modelos chinos. Cuando se ejecutan localmente, no se envían datos a DeepSeek. Aún así, verifica si tu software (Ollama, LM Studio) tiene funciones de telemetría y desactívalas si es necesario.

Enlaces útiles

Preguntas frecuentes

¿Cuál es la diferencia entre DeepSeek-R1 y DeepSeek-V3?

DeepSeek-V3 es el modelo base, un generalista con 671B parámetros. DeepSeek-R1 se construye sobre V3, pero fue entrenado con Reinforcement Learning para razonamiento. R1 piensa paso a paso, V3 responde directamente.

¿Puedo ejecutar DeepSeek-R1 localmente en mi PC?

El R1 completo con 671B parámetros es demasiado grande para hardware de consumo. Las versiones destiladas de 1,5B a 70B están diseñadas para ejecución local y funcionan con Ollama en tarjetas gráficas convencionales.

¿Qué versión de R1-Distill debo elegir?

Con 8 GB VRAM usa la versión 7B. Con 12 GB VRAM usa la versión 14B. Con 24 GB VRAM usa la versión 32B. La versión 32B ofrece el mejor equilibrio entre calidad de razonamiento y requisitos de hardware.

¿Qué significa el bloque de pensamiento en R1?

R1 produce un proceso de razonamiento antes de la respuesta real, encerrado entre etiquetas especiales. En él, el modelo descompone el problema en pasos intermedios, verifica suposiciones y se auto-corrige. La respuesta final viene después.

¿Es DeepSeek-Coder mejor que DeepSeek-R1 para programación?

Para preguntas de código rápidas, DeepSeek-Coder es más directo porque no genera un largo proceso de pensamiento. Para tareas de programación complejas con lógica, R1 suele ser superior. Si necesitas respuestas rápidas, usa Coder; para problemas difíciles, R1.

¿Se pueden usar los modelos DeepSeek de forma gratuita?

Sí, todos los modelos DeepSeek son Open Source y gratuitos. Los pesos del modelo están disponibles en Hugging Face. Para uso comercial, verifica la licencia correspondiente, la mayoría lo permiten.

¿Qué tal funcionan los modelos DeepSeek en alemán?

Los modelos DeepSeek fueron entrenados principalmente en inglés y chino. El alemán funciona, pero no es tan fuerte como en modelos como Qwen, que fueron optimizados específicamente para multilingüismo. Para aplicaciones puramente en alemán, prueba Qwen como alternativa.

¿Qué significa Mixture-of-Experts en DeepSeek?

MoE significa que el modelo está compuesto por muchos submodelos (expertos), pero solo activa los más relevantes para cada token. DeepSeek-V3 tiene 671B parámetros en total, pero solo 37B están activos por token. Esto ahorra poder de cálculo, pero todos los parámetros deben estar en memoria.

¿Puedo usar DeepSeek-R1 con LM Studio?

Sí, LM Studio es compatible con modelos DeepSeek. Buscas en LM Studio “deepseek-r1” y seleccionas la versión Distill apropiada en la cuantización que desees. LM Studio descarga el archivo GGUF automáticamente.

¿Necesito una GPU Nvidia para DeepSeek?

No. Los modelos DeepSeek funcionan en CPU, Apple Silicon y GPUs AMD. Ollama es compatible con todas estas plataformas. Una GPU Nvidia es la más rápida, pero para las versiones pequeñas destiladas también basta un Mac con 16 GB de Unified Memory.

¿En qué se diferencian los R1-Distills de los modelos base?

Los Distills se basan en modelos como Qwen 2.5 o Llama 3.1, pero fueron reentrenados con las capacidades de razonamiento de R1. Se comportan como R1 con bloque de pensamiento, pero mantienen la arquitectura y el tamaño del modelo base más pequeño.

Referencias

  • Sitio web oficial de DeepSeek y publicaciones de modelos
  • DeepSeek-R1 Technical Report en arXiv
  • DeepSeek-V3 Technical Report en arXiv
  • Librería de modelos de Ollama: Modelos DeepSeek
  • Hugging Face: Tarjetas de modelo DeepSeek y pesos
  • Repositorio GitHub de DeepSeek-Coder
Volver al blog
Share:

Entradas relacionadas