CPU vs. GPU: ¿Qué procesador necesitas para IA local?
Qué cubre este artículo sobre CPU vs. GPU
- La diferencia arquitectónica entre CPU y GPU y por qué es decisiva para la IA local
- Diferencias de rendimiento concretas con números, medidas en modelos reales
- Cuándo una CPU es suficiente para IA local y cuándo necesitas una GPU imprescindiblemente
- Comparación de los tres grandes fabricantes de GPU: Nvidia, AMD e Intel
- Los errores típicos que cometen los principiantes al elegir entre CPU y GPU
Introducción: CPU vs. GPU explicado de forma clara
Cuando trabajas con IA local, te encuentras pronto con una pregunta central: ¿se ejecuta el modelo en la CPU o en la GPU? La respuesta determina si puedes trabajar fluidamente con un modelo de lenguaje local en tu ordenador o si esperas segundos, incluso minutos, para cada respuesta. La CPU es el procesador principal en cualquier ordenador, la GPU es el procesador de la tarjeta gráfica. Ambas pueden ejecutar modelos de IA, pero lo hacen de formas muy distintas y con velocidades muy diferentes.
Este artículo te explica por qué sin necesidad de haber estudiado informática. Aprenderás cómo están construidas la CPU y la GPU, por qué la GPU es mucho más rápida en los cálculos de IA, y cuándo la CPU es suficiente. Al final, sabrás qué hardware necesitas para tu aplicación y por qué.
¿Por qué necesito esta comparación?
Imagina que quieres ejecutar localmente un modelo de lenguaje con 7 mil millones de parámetros. Tienes un ordenador moderno con una buena CPU, pero sin tarjeta gráfica dedicada. Instalas Ollama, descargas el modelo y haces una pregunta. Llega la respuesta, pero tarda. Cada palabra tarda aproximadamente 30 segundos. Por una frase de 20 palabras esperas diez minutos. Es frustrante y prácticamente inutilizable.
Ahora tomas la misma CPU, añades una tarjeta gráfica promedio como una Nvidia RTX 3060 e inicias el modelo de nuevo. Esta vez cada palabra tarda aproximadamente 0,1 segundos. La frase completa se genera en dos segundos. Es un factor de 300, con la misma CPU y el mismo modelo. La única diferencia es que ahora el cálculo se ejecuta en la GPU en lugar de la CPU.
Esta comparación es importante porque te muestra dónde invertir tu dinero da mejor resultado. Si quieres usar IA local en serio, la GPU es el componente más importante. La CPU juega un papel, pero no es el cuello de botella. Quien entiende esto compra el hardware correcto y evita decisiones caras equivocadas.
CPU vs. GPU explicado brevemente
La CPU, o Central Processing Unit, es el procesador principal de tu ordenador. Típicamente tiene entre 4 y 16 núcleos, cada uno muy potente y capaz de ejecutar tareas complejas una tras otra. La CPU es una generalista. Se encarga del sistema operativo, todos los programas en ejecución, operaciones de archivos y todo lo que hace tu ordenador.
La GPU, o Graphics Processing Unit, es el procesador de la tarjeta gráfica. Tiene miles de núcleos, pero cada uno está construido de forma más simple y solo puede realizar operaciones aritméticas básicas. A cambio, la GPU puede ejecutar estas operaciones en paralelo masivo, es decir, miles de cálculos simultáneamente.
Una analogía simple: imagina que tienes que reorganizar un almacén enorme lleno de cajas. La CPU es un pequeño equipo de trabajadores muy inteligentes. Cada trabajador puede resolver tareas complejas, apilar una caja de forma óptima, planificar la mejor ruta por el almacén. Pero son pocos trabajadores y trabajan uno tras otro. La GPU es un ejército de trabajadores simples. Cada uno solo puede llevar una caja de A a B, pero son miles y todos trabajan al mismo tiempo. Para reorganizar el almacén, el ejército es mucho más rápido que el pequeño equipo.
Exactamente lo mismo ocurre con los cálculos de IA. Un modelo de lenguaje consiste en el fondo en enormes matrices, es decir, campos de números que deben multiplicarse entre sí. Son millones de operaciones aritméticas simples que se pueden ejecutar independientemente unas de otras. Para la CPU con sus pocos núcleos es una tarea lenta. Para la GPU con sus miles de núcleos es ideal, porque puede ejecutar todas las operaciones simultáneamente.
Para quién es esta comparación
Este artículo va dirigido a principiantes que quieren probar IA local y se preguntan si su hardware actual es suficiente o si necesitan una tarjeta gráfica. Si no sabes por qué un modelo es lento en CPU y rápido en GPU, estás en el lugar correcto. No necesitas conocimientos previos. Avanzamos paso a paso por los fundamentos.
Incluso si ya has hecho primeros intentos con Ollama y te sorprende que tu modelo funcione fluidamente en un ordenador pero no en otro, este artículo te ayuda. Los fundamentos aquí son la base para temas más avanzados como GPU-Offloading, RAM vs. VRAM y Ancho de banda de memoria. Si más adelante buscas asesoramiento de compra, lo encontrarás en Asesoramiento de compra.
Términos importantes sobre CPU y GPU
| Término | Significado |
|---|---|
| CPU | Central Processing Unit, procesador principal con pocos núcleos pero muy potentes |
| GPU | Graphics Processing Unit, procesador de la tarjeta gráfica con muchos núcleos simples |
| Núcleo | Una unidad de cálculo independiente dentro de un procesador |
| Thread | Una unidad de ejecución secuencial, un núcleo puede procesar múltiples threads |
| Procesamiento paralelo | Ejecución simultánea de múltiples operaciones aritméticas |
| Inferencia | La ejecución de un modelo entrenado, es decir, la generación de respuestas |
| FLOPS | Floating Point Operations Per Second, medida de potencia de cálculo |
| Tensor Core | Unidad de cálculo especial en GPUs de Nvidia, optimizada para matemática de IA |
| CUDA | Plataforma de programación de Nvidia para cálculos en GPU |
| ROCm | Plataforma de programación de AMD para cálculos en GPU |
Diferencias arquitectónicas
La diferencia más importante entre CPU y GPU está en la arquitectura, es decir, en cómo están construidos los procesadores. La CPU está diseñada para ejecutar tareas complejas rápidamente una tras otra. Tiene pocos núcleos, típicamente entre 4 y 16 en modelos de consumidor, pero cada núcleo es muy potente. Cada núcleo tiene una gran jerarquía de caché, es decir, memoria intermedia rápida, y una lógica de control compleja que asegura que las instrucciones se ejecuten eficientemente. La CPU puede manejar ramificaciones complejas, saltos en el código y diferentes tipos de datos. Es una generalista que puede con casi cualquier cosa.
La GPU está construida de forma diferente. Tiene miles de núcleos, una Nvidia RTX 4090 por ejemplo tiene más de 16.000. Cada núcleo individual es mucho más simple que un núcleo de CPU. Tiene menos caché y una lógica de control más simple. A cambio, los núcleos están especializados en ejecutar operaciones aritméticas simples en paralelo masivo. La GPU no es una generalista, es una especialista en un tipo específico de cálculo.
¿Por qué las GPUs son mejores para matemática de matrices? Los modelos de IA, especialmente los modelos de lenguaje, consisten en el fondo en matrices enormes. Durante la inferencia, las entradas se multiplican por estas matrices. Una multiplicación de matrices consiste en muchísimas operaciones aritméticas simples que son independientes unas de otras. Cada elemento de la matriz resultado es la suma de productos, y estas sumas pueden calcularse todas simultáneamente. Para la CPU con sus pocos núcleos significa que debe ejecutar estas operaciones en bloques grandes uno tras otro. Para la GPU con sus miles de núcleos significa que puede ejecutar todas las operaciones simultáneamente.
Un ejemplo concreto: una multiplicación de matrices que requiere 10.000 operaciones aritméticas independientes. Una CPU con 8 núcleos puede ejecutar 8 operaciones simultáneamente y necesita aproximadamente 1.250 iteraciones. Una GPU con 10.000 núcleos puede ejecutar todas las operaciones en una iteración. Esta es la razón por la que la GPU es tan mucho más rápida en cálculos de IA. No es magia, es paralelismo puro.
Además está el ancho de banda de memoria. La GPU está conectada directamente a VRAM, que tiene un ancho de banda mucho mayor que la RAM conectada a la CPU. Más sobre ancho de banda de memoria lo encontrarás en el artículo Ancho de banda de memoria. La combinación de muchos núcleos y alto ancho de banda de memoria hace que la GPU sea el procesador ideal para inferencia de IA.
Comparativa de rendimiento
Aquí encontrarás números concretos para que te hagas una idea de las diferencias. Los datos se refieren a modelos cuantizados, como los que típicamente se cargan con Ollama, medidos en tokens por segundo. Un token equivale aproximadamente a una palabra o una parte de ella.
| Modelo | CPU (Ryzen 5, 6 núcleos) | GPU (RTX 3060, 12 GB) | GPU (RTX 4090, 24 GB) |
|---|---|---|---|
| Llama 3.2 1B | 15 tok/s | 120 tok/s | 400 tok/s |
| Llama 3.1 8B | 5 tok/s | 60 tok/s | 200 tok/s |
| Mistral 7B | 4 tok/s | 55 tok/s | 180 tok/s |
| Llama 3.1 13B | 2 tok/s | 35 tok/s | 120 tok/s |
| Qwen2.5 14B | 2 tok/s | 30 tok/s | 110 tok/s |
| Llama 3.3 70B | 0,3 tok/s | no cabe en VRAM | 25 tok/s |
Estas cifras son orientativas y varían según la configuración, cuantización y software utilizados. Sin embargo, dan una buena idea del orden de magnitud. La CPU logra velocidades aceptables con modelos pequeños, pero a partir de 7 mil millones de parámetros se vuelve lenta. La GPU es significativamente más rápida en todos los casos, y para modelos grandes es la única opción práctica.
¿Qué significan estos números en la práctica? Un token corresponde aproximadamente a una palabra. Con 5 tokens por segundo en la CPU, una frase de 20 palabras tarda unos 4 segundos. Es lento, pero tolerable para algunas aplicaciones. Con 60 tokens por segundo en la GPU, la misma frase se completa en 0,3 segundos. Esto se siente fluido, como trabajar con una IA en la nube.
Cuándo es suficiente la CPU
La CPU no es inútil para IA local. Existen escenarios donde es completamente adecuada y no necesitas una GPU.
Modelos pequeños. Los modelos de 1 a 3 mil millones de parámetros, como Llama 3.2 1B o Phi-3 Mini, se ejecutan en una CPU moderna con velocidad aceptable. Entre 10 y 20 tokens por segundo es suficiente para tareas simples.
Experimentación. Si solo quieres probar si la IA local te interesa, no necesitas una tarjeta gráfica. Puedes iniciar un modelo pequeño en la CPU con Ollama y ver si el concepto funciona para ti. Si es así, siempre puedes actualizar después.
Privacidad y funcionamiento sin conexión. Si la seguridad de tus datos es más importante que la velocidad y solo haces consultas ocasionales al modelo, la CPU es suficiente. El modelo se ejecuta localmente, tus datos permanecen en tu máquina y no necesitas hardware costoso. Más información en ¿Qué es la IA local?.
Presupuesto limitado. Una tarjeta gráfica útil para IA local cuesta al menos 300 euros. Si no tienes este presupuesto, la CPU es una alternativa gratuita que funciona, aunque lentamente. Puedes actualizar más tarde sin reconstruir completamente tu máquina.
Tareas en segundo plano. Si el modelo se ejecuta en background y la velocidad no es crítica, como análisis automático de textos en archivos durante la noche, la CPU es perfectamente adecuada.
Cuándo necesitas una GPU
Una GPU es necesaria si quieres usar IA local de manera productiva, es decir, cuando la velocidad y el tamaño del modelo son importantes.
Inferencia interactiva. Si trabajas interactivamente con un modelo, haciendo preguntas y esperando respuestas, necesitas una GPU. A partir de 30 tokens por segundo el modelo se siente fluido. La CPU no lo logra con la mayoría de los modelos.
Modelos más grandes. A partir de 7 mil millones de parámetros la CPU se vuelve muy lenta, y con 13 mil millones o más es prácticamente inutilizable. Si quieres usar modelos de este tamaño, necesitas una GPU. La calidad de las respuestas mejora con el tamaño del modelo, pero requieres el hardware para ejecutarlo en un tiempo razonable.
Uso en producción. Si utilizas IA local regularmente en tu flujo de trabajo, por ejemplo para resumir documentos, traducir o programar, una GPU es imprescindible. La CPU es demasiado lenta para esto y te frustrarás.
Múltiples consultas simultáneas. Si varios usuarios acceden al modelo al mismo tiempo o haces múltiples consultas en paralelo, la GPU necesita la capacidad de cómputo para manejarlo. La CPU se satura rápidamente.
Fine-tuning y entrenamiento. Si quieres ajustar un modelo a tus datos, necesitas obligatoriamente una GPU. El entrenamiento en CPU es impracticable en la realidad, tomaría días o semanas.
Comparativa de fabricantes de GPU
Si decides optar por una GPU, tienes tres fabricantes entre los que elegir: Nvidia, AMD e Intel. Se diferencian significativamente en su soporte para IA local.
Nvidia. Nvidia es el líder del mercado y la opción más sencilla para IA local. La plataforma de programación CUDA de Nvidia es el estándar de facto en el mundo de la IA. Casi todas las herramientas y frameworks, desde Ollama pasando por PyTorch hasta TensorFlow, están optimizadas para CUDA. Además, las GPUs de Nvidia tienen Tensor Cores, unidades de cálculo especiales optimizadas para matemáticas de IA que aumentan el rendimiento. Si no quieres experimentar y simplemente buscas una GPU que funcione, elige Nvidia. La desventaja es el precio: las GPUs de Nvidia son más caras que la competencia.
AMD. AMD es el segundo gran actor. Su plataforma de programación se llama ROCm y ha mejorado considerablemente en los últimos años. Muchas herramientas, incluyendo Ollama, ahora soportan GPUs de AMD. El rendimiento es bueno en tarjetas comparables, y las GPUs de AMD suelen ser más baratas que sus equivalentes de Nvidia. La desventaja es que el soporte no es tan amplio ni estable como CUDA. Algunas herramientas no funcionan o requieren configuración adicional. Si estás dispuesto a hacer ajustes ocasionales, AMD es una buena alternativa.
Intel. Intel es el tercer proveedor, pero aún está en sus primeras etapas en GPUs para IA. Su plataforma de programación se llama oneAPI y está en desarrollo activo. Las nuevas Intel Arc muestran potencial, pero el soporte en herramientas de IA sigue siendo incompleto. Por ahora, Intel no es una recomendación para principiantes en IA local. Si eres experimentador y quieres seguir los últimos desarrollos, puedes echarle un vistazo, pero Nvidia o AMD son opciones más seguras.
Ejemplo: El mismo modelo en CPU y GPU
Para que entiendas la diferencia de forma concreta, aquí tienes un ejemplo práctico. Tomamos Llama 3.1 8B, cuantizado a 4 bits, y lo ejecutamos en tres configuraciones diferentes. La tarea es la misma: el modelo debe generar un párrafo de 100 palabras.
Setup 1: Solo CPU, AMD Ryzen 5 5600, 32 GB RAM. El modelo se carga en RAM y se ejecuta completamente en la CPU. La velocidad es de aproximadamente 5 tokens por segundo. Para 100 palabras, es decir unos 130 tokens, el modelo necesita 26 segundos. Es lento, pero funciona. Aceptable para uso ocasional, frustrante para trabajo interactivo.
Setup 2: CPU más GPU, AMD Ryzen 5 5600 más Nvidia RTX 3060 con 12 GB VRAM. El modelo cabe completamente en el VRAM y se ejecuta en la GPU. La velocidad es de aproximadamente 60 tokens por segundo. Para 130 tokens el modelo necesita 2,2 segundos. Esto es fluido y se siente como trabajar con una IA en la nube.
Setup 3: GPU de gama alta, Nvidia RTX 4090 con 24 GB VRAM. El modelo se ejecuta completamente en la GPU. La velocidad es de aproximadamente 200 tokens por segundo. Para 130 tokens el modelo necesita 0,65 segundos. Prácticamente sin latencia.
La diferencia entre Setup 1 y Setup 2 es dramática. La CPU sola necesita 26 segundos, la combinación de CPU y GPU necesita 2,2 segundos. Es un factor de 12, y eso con una tarjeta gráfica que cuesta alrededor de 300 euros. El salto de Setup 2 a Setup 3 también es notable, pero aquí el precio sube de 300 a unos 2000 euros. Para la mayoría de usuarios, una RTX 3060 o una tarjeta comparable es el punto óptimo.
Errores comunes con CPU y GPU
- Confundir CPU con GPU: Una CPU potente no garantiza velocidad en inferencia de IA. Incluso un Ryzen 9 o Core i9 de gama alta es más lento que una tarjeta gráfica promedio para estas tareas. La razón está en la arquitectura, no en el rendimiento bruto del procesador.
- Subestimar los requisitos de VRAM: Una GPU rápida es inútil si el modelo no cabe en su memoria. Cuando el modelo se desborda hacia la RAM, el rendimiento cae drásticamente. Consulta RAM vs. VRAM para entender mejor esto.
- Comprar GPUs AMD sin investigar: Las GPUs AMD funcionan, pero no todas las herramientas las soportan de forma nativa. Si consideras una GPU AMD, verifica antes si tus herramientas preferidas tienen soporte para ROCm.
- Confundir GPU integrada con dedicada: Las GPUs integradas, aquellas incrustadas en el procesador, utilizan memoria compartida del sistema y no son adecuadas para IA. Necesitas una tarjeta gráfica dedicada con su propia VRAM.
- Equiparar núcleos de CPU con núcleos de GPU: 16 núcleos de CPU no equivalen a 16 núcleos de GPU. Un núcleo de CPU es mucho más potente que uno de GPU. La fortaleza de una GPU radica en la cantidad masiva de núcleos, no en su potencia individual.
- Ignorar el ancho de banda de memoria: Incluso con suficiente VRAM, un ancho de banda bajo puede ralentizar el modelo. Esto es especialmente cierto en tarjetas gráficas antiguas o con memoria compartida. Aprende más en Ancho de banda de memoria.
- Pasar por alto la cuantización: Sin cuantización, los modelos consumen mucha más memoria y son más lentos. Con cuantización de 4 bits, modelos más grandes funcionan en GPUs más pequeñas. Más detalles en Cuantización.
- Subestimar GPU-Offloading: Cuando el modelo no cabe completamente en VRAM, se usa GPU-Offloading: parte del modelo en GPU, el resto en CPU. Funciona, pero es notoriamente más lento que ejecutar el modelo completamente en GPU. Consulta GPU-Offloading.
Hardware, costos y seguridad con CPU y GPU
Hardware: Para comenzar con IA local, basta una tarjeta gráfica con 8 GB de VRAM si principalmente usas modelos de 7B. Para modelos de 13B, se recomiendan 12 GB de VRAM; para modelos más grandes, 24 GB de VRAM o Apple Silicon con suficiente Unified Memory. La CPU juega un papel secundario siempre que sea moderna y tenga al menos 6 u 8 núcleos. Lo más importante es tener suficiente RAM para cargar el modelo. Las cifras exactas están en Requisitos de RAM y VRAM.
Costos: Una CPU adecuada para IA local cuesta entre 150 y 300 euros. Una tarjeta gráfica que marque una diferencia real parte desde 300 euros por una RTX 3060 con 12 GB de VRAM, hasta 2000 euros para una RTX 4090 con 24 GB. Las alternativas AMD como la RX 7600 con 8 GB de VRAM están disponibles desde aproximadamente 250 euros. Apple Silicon es un caso especial porque no compras la memoria por separado, sino que configuras el Mac con la cantidad deseada de Unified Memory. Un Mac Studio con 64 GB de Unified Memory es caro, pero a menudo competitivo frente a configuraciones GPU de gama alta. La Guía de compra te ayuda a elegir lo más adecuado.
Seguridad: Con modelos ejecutados localmente, tus datos permanecen en tu equipo. Ninguna consulta viaja a un servidor, ningún dato abandona tu sistema. Esta es una ventaja significativa frente a la IA en la nube. Que uses CPU o GPU no afecta la seguridad, lo importante es que el modelo corra localmente sin llamar a APIs externas. Más información en ¿Qué es IA local?.
Enlaces y recursos adicionales sobre CPU y GPU
- Fundamentos de hardware de IA para profundizar en los conceptos básicos del hardware para IA local
- RAM vs. VRAM para entender la diferencia entre memoria del sistema y memoria de gráficos
- GPU-Offloading si quieres saber cómo se reparten los modelos entre CPU y GPU
- Ancho de banda de memoria para el factor de rendimiento que muchos pasan por alto
- Guía de compra si planeas adquirir una nueva tarjeta gráfica o equipo
- ¿Qué es IA local? para los fundamentos de la IA local
- Requisitos de RAM y VRAM para cifras precisas según el tamaño del modelo
- Cuantización si deseas entender cómo se reducen los modelos
- Ollama para la herramienta más popular para ejecutar modelos localmente
FAQ: CPU vs. GPU - Preguntas frecuentes
¿Puedo ejecutar IA local solo con la CPU?
Sí, es posible. Herramientas como Ollama funcionan sin tarjeta gráfica. Sin embargo, la velocidad es muy baja con modelos grandes. Para modelos pequeños de 1 a 3 mil millones de parámetros, la CPU es funcional; con 7 mil millones o más se vuelve lento. Si solo quieres probar si la IA local te interesa, la CPU es suficiente.
¿Por qué es la GPU tan mucho más rápida que la CPU?
La GPU tiene miles de núcleos simples que pueden ejecutar operaciones en paralelo masivo. La CPU tiene pocos núcleos complejos que procesan tareas secuencialmente. La inferencia de IA consiste en muchas operaciones simples e independientes, para lo cual la GPU es ideal. Además, el VRAM tiene mayor ancho de banda.
¿Es suficiente una GPU integrada para IA local?
En la mayoría de los casos, no. Las GPUs integradas usan memoria compartida del RAM y tienen bajo ancho de banda. Para modelos pequeños podría funcionar, pero lentamente. Para IA local seria, necesitas una tarjeta gráfica dedicada con su propia VRAM o Apple Silicon con Unified Memory.
¿Necesito obligatoriamente una GPU Nvidia?
No, pero es la opción más simple. CUDA es el estándar en la industria de IA y casi todas las herramientas están optimizadas para él. Las GPUs AMD con ROCm también funcionan, pero a veces requieren más configuración. Las GPUs Intel aún están en fase temprana para soporte de IA. Si prefieres evitar complicaciones, elige Nvidia.
¿Qué son los Tensor Cores y los necesito?
Los Tensor Cores son unidades de cálculo especializadas en GPUs Nvidia optimizadas para matemática de IA. Pueden ejecutar ciertas operaciones matriciales significativamente más rápido que los núcleos GPU convencionales. Para IA local son útiles, pero no indispensables. Todas las GPUs Nvidia modernas desde la serie RTX 20 los incluyen.
¿Puedo usar CPU y GPU simultáneamente para un modelo?
Sí, eso se llama GPU-Offloading. Cuando el modelo no cabe completamente en VRAM, parte se ejecuta en GPU y el resto en CPU. Funciona, pero es más lento que ejecutar el modelo íntegramente en GPU. Más detalles en GPU-Offloading.
¿Cuánto VRAM necesito para IA local?
Depende del tamaño del modelo. Un modelo cuantizado de 7B requiere aproximadamente 4 a 5 GB de VRAM, uno de 13B alrededor de 8 a 9 GB. Con 12 GB de VRAM estás seguro con modelos hasta 13B; con 24 GB puedes ejecutar modelos más grandes. Las cifras precisas las encontrarás en Requisitos de RAM y VRAM.
¿Hace una CPU cara que la IA local sea más rápida?
Solo marginalmente. Si el modelo corre en GPU, la CPU apenas importa. Una CPU muy lenta puede convertirse en cuello de botella, pero a partir de un procesador moderno de gama media con 6 u 8 núcleos, actualizar es poco perceptible. Invierte mejor en una GPU superior o más VRAM.
¿Vale la pena Apple Silicon para IA local?
Sí, Apple Silicon es excelente si quieres ejecutar modelos grandes localmente. Gracias al Unified Memory, la GPU puede acceder a toda la memoria del sistema sin limitaciones de VRAM como en tarjetas dedicadas. Un Mac con 64 o 128 GB de Unified Memory puede cargar modelos que no caben en ninguna tarjeta gráfica de consumidor. La desventaja es el precio y menor ancho de banda respecto a GPUs de gama alta.
¿Es mejor una GPU cara o dos baratas?
Generalmente, una cara es mejor. Configuraciones multi-GPU funcionan, pero son más complejas, consumen más energía y no todas las herramientas escalan linealmente entre múltiples GPUs. Si comparas una RTX 4090 con 24 GB de VRAM contra dos RTX 3060 con 12 GB cada una, la única 4090 suele ser más rápida y fácil de manejar.
¿Puedo entrenar en CPU en lugar de solo hacer inferencia?
Teóricamente sí, prácticamente no. El entrenamiento es más exigente que la inferencia y toma múltiples veces más en CPU. Un entrenamiento que dura una hora en GPU podría tomar días o semanas en CPU. Para entrenamiento serio necesitas GPU, preferiblemente con mucho VRAM y Tensor Cores.
Fuentes y lecturas complementarias
- Documentación de Nvidia CUDA y Tensor Core
- Descripción general de la plataforma AMD ROCm
- Documentación de Intel oneAPI y Arc GPU
- Documentación de Ollama sobre compatibilidad con CPU y GPU
- Experiencias y benchmarks de la comunidad de IA local
- Fundamentos de hardware de IA para artículos complementarios


