Guía de hardware Ollama: VRAM, cuantización y tablas comparativas de GPU (2026)

Quieres ejecutar un modelo 7B en local y no sabes cuánta VRAM debe tener tu GPU. ¿Y con 13B? En internet dicen que 8 GB bastan, otros que hacen falta 16 GB como mínimo. ¿A quién hacer caso?
Este problema me persiguió varios meses. Cuando empecé con Ollama el año pasado, compré una RTX 3060 12 GB pensando: «12 GB deberían alcanzar». Al ejecutar un 13B, me quedé sin VRAM y la velocidad cayó a 3 tokens/s, como navegar con una conexión lentísima.
Luego entendí algo clave: el límite de VRAM es una frontera real. Si la cruzas, el rendimiento se desploma; si no la cruzas, todo va bien.
En este artículo reuní en tablas las GPUs más usadas, los tamaños de modelo y los niveles de cuantización. Al terminar de leer sabrás qué modelos puede ejecutar tu tarjeta y qué GPU encaja mejor con tu presupuesto.
1. Tabla principal: requisitos de VRAM de un vistazo
Primero, la fórmula. La VRAM necesaria es aproximadamente:
VRAM ≈ parámetros (B) × bits de cuantización ÷ 8 + KV Cache (1-2 GB)
Parece simple, pero define el tamaño máximo del modelo. Ejemplo: un 7B con cuantización Q4 (4 bits) ≈ 7 × 4 ÷ 8 = 3,5 GB; con KV Cache y overhead real, necesitas 4-6 GB.
Esta es la tabla completa. Conviene guardarla:
| Tamaño del modelo | Q4_K_M | Q5_K_M | Q8_0 | FP16 | GPU recomendada |
|---|---|---|---|---|---|
| 7B | 4-6 GB | 5-6 GB | 7-8 GB | 14 GB | RTX 3060 12 GB |
| 13B | 8-10 GB | 10-12 GB | 13-14 GB | 26 GB | RTX 4060 Ti 16 GB |
| 32B | 20-24 GB | 24-28 GB | 32-36 GB | 64 GB | RTX 4090 24 GB |
| 70B | 40-48 GB | 48-56 GB | 70-80 GB | 140 GB | Dos RTX 3090 / Mac M4 Max 128 GB |
Un punto crítico: si te quedas corto de VRAM, el rendimiento puede caer entre 5 y 20 veces.
Lo probé con una RTX 3060 12 GB ejecutando 13B Q4_K_M. La VRAM quedaba justo en el límite: a veces funcionaba, a veces se quedaba sin memoria. Cuando pasa, Ollama mueve parte de los datos a la RAM del sistema y la velocidad pasa de 45 tokens/s a 2-3 tokens/s. El cambio de fluidez es inmediato.
Al comprar GPU, mejor tener 2 GB de margen que quedarte justo en el borde.
2. Cuantización: Q4 vs Q5 vs Q8 en la práctica
La cuantización es la palanca principal para reducir VRAM.
FP16 es la precisión original: cada parámetro ocupa 16 bits. Q4 lo comprime a 4 bits y la VRAM se reduce a la mitad. La pregunta es: ¿se nota en la calidad?
Sí, pero menos de lo que imaginas.
Datos de pruebas reales:
| Nivel de cuantización | VRAM modelo 7B | Pérdida de calidad | Escenario recomendado |
|---|---|---|---|
| Q4_K_M | 4,5 GB | 1-3 % | Uso diario (recomendado) |
| Q5_K_M | 5,7 GB | <1 % | Si buscas más precisión |
| Q8_0 | 7,7 GB | <0,5 % | Máxima calidad |
| FP16 | 14 GB | 0 % | Investigación / referencia |
Q4_K_M es la opción por defecto. Pierde solo un 1-3 % y en la mayoría de casos no se nota. Con Llama 3.1 8B en Q4_K_M escribí varios artículos técnicos; frente a FP16, la diferencia es difícil de ver.
Q5_K_M encaja si tienes 16 GB o más de VRAM. Con una RTX 4060 Ti 16 GB obtienes mejor calidad de inferencia, sobre todo en razonamiento matemático y textos largos.
Q8_0 se acerca a la calidad original. Salvo evaluación o investigación, Q8 no compensa: el doble de VRAM por una ganancia pequeña.
Evita Q3 y Q2: la pérdida es evidente y el modelo empieza a divagar. Solo si la VRAM es muy escasa (por ejemplo 4 GB); si no, no los uses.
Mi recomendación: empieza con Q4_K_M y pasa a Q5 solo si la calidad no te convence. En la mayoría de casos, Q4 basta.
3. Tres tecnologías de aceleración: CUDA vs Metal vs ROCm
Elegir GPU no es solo VRAM: también importa la tecnología de aceleración.
Ollama soporta cuatro backends GPU: NVIDIA CUDA, Apple Metal, AMD ROCm y Vulkan. Cada uno tiene pros y contras; la plataforma equivocada puede costarte la mitad del rendimiento.
Tabla comparativa:
| Tecnología | Hardware | Rendimiento 7B | Sistemas | Madurez |
|---|---|---|---|---|
| CUDA | GPU NVIDIA | 30-80 tok/s | Win/Linux | ★★★★★ |
| Metal | Apple M1-M4 | 20-50 tok/s | macOS | ★★★★★ |
| ROCm | AMD RX 7000 | 25-60 tok/s | Sobre todo Linux | ★★★☆☆ |
| Vulkan | AMD/Intel | 15-40 tok/s | Multiplataforma | ★★★☆☆ |
CUDA: la opción más estable
NVIDIA CUDA es hoy la opción más madura. Drivers estables, comunidad amplia, documentación completa. Instalas Ollama y CUDA se detecta solo, sin configuración extra.
Mi RTX 3060 con CUDA ejecuta Llama 3.1 8B Q4 a unos 45 tokens/s de media. Inferencia fluida y respuesta rápida.
El único pero: el precio. Las NVIDIA tienen mucho sobreprecio; una RTX 4090 ronda los $1800.
Metal: la opción para usuarios Mac
Apple Metal rinde muy bien en Mac. M1/M2/M3/M4 están soportados y la memoria unificada permite modelos más grandes al compartir VRAM y RAM.
La aceleración Apple Metal es la ventaja clave en Mac. En Apple Silicon, Ollama usa Metal automáticamente; con suficiente memoria unificada, la configuración es simple.
No uses OLLAMA_ORIGINS como interruptor de rendimiento. Configura orígenes permitidos/CORS y no activa MLX:
# Ollama usa Metal automáticamente en Apple Silicon
# OLLAMA_ORIGINS solo permite orígenes de navegador adicionales para la API de Ollama
ollama serve
Requisito: al menos 32 GB de memoria unificada. Con menos de 16 GB, los modelos grandes sufren.
ROCm: el camino difícil de AMD
AMD ROCm en Linux funciona razonablemente; en Windows es más complicado. Soporte oficial en Linux; en Windows sigue en fase experimental, con bugs y compatibilidad irregular.
Si tienes AMD en Windows, mejor Vulkan:
OLLAMA_VULKAN=1 ollama serve
Vulkan es multiplataforma. Un poco más lento que CUDA, pero estable.
Mi consejo: si no quieres complicarte, NVIDIA CUDA. En Mac, Metal automático. En AMD: Linux + ROCm o Windows + Vulkan.
4. Recomendaciones de GPU: de entrada a gama alta
Tabla por presupuesto.
Nivel de entrada (presupuesto $200-400)
| Modelo | VRAM | Modelos adecuados | Rendimiento | Precio |
|---|---|---|---|---|
| RTX 3060 12 GB | 12 GB | 7B Q4, 13B Q4 | 40-60 tok/s | $250 |
| RX 6600 8 GB | 8 GB | 7B Q4 | 30-45 tok/s | $200 |
La RTX 3060 12 GB es la mejor para empezar. Con 12 GB puedes ejecutar 7B y 13B en Q4 con excelente relación calidad-precio. Pregunta frecuente: ¿RTX 4060 8 GB o RTX 3060 12 GB para LLM?
Respuesta clara: 3060 12 GB. La 4060 es más potente, pero 8 GB de VRAM es un límite real; con 13B te quedarás sin memoria.
La RX 6600 encaja si el presupuesto es ajustado y solo usas 7B. En Windows, AMD exige más trabajo con Vulkan que NVIDIA.
Nivel intermedio (presupuesto $400-800)
| Modelo | VRAM | Modelos adecuados | Rendimiento | Precio |
|---|---|---|---|---|
| RTX 4060 Ti 16 GB | 16 GB | 13B Q4/Q8, 14B Q4 | 50-80 tok/s | $400 |
| RTX 4070 Super 12 GB | 12 GB | 7B Q8, 13B Q4 | 60-90 tok/s | $600 |
La RTX 4060 Ti 16 GB es mi recomendación principal. 16 GB es un punto dulce: 13B en Q8 o 14B en Q4. Unos $400, muy buena relación calidad-precio.
La RTX 4070 Super es más rápida, pero 12 GB limita a 13B Q4. Si priorizas velocidad, 4070 Super; si priorizas tamaño de modelo, 4060 Ti 16 GB.
Nivel alto (presupuesto $1.200-2.000)
| Modelo | VRAM | Modelos adecuados | Rendimiento | Precio |
|---|---|---|---|---|
| RTX 4090 24 GB | 24 GB | 32B Q4, 70B con offload* | 80-150 tok/s | $1.800 |
| RTX 5090 32 GB | 32 GB | 32B Q8, 70B Q4 con offload* | Depende del modelo | $2.000 |
| RX 7900 XTX 24 GB | 24 GB | 32B Q4 | 60-100 tok/s | $900 |
*Nota: una sola tarjeta de 24/32 GB necesita offload y/o cuantización más agresiva para 70B. Para un 70B Q4 más estable, dos RTX 3090 o 48 GB+ de memoria son más realistas.
La RTX 4090 sigue siendo la referencia en gama alta. 24 GB ejecutan 32B Q4 sin problema; para 70B hace falta offload, cuantización más agresiva o doble GPU.
La RTX 5090 32 GB es la nueva referencia de 2026, con 32 GB GDDR7 oficiales. Es mejor candidata que la 4090 para intentar 70B Q4 en una sola tarjeta, pero los contextos largos y el overhead pueden seguir exigiendo offload; no la trates como solución completa para 70B Q5/Q8.
La RX 7900 XTX ofrece 24 GB por unos $900, pero ROCm en Windows es inestable; mejor en Linux.
Recomendaciones para usuarios Mac
| Chip | Memoria unificada | Modelos adecuados | Rendimiento |
|---|---|---|---|
| M4 Pro | 24 GB | 14B Q4 | 35-55 tok/s |
| M4 Max | 128 GB | 70B Q4 | 28-30 tok/s |
| M3 Ultra | 192 GB | 70B+, varios modelos en paralelo | 25-35 tok/s |
La memoria unificada de Mac permite modelos más grandes. Un M4 Max con 128 GB ejecuta 70B Q4 completo sin tantos compromisos de cuantización.
El pero es la velocidad: M4 Max con 70B ronda 28-30 tok/s, bastante por debajo de una RTX 4090. Si buscas velocidad, NVIDIA; si buscas integridad del modelo y facilidad, Mac es buena opción.
La mejor relación calidad-precio: RTX 3090 24 GB de segunda mano
Opción que muchos pasan por alto: RTX 3090 24 GB de segunda mano.
En el mercado de usados ronda los $600. Una sola tarjeta de 24 GB encaja muy bien con 32B Q4; si el objetivo es 70B Q4, dos 3090 son más realistas, o tendrás que aceptar offload pesado y cuantización más agresiva. Menos potencia que una 4090, pero a mitad de precio.
Un conocido lleva más de un año con una 3090 usada sin problemas. Clave: vendedor fiable y evitar tarjetas de minería.
5. Flujo de decisión de compra
Tras las cuatro secciones anteriores, puede que aún haya demasiadas tablas y modelos. Este flujo te guía paso a paso.
Paso 1: define el modelo objetivo
¿Qué modelo quieres ejecutar? Es la pregunta central.
- Chat diario, redacción: 7B basta (Llama 3.1 8B, Qwen 2.5 7B)
- Código, preguntas técnicas: mejor 13B-14B (Qwen 2.5 14B, DeepSeek Coder)
- Razonamiento complejo, textos largos: 32B-70B (DeepSeek V3, Qwen 2.5 72B)
La mayoría elige 7B o 13B. 70B solo si tienes una necesidad concreta.
Paso 2: define la cuantización
- VRAM justa: Q4_K_M (por defecto)
- VRAM holgada: Q5_K_M (más precisión)
- Investigación / comparación: Q8_0 o FP16
Empieza con Q4_K_M: calidad suficiente en la mayoría de escenarios y menos VRAM.
Paso 3: consulta la tabla de VRAM
Vuelve a la tabla del capítulo 1 y busca modelo + cuantización.
Ejemplo: Llama 3.1 8B Q4_K_M → 4-6 GB. Necesitas al menos 8 GB de VRAM (2 GB de margen).
Paso 4: elige GPU según presupuesto
Combina VRAM y presupuesto con la tabla del capítulo 4.
- $200-400: RTX 3060 12 GB
- $400-800: RTX 4060 Ti 16 GB
- $1.200+: RTX 4090 24 GB o RTX 5090 32 GB
- Usuarios Mac: M4 Max 128 GB
Paso 5: confirma la plataforma
- Windows: NVIDIA CUDA es lo más estable; AMD con Vulkan
- Linux: CUDA y ROCm estables
- macOS: Apple Metal se acelera automáticamente; revisa sobre todo la memoria unificada
Ejemplo de decisión
Supón que quieres ejecutar Llama 3.3 70B:
- Modelo objetivo: 70B
- Cuantización: Q4_K_M (relación calidad-precio)
- VRAM: tabla → 40-48 GB
- Presupuesto: unos $1.500
- Plataforma: Windows
Análisis:
- RTX 4090 24 GB: una sola tarjeta no basta; hace falta doble GPU o cuantización agresiva
- RTX 5090 32 GB: mejor candidata de una sola tarjeta para intentar 70B Q4, aunque los contextos largos pueden requerir offload
- Dos RTX 3090 24 GB de segunda mano: $1.200, 48 GB, buena relación calidad-precio
- Mac M4 Max 128 GB: ejecución completa, pero más lenta
Recomendación final: con presupuesto ajustado, dos RTX 3090 de segunda mano. Si priorizas comodidad CUDA en una sola tarjeta, RTX 5090 32 GB. En Mac, M4 Max 128 GB es la mejor opción de una sola máquina para 70B completo.
Resumen
La lógica del hardware en una frase: la VRAM marca el techo; la cuantización marca el suelo.
Una tabla comparativa, una lista de recomendaciones y tres tecnologías de aceleración: con esto deberías tener claro lo que antes generaba dudas.
Si aún dudas, recuerda esta regla:
- Presupuesto limitado: RTX 3060 12 GB, ideal para empezar con 7B y 13B
- Rendimiento: RTX 4090 24 GB o 4060 Ti 16 GB, de gama media a alta
- Usuarios Mac: M4 Max 128 GB, la única opción de una sola máquina para 70B completo
- Mejor relación calidad-precio: RTX 3090 24 GB de segunda mano, muy buena para 32B en una tarjeta; para 70B, usa dos tarjetas
Más trucos prácticos de Ollama en otros artículos de la serie: Guía de aceleración GPU de Ollama, Comparativa de modelos LLM locales.
FAQ
¿Cuánta VRAM necesita realmente un modelo 7B?
¿RTX 3060 12 GB o RTX 4060 8 GB para ejecutar LLM?
¿La cuantización Q4 afecta mucho la calidad del modelo?
¿Se puede usar Ollama con GPU AMD?
¿Cómo obtener el mejor rendimiento en Mac?
¿Qué hacer con poco presupuesto si quiero ejecutar un modelo 70B?
10 min de lectura · Publicado el: 28 may 2026 · Actualizado el: 21 ago 2026
Guía de Ollama local LLM
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
Llama 70B en local: comparativa de 5700XT, Mac M4 y CUDA con guía de elección
¿Quieres ejecutar Llama 70B en local? Comparamos AMD 5700XT, Mac M4 y NVIDIA CUDA con datos reales para ayudarte a elegir el hardware adecuado: requisitos de VRAM, rendimiento y errores habituales.
Parte 5 de 18
Siguiente
Aceleración GPU en Ollama: guía práctica con CUDA, ROCm y Metal en todas las plataformas
Guía completa de aceleración GPU en Ollama: configuración en NVIDIA CUDA, AMD ROCm y Apple Metal, con pasos de verificación, ajustes multi-GPU y resolución de problemas para multiplicar por 10-20 la velocidad de inferencia local de LLM.
Parte 7 de 18



Comentarios
Inicia sesión con GitHub para dejar un comentario