Cambiar tema

Guía de hardware Ollama: VRAM, cuantización y tablas comparativas de GPU (2026)

Easton editorial illustration: central VRAM capacity gauge matching 7B, 13B, and 70B model blocks to CUDA, ROCm, and Metal docks
4-6 GB
VRAM para 7B Q4
Funciona con GPUs de entrada
40-48 GB
VRAM para 70B Q4
Requiere 48 GB+ de memoria o doble GPU
Automático
Aceleración Metal en Mac
Sin interruptor extra en Apple Silicon
数据来源: Datos de pruebas reales y documentación oficial

Quieres ejecutar un modelo 7B en local y no sabes cuánta VRAM debe tener tu GPU. ¿Y con 13B? En internet dicen que 8 GB bastan, otros que hacen falta 16 GB como mínimo. ¿A quién hacer caso?

Este problema me persiguió varios meses. Cuando empecé con Ollama el año pasado, compré una RTX 3060 12 GB pensando: «12 GB deberían alcanzar». Al ejecutar un 13B, me quedé sin VRAM y la velocidad cayó a 3 tokens/s, como navegar con una conexión lentísima.

Luego entendí algo clave: el límite de VRAM es una frontera real. Si la cruzas, el rendimiento se desploma; si no la cruzas, todo va bien.

En este artículo reuní en tablas las GPUs más usadas, los tamaños de modelo y los niveles de cuantización. Al terminar de leer sabrás qué modelos puede ejecutar tu tarjeta y qué GPU encaja mejor con tu presupuesto.

1. Tabla principal: requisitos de VRAM de un vistazo

Primero, la fórmula. La VRAM necesaria es aproximadamente:

VRAM ≈ parámetros (B) × bits de cuantización ÷ 8 + KV Cache (1-2 GB)

Parece simple, pero define el tamaño máximo del modelo. Ejemplo: un 7B con cuantización Q4 (4 bits) ≈ 7 × 4 ÷ 8 = 3,5 GB; con KV Cache y overhead real, necesitas 4-6 GB.

Esta es la tabla completa. Conviene guardarla:

Tamaño del modeloQ4_K_MQ5_K_MQ8_0FP16GPU recomendada
7B4-6 GB5-6 GB7-8 GB14 GBRTX 3060 12 GB
13B8-10 GB10-12 GB13-14 GB26 GBRTX 4060 Ti 16 GB
32B20-24 GB24-28 GB32-36 GB64 GBRTX 4090 24 GB
70B40-48 GB48-56 GB70-80 GB140 GBDos RTX 3090 / Mac M4 Max 128 GB

Un punto crítico: si te quedas corto de VRAM, el rendimiento puede caer entre 5 y 20 veces.

Lo probé con una RTX 3060 12 GB ejecutando 13B Q4_K_M. La VRAM quedaba justo en el límite: a veces funcionaba, a veces se quedaba sin memoria. Cuando pasa, Ollama mueve parte de los datos a la RAM del sistema y la velocidad pasa de 45 tokens/s a 2-3 tokens/s. El cambio de fluidez es inmediato.

Al comprar GPU, mejor tener 2 GB de margen que quedarte justo en el borde.

2. Cuantización: Q4 vs Q5 vs Q8 en la práctica

La cuantización es la palanca principal para reducir VRAM.

FP16 es la precisión original: cada parámetro ocupa 16 bits. Q4 lo comprime a 4 bits y la VRAM se reduce a la mitad. La pregunta es: ¿se nota en la calidad?

Sí, pero menos de lo que imaginas.

Datos de pruebas reales:

Nivel de cuantizaciónVRAM modelo 7BPérdida de calidadEscenario recomendado
Q4_K_M4,5 GB1-3 %Uso diario (recomendado)
Q5_K_M5,7 GB<1 %Si buscas más precisión
Q8_07,7 GB<0,5 %Máxima calidad
FP1614 GB0 %Investigación / referencia

Q4_K_M es la opción por defecto. Pierde solo un 1-3 % y en la mayoría de casos no se nota. Con Llama 3.1 8B en Q4_K_M escribí varios artículos técnicos; frente a FP16, la diferencia es difícil de ver.

Q5_K_M encaja si tienes 16 GB o más de VRAM. Con una RTX 4060 Ti 16 GB obtienes mejor calidad de inferencia, sobre todo en razonamiento matemático y textos largos.

Q8_0 se acerca a la calidad original. Salvo evaluación o investigación, Q8 no compensa: el doble de VRAM por una ganancia pequeña.

Evita Q3 y Q2: la pérdida es evidente y el modelo empieza a divagar. Solo si la VRAM es muy escasa (por ejemplo 4 GB); si no, no los uses.

Mi recomendación: empieza con Q4_K_M y pasa a Q5 solo si la calidad no te convence. En la mayoría de casos, Q4 basta.

3. Tres tecnologías de aceleración: CUDA vs Metal vs ROCm

Elegir GPU no es solo VRAM: también importa la tecnología de aceleración.

Ollama soporta cuatro backends GPU: NVIDIA CUDA, Apple Metal, AMD ROCm y Vulkan. Cada uno tiene pros y contras; la plataforma equivocada puede costarte la mitad del rendimiento.

Tabla comparativa:

TecnologíaHardwareRendimiento 7BSistemasMadurez
CUDAGPU NVIDIA30-80 tok/sWin/Linux★★★★★
MetalApple M1-M420-50 tok/smacOS★★★★★
ROCmAMD RX 700025-60 tok/sSobre todo Linux★★★☆☆
VulkanAMD/Intel15-40 tok/sMultiplataforma★★★☆☆

CUDA: la opción más estable

NVIDIA CUDA es hoy la opción más madura. Drivers estables, comunidad amplia, documentación completa. Instalas Ollama y CUDA se detecta solo, sin configuración extra.

Mi RTX 3060 con CUDA ejecuta Llama 3.1 8B Q4 a unos 45 tokens/s de media. Inferencia fluida y respuesta rápida.

El único pero: el precio. Las NVIDIA tienen mucho sobreprecio; una RTX 4090 ronda los $1800.

Metal: la opción para usuarios Mac

Apple Metal rinde muy bien en Mac. M1/M2/M3/M4 están soportados y la memoria unificada permite modelos más grandes al compartir VRAM y RAM.

La aceleración Apple Metal es la ventaja clave en Mac. En Apple Silicon, Ollama usa Metal automáticamente; con suficiente memoria unificada, la configuración es simple.

No uses OLLAMA_ORIGINS como interruptor de rendimiento. Configura orígenes permitidos/CORS y no activa MLX:

# Ollama usa Metal automáticamente en Apple Silicon
# OLLAMA_ORIGINS solo permite orígenes de navegador adicionales para la API de Ollama
ollama serve

Requisito: al menos 32 GB de memoria unificada. Con menos de 16 GB, los modelos grandes sufren.

ROCm: el camino difícil de AMD

AMD ROCm en Linux funciona razonablemente; en Windows es más complicado. Soporte oficial en Linux; en Windows sigue en fase experimental, con bugs y compatibilidad irregular.

Si tienes AMD en Windows, mejor Vulkan:

OLLAMA_VULKAN=1 ollama serve

Vulkan es multiplataforma. Un poco más lento que CUDA, pero estable.

Mi consejo: si no quieres complicarte, NVIDIA CUDA. En Mac, Metal automático. En AMD: Linux + ROCm o Windows + Vulkan.

4. Recomendaciones de GPU: de entrada a gama alta

Tabla por presupuesto.

Nivel de entrada (presupuesto $200-400)

ModeloVRAMModelos adecuadosRendimientoPrecio
RTX 3060 12 GB12 GB7B Q4, 13B Q440-60 tok/s$250
RX 6600 8 GB8 GB7B Q430-45 tok/s$200

La RTX 3060 12 GB es la mejor para empezar. Con 12 GB puedes ejecutar 7B y 13B en Q4 con excelente relación calidad-precio. Pregunta frecuente: ¿RTX 4060 8 GB o RTX 3060 12 GB para LLM?

Respuesta clara: 3060 12 GB. La 4060 es más potente, pero 8 GB de VRAM es un límite real; con 13B te quedarás sin memoria.

La RX 6600 encaja si el presupuesto es ajustado y solo usas 7B. En Windows, AMD exige más trabajo con Vulkan que NVIDIA.

Nivel intermedio (presupuesto $400-800)

ModeloVRAMModelos adecuadosRendimientoPrecio
RTX 4060 Ti 16 GB16 GB13B Q4/Q8, 14B Q450-80 tok/s$400
RTX 4070 Super 12 GB12 GB7B Q8, 13B Q460-90 tok/s$600

La RTX 4060 Ti 16 GB es mi recomendación principal. 16 GB es un punto dulce: 13B en Q8 o 14B en Q4. Unos $400, muy buena relación calidad-precio.

La RTX 4070 Super es más rápida, pero 12 GB limita a 13B Q4. Si priorizas velocidad, 4070 Super; si priorizas tamaño de modelo, 4060 Ti 16 GB.

Nivel alto (presupuesto $1.200-2.000)

ModeloVRAMModelos adecuadosRendimientoPrecio
RTX 4090 24 GB24 GB32B Q4, 70B con offload*80-150 tok/s$1.800
RTX 5090 32 GB32 GB32B Q8, 70B Q4 con offload*Depende del modelo$2.000
RX 7900 XTX 24 GB24 GB32B Q460-100 tok/s$900

*Nota: una sola tarjeta de 24/32 GB necesita offload y/o cuantización más agresiva para 70B. Para un 70B Q4 más estable, dos RTX 3090 o 48 GB+ de memoria son más realistas.

La RTX 4090 sigue siendo la referencia en gama alta. 24 GB ejecutan 32B Q4 sin problema; para 70B hace falta offload, cuantización más agresiva o doble GPU.

La RTX 5090 32 GB es la nueva referencia de 2026, con 32 GB GDDR7 oficiales. Es mejor candidata que la 4090 para intentar 70B Q4 en una sola tarjeta, pero los contextos largos y el overhead pueden seguir exigiendo offload; no la trates como solución completa para 70B Q5/Q8.

La RX 7900 XTX ofrece 24 GB por unos $900, pero ROCm en Windows es inestable; mejor en Linux.

Recomendaciones para usuarios Mac

ChipMemoria unificadaModelos adecuadosRendimiento
M4 Pro24 GB14B Q435-55 tok/s
M4 Max128 GB70B Q428-30 tok/s
M3 Ultra192 GB70B+, varios modelos en paralelo25-35 tok/s

La memoria unificada de Mac permite modelos más grandes. Un M4 Max con 128 GB ejecuta 70B Q4 completo sin tantos compromisos de cuantización.

El pero es la velocidad: M4 Max con 70B ronda 28-30 tok/s, bastante por debajo de una RTX 4090. Si buscas velocidad, NVIDIA; si buscas integridad del modelo y facilidad, Mac es buena opción.

La mejor relación calidad-precio: RTX 3090 24 GB de segunda mano

Opción que muchos pasan por alto: RTX 3090 24 GB de segunda mano.

En el mercado de usados ronda los $600. Una sola tarjeta de 24 GB encaja muy bien con 32B Q4; si el objetivo es 70B Q4, dos 3090 son más realistas, o tendrás que aceptar offload pesado y cuantización más agresiva. Menos potencia que una 4090, pero a mitad de precio.

Un conocido lleva más de un año con una 3090 usada sin problemas. Clave: vendedor fiable y evitar tarjetas de minería.

5. Flujo de decisión de compra

Tras las cuatro secciones anteriores, puede que aún haya demasiadas tablas y modelos. Este flujo te guía paso a paso.

Paso 1: define el modelo objetivo

¿Qué modelo quieres ejecutar? Es la pregunta central.

  • Chat diario, redacción: 7B basta (Llama 3.1 8B, Qwen 2.5 7B)
  • Código, preguntas técnicas: mejor 13B-14B (Qwen 2.5 14B, DeepSeek Coder)
  • Razonamiento complejo, textos largos: 32B-70B (DeepSeek V3, Qwen 2.5 72B)

La mayoría elige 7B o 13B. 70B solo si tienes una necesidad concreta.

Paso 2: define la cuantización

  • VRAM justa: Q4_K_M (por defecto)
  • VRAM holgada: Q5_K_M (más precisión)
  • Investigación / comparación: Q8_0 o FP16

Empieza con Q4_K_M: calidad suficiente en la mayoría de escenarios y menos VRAM.

Paso 3: consulta la tabla de VRAM

Vuelve a la tabla del capítulo 1 y busca modelo + cuantización.

Ejemplo: Llama 3.1 8B Q4_K_M → 4-6 GB. Necesitas al menos 8 GB de VRAM (2 GB de margen).

Paso 4: elige GPU según presupuesto

Combina VRAM y presupuesto con la tabla del capítulo 4.

  • $200-400: RTX 3060 12 GB
  • $400-800: RTX 4060 Ti 16 GB
  • $1.200+: RTX 4090 24 GB o RTX 5090 32 GB
  • Usuarios Mac: M4 Max 128 GB

Paso 5: confirma la plataforma

  • Windows: NVIDIA CUDA es lo más estable; AMD con Vulkan
  • Linux: CUDA y ROCm estables
  • macOS: Apple Metal se acelera automáticamente; revisa sobre todo la memoria unificada

Ejemplo de decisión

Supón que quieres ejecutar Llama 3.3 70B:

  1. Modelo objetivo: 70B
  2. Cuantización: Q4_K_M (relación calidad-precio)
  3. VRAM: tabla → 40-48 GB
  4. Presupuesto: unos $1.500
  5. Plataforma: Windows

Análisis:

  • RTX 4090 24 GB: una sola tarjeta no basta; hace falta doble GPU o cuantización agresiva
  • RTX 5090 32 GB: mejor candidata de una sola tarjeta para intentar 70B Q4, aunque los contextos largos pueden requerir offload
  • Dos RTX 3090 24 GB de segunda mano: $1.200, 48 GB, buena relación calidad-precio
  • Mac M4 Max 128 GB: ejecución completa, pero más lenta

Recomendación final: con presupuesto ajustado, dos RTX 3090 de segunda mano. Si priorizas comodidad CUDA en una sola tarjeta, RTX 5090 32 GB. En Mac, M4 Max 128 GB es la mejor opción de una sola máquina para 70B completo.

Resumen

La lógica del hardware en una frase: la VRAM marca el techo; la cuantización marca el suelo.

Una tabla comparativa, una lista de recomendaciones y tres tecnologías de aceleración: con esto deberías tener claro lo que antes generaba dudas.

Si aún dudas, recuerda esta regla:

  • Presupuesto limitado: RTX 3060 12 GB, ideal para empezar con 7B y 13B
  • Rendimiento: RTX 4090 24 GB o 4060 Ti 16 GB, de gama media a alta
  • Usuarios Mac: M4 Max 128 GB, la única opción de una sola máquina para 70B completo
  • Mejor relación calidad-precio: RTX 3090 24 GB de segunda mano, muy buena para 32B en una tarjeta; para 70B, usa dos tarjetas

Más trucos prácticos de Ollama en otros artículos de la serie: Guía de aceleración GPU de Ollama, Comparativa de modelos LLM locales.

FAQ

¿Cuánta VRAM necesita realmente un modelo 7B?
Con cuantización Q4_K_M necesitas 4-6 GB; sumando KV Cache y overhead de ejecución, conviene una GPU con al menos 8 GB de VRAM.
¿RTX 3060 12 GB o RTX 4060 8 GB para ejecutar LLM?
3060 12 GB. La 4060 tiene más potencia de cómputo, pero 8 GB de VRAM es un límite duro: con modelos 13B te quedarás sin memoria. La VRAM importa más que el rendimiento bruto.
¿La cuantización Q4 afecta mucho la calidad del modelo?
No. Q4_K_M pierde solo un 1-3 % de calidad y en la mayoría de escenarios no se nota. Salvo que hagas evaluación de modelos, Q4 basta.
¿Se puede usar Ollama con GPU AMD?
Sí. En Linux, ROCm es bastante estable; en Windows conviene Vulkan (configura OLLAMA_VULKAN=1).
¿Cómo obtener el mejor rendimiento en Mac?
En Apple Silicon, Ollama usa Metal automáticamente. No uses OLLAMA_ORIGINS como interruptor de MLX: solo configura orígenes permitidos/CORS. Para aceleración específica de MLX, usa un runtime MLX separado.
¿Qué hacer con poco presupuesto si quiero ejecutar un modelo 70B?
Dos RTX 3090 24 GB de segunda mano × 2 = 48 GB de VRAM, unos $1200 en total, la mejor relación calidad-precio. O un Mac M4 Max con 128 GB en una sola máquina.

10 min de lectura · Publicado el: 28 may 2026 · Actualizado el: 21 ago 2026

Comentarios

Inicia sesión con GitHub para dejar un comentario

Easton BlogEaston Blog