Llama 70B en local: comparativa de 5700XT, Mac M4 y CUDA con guía de elección

¿Quieres ejecutar Llama 70B en local? ¿Te alcanza una AMD 5700XT con 8 GB de VRAM? ¿Puede un Mac M4?
La respuesta puede sorprenderte. La versión completa FP16 de 70B exige 140 GB de VRAM — en hardware de consumo, básicamente imposible. Pero la cuantización baja el listón a unos 40 GB, y de repente la cosa se pone interesante.
En este artículo comparamos con datos reales tres enfoques habituales: AMD 5700XT (favorita de quien disfruta complicarse con la configuración), Mac M4 (ventaja clara de la memoria unificada) y NVIDIA CUDA (rey del ecosistema). En unos 5 minutos podrás decidir cuál te conviene.
La verdad sobre la VRAM de Llama 70B
La cuantización, en pocas palabras, comprime el modelo. En FP16 original, cada parámetro ocupa 2 bytes; multiplica 70 mil millones de parámetros y obtienes 140 GB de VRAM. Aunque tengas 24 GB en una RTX 4090, sigue sin bastar.
¿La salida? Las versiones cuantizadas en formato GGUF.
¿Qué nivel de cuantización elegir?
Cada nivel cambia mucho la VRAM que necesitas:
| Nivel de cuantización | VRAM necesaria | Pérdida de precisión | Caso de uso |
|---|---|---|---|
| Q8_0 | ~75GB | Mínima | Investigación, máxima precisión |
| Q6_K | ~55GB | Baja | Con 64 GB+ de RAM |
| Q5_K_M | ~45GB | Aceptable | Mac con 64 GB de RAM |
| Q4_K_M | ~35-40GB | Equilibrio | La mayoría del hardware de consumo |
| Q3_K_M | ~30GB | Notable | Compresión extrema de VRAM |
Recomiendo Q4_K_M. ¿Por qué? Es un buen equilibrio entre precisión y VRAM. Q3 también corre, pero la pérdida se nota: peor calidad de respuesta y razonamiento más débil. Q5 o superior es mejor, pero sube otra vez el requisito de memoria.
No olvides el KV Cache: durante la inferencia el modelo guarda el contexto, y eso suma unos 5 GB extra. En la práctica, para Q4_K_M necesitas unos 40-45 GB de memoria disponible.
Comparativa real de tres enfoques de hardware
Directo a la tabla. Datos del foro Reddit LocalLLaMA y de varios blogs técnicos.
| Enfoque | VRAM/RAM | Modelos viables | Rendimiento 70B Q4 | Rango de precio | Dificultad de setup |
|---|---|---|---|---|---|
| AMD 5700XT | 8 GB VRAM | 7B completo, 12B parcial | No recomendado | Segunda mano $150-200 | Alta |
| Mac M4 Max | 128 GB memoria unificada | 70B Q4/Q5 | 20-28 tok/s | $3500+ | Baja |
| NVIDIA RTX 4090 | 24 GB VRAM | 32B completo, 70B offload | 18 tok/s (offload) | $1500-2000 | Media |
| NVIDIA RTX 5090 | 32 GB VRAM | Intento de 70B Q4 en una sola GPU / offload | Depende del contexto | $2000+ | Media |
AMD 5700XT: la pesadilla de quien disfruta complicarse
En serio, correr 70B en una 5700XT es ir a ciegas. Con 8 GB de VRAM, un 7B Q4 apenas cabe; 70B, imposible. Aun así hay quien no se rinde — yo también probé workarounds de ROCm.
Resultado: inestabilidad. Arranca, pero puede fallar en cualquier momento. AMD no soporta ROCm en RDNA1 (la 5700XT es de esa generación); lo que queda son overrides de variables de entorno de la comunidad:
HSA_OVERRIDE_GFX_VERSION=10.1.0
Eso engaña a ROCm para que arranque, pero el rendimiento es mediocre y la estabilidad, mala. Si quieres aprender y experimentar, adelante. Si buscas algo serio, olvídalo.
Mac M4: la memoria unificada marca la diferencia
La memoria unificada de Apple Silicon es casi un regalo para modelos grandes. En un M4 Max con 128 GB, RAM del sistema y VRAM son lo mismo — no peleas con offload cuando se acaba la VRAM.
Los números son buenos: 20-28 tok/s, muy cómodo para inferencia local. Y el setup es simple: instala Ollama o usa MLX directamente; unas pocas líneas y listo.
El pero es el precio: M4 Max desde $3500+, no es poco. Pero si ya necesitabas un Mac para otras cosas y además quieres un modelo grande, la cuenta puede salir bien.
NVIDIA CUDA: ecosistema maduro, pero 70B exige offload
Con 24 GB, la RTX 4090 va sobrada para 32B. Para 70B, no alcanza: hace falta offload — parte de capas en GPU, el resto en RAM del sistema.
Funciona, pero más lento: unos 18 tok/s, algo por debajo del Mac M4 Max. Mover datos entre CPU y GPU cuesta tiempo.
La RTX 5090 ya está lanzada con 32 GB de GDDR7. Es mejor candidata que la RTX 4090 para intentar 70B Q4 en una sola tarjeta, aunque los contextos largos y el overhead pueden seguir exigiendo offload; precio y disponibilidad pueden variar.
La ventaja de CUDA es el ecosistema. ¿Fine-tuning? La cadena de herramientas NVIDIA es la más completa. PyTorch y Hugging Face priorizan CUDA. Apple Silicon y AMD no compiten ahí.
Cómo saber qué enfoque te conviene
Sin darle vueltas: sigue este flujo paso a paso.
Paso 1: mira qué tienes ya
¿Ya tienes una 5700XT?
- Puedes probar el workaround de ROCm, pero prepárate para liarte
- En la práctica solo aguantará modelos 7B (12B ya requiere offload parcial)
- Encaja si quieres aprender ROCm y no te importan los tropiezos
¿Ya tienes un Mac?
- Revisa la RAM: 64 GB permiten 70B Q5; 128 GB, más holgado
- M4 Pro/Max rinden mejor; la base M4 también sirve
- Pruébalo directamente: suele funcionar a la primera
¿No tienes nada?
- Mira el presupuesto en el siguiente paso
Paso 2: el presupuesto decide
| Rango de presupuesto | Enfoque recomendado | Notas |
|---|---|---|
| <$500 | 5700XT de segunda mano o Mac Mini M4 base | 5700XT arriesgada; M4 base con 16 GB solo para modelos pequeños |
| $500-2000 | RTX 4090 o Mac Mini M4 Pro | RTX 4090 con offload para 70B; M4 Pro 24 GB encaja mejor con 7B/13B y algunos 32B |
| $2000+ | RTX 5090 o Mac Studio M4 Max | Fine-tuning → NVIDIA; inferencia pura → Mac |
Paso 3: ¿para qué lo quieres?
¿Solo probar y jugar?
- Cualquier hardware que corra 7B vale. No hace falta complicarse con 70B para sentir la inferencia local.
¿Uso diario y estabilidad?
- La serie Mac M4 es lo más tranquilo: instalas y usas, sin pelear con versiones de CUDA ni configs de ROCm.
¿Fine-tuning?
- NVIDIA CUDA, sin alternativa real: más soporte, más tutoriales, menos sorpresas.
¿Máxima velocidad de inferencia?
- MLX en Mac M4 Max suele ir 30-50 % más rápido que llama.cpp; lo vemos abajo.
La mayoría encaja en el segundo caso — uso estable. Mac gana ahí: sin drivers raros ni problemas de compatibilidad, listo al sacarlo de la caja.
MLX vs llama.cpp en Mac
En Mac hay otra duda: ¿MLX o llama.cpp?
Comparativa de rendimiento
Según pruebas de Compute Market:
| Escenario | MLX | llama.cpp | Diferencia |
|---|---|---|---|
| Prompt corto (<512 tokens) | Más rápido | Referencia | MLX 30-50 % más rápido |
| Prompt largo (>2048 tokens) | Referencia | Más rápido | llama.cpp ligeramente mejor |
| Velocidad global | ~25 tok/s | ~20 tok/s | MLX por delante |
MLX está optimizado por Apple para Silicon y usa Metal directamente. llama.cpp es multiplataforma; también soporta Metal, pero no tan a fondo.
¿Cómo elegir?
¿Inferencia pura y velocidad?
- MLX. Con
mlx_lm.generatearrancas rápido, setup mínimo.
¿Necesitas la cadena de herramientas de llama.cpp?
- Si usas utilidades de terceros que dependen de llama.cpp, o quieres mover el mismo GGUF entre dispositivos, elige llama.cpp: mejor compatibilidad en casi cualquier plataforma.
¿No estás seguro?
- Prueba los dos. La instalación es sencilla; un par de ejecuciones y verás cuál encaja con tu ritmo.
Yo me inclino por MLX: mi caso principal es inferencia local y quiero velocidad. La compatibilidad de toolchain no me urge.
Resumen
Para cerrar, una tabla de decisión rápida:
| Tu situación | Enfoque recomendado | Motivo |
|---|---|---|
| Ya tienes Mac (64 GB+ RAM) | Úsalo con MLX | Más tranquilo, buen rendimiento |
| Sin hardware, presupuesto <$500 | Mac Mini M4 base | Más estable que 5700XT, menos riesgo |
| $500-2000 y quieres estabilidad | Mac Mini M4 Pro o RTX 4090 | 24 GB van mejor para 7B/13B; 70B necesita 64 GB+ u offload |
| $2000+ y fine-tuning | RTX 4090/5090 | Ecosistema CUDA maduro |
| Quieres aprender ROCm aunque sea más complejo | 5700XT de segunda mano | Barata, pero prepárate para tropiezos |
En una frase: Mac = tranquilo y estable; CUDA = ecosistema completo; AMD = buena relación precio/rendimiento pero más lío.
Si buscas algo serio sin perder horas en configuración, elige Mac. Si el presupuesto aprieta y aceptas tropiezos, prueba 5700XT, pero no esperes milagros con 70B. Para fine-tuning, NVIDIA CUDA es la opción.
¿Quieres probar ya? Con Mac, instala Ollama o MLX y corre un 7B para sentir la inferencia local. Sin Mac, revisa si tu hardware actual aguanta un modelo pequeño — 70B no es el punto de partida; lo importante es arrancar.
FAQ
¿Cuánta VRAM hace falta para ejecutar Llama 70B?
¿Mac M4 o NVIDIA conviene más para modelos grandes?
¿Qué hardware elegir con presupuesto ajustado?
¿Puede un AMD 5700XT ejecutar Llama 70B?
¿MLX o llama.cpp en Mac?
7 min de lectura · Publicado el: 28 may 2026 · Actualizado el: 21 ago 2026
Guía de Ollama local LLM
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
Parámetros de Ollama Modelfile explicados: guía completa para crear modelos personalizados
Guía detallada de los 10 parámetros clave de Ollama Modelfile, con consejos de ajuste para temperature, num_ctx y más. Incluye 4 plantillas listas para usar y ayudarte a crear tu propio modelo personalizado.
Parte 4 de 18
Siguiente
Guía de hardware Ollama: VRAM, cuantización y tablas comparativas de GPU (2026)
Tabla comparativa completa de hardware Ollama: requisitos de VRAM para modelos 7B/13B/70B, comparativa de cuantización Q4/Q8 y las tres tecnologías de aceleración NVIDIA CUDA, AMD ROCm y Apple Metal. Recomendaciones por niveles de RTX 3060 a 5090 para que encuentres rápido la GPU adecuada para tu modelo.
Parte 6 de 18



Comentarios
Inicia sesión con GitHub para dejar un comentario