Cambiar tema

Llama 70B en local: comparativa de 5700XT, Mac M4 y CUDA con guía de elección

Easton editorial illustration: 70B 权重块, 5700XT 测试架, M4 统一内存托盘, CUDA 双层 offload 试验架
20-28 tok/s
Mac M4 Max 70B Q4
Mejor rendimiento con memoria unificada
18 tok/s
RTX 4090 70B offload
Overhead por mover datos CPU-GPU
~40GB
VRAM necesaria Q4_K_M
Con KV Cache, unos 45 GB
数据来源: Foro Reddit LocalLLaMA y pruebas de blogs técnicos

¿Quieres ejecutar Llama 70B en local? ¿Te alcanza una AMD 5700XT con 8 GB de VRAM? ¿Puede un Mac M4?

La respuesta puede sorprenderte. La versión completa FP16 de 70B exige 140 GB de VRAM — en hardware de consumo, básicamente imposible. Pero la cuantización baja el listón a unos 40 GB, y de repente la cosa se pone interesante.

En este artículo comparamos con datos reales tres enfoques habituales: AMD 5700XT (favorita de quien disfruta complicarse con la configuración), Mac M4 (ventaja clara de la memoria unificada) y NVIDIA CUDA (rey del ecosistema). En unos 5 minutos podrás decidir cuál te conviene.

La verdad sobre la VRAM de Llama 70B

La cuantización, en pocas palabras, comprime el modelo. En FP16 original, cada parámetro ocupa 2 bytes; multiplica 70 mil millones de parámetros y obtienes 140 GB de VRAM. Aunque tengas 24 GB en una RTX 4090, sigue sin bastar.

¿La salida? Las versiones cuantizadas en formato GGUF.

¿Qué nivel de cuantización elegir?

Cada nivel cambia mucho la VRAM que necesitas:

Nivel de cuantizaciónVRAM necesariaPérdida de precisiónCaso de uso
Q8_0~75GBMínimaInvestigación, máxima precisión
Q6_K~55GBBajaCon 64 GB+ de RAM
Q5_K_M~45GBAceptableMac con 64 GB de RAM
Q4_K_M~35-40GBEquilibrioLa mayoría del hardware de consumo
Q3_K_M~30GBNotableCompresión extrema de VRAM

Recomiendo Q4_K_M. ¿Por qué? Es un buen equilibrio entre precisión y VRAM. Q3 también corre, pero la pérdida se nota: peor calidad de respuesta y razonamiento más débil. Q5 o superior es mejor, pero sube otra vez el requisito de memoria.

No olvides el KV Cache: durante la inferencia el modelo guarda el contexto, y eso suma unos 5 GB extra. En la práctica, para Q4_K_M necesitas unos 40-45 GB de memoria disponible.

Comparativa real de tres enfoques de hardware

Directo a la tabla. Datos del foro Reddit LocalLLaMA y de varios blogs técnicos.

EnfoqueVRAM/RAMModelos viablesRendimiento 70B Q4Rango de precioDificultad de setup
AMD 5700XT8 GB VRAM7B completo, 12B parcialNo recomendadoSegunda mano $150-200Alta
Mac M4 Max128 GB memoria unificada70B Q4/Q520-28 tok/s$3500+Baja
NVIDIA RTX 409024 GB VRAM32B completo, 70B offload18 tok/s (offload)$1500-2000Media
NVIDIA RTX 509032 GB VRAMIntento de 70B Q4 en una sola GPU / offloadDepende del contexto$2000+Media

AMD 5700XT: la pesadilla de quien disfruta complicarse

En serio, correr 70B en una 5700XT es ir a ciegas. Con 8 GB de VRAM, un 7B Q4 apenas cabe; 70B, imposible. Aun así hay quien no se rinde — yo también probé workarounds de ROCm.

Resultado: inestabilidad. Arranca, pero puede fallar en cualquier momento. AMD no soporta ROCm en RDNA1 (la 5700XT es de esa generación); lo que queda son overrides de variables de entorno de la comunidad:

HSA_OVERRIDE_GFX_VERSION=10.1.0

Eso engaña a ROCm para que arranque, pero el rendimiento es mediocre y la estabilidad, mala. Si quieres aprender y experimentar, adelante. Si buscas algo serio, olvídalo.

Mac M4: la memoria unificada marca la diferencia

La memoria unificada de Apple Silicon es casi un regalo para modelos grandes. En un M4 Max con 128 GB, RAM del sistema y VRAM son lo mismo — no peleas con offload cuando se acaba la VRAM.

Los números son buenos: 20-28 tok/s, muy cómodo para inferencia local. Y el setup es simple: instala Ollama o usa MLX directamente; unas pocas líneas y listo.

El pero es el precio: M4 Max desde $3500+, no es poco. Pero si ya necesitabas un Mac para otras cosas y además quieres un modelo grande, la cuenta puede salir bien.

NVIDIA CUDA: ecosistema maduro, pero 70B exige offload

Con 24 GB, la RTX 4090 va sobrada para 32B. Para 70B, no alcanza: hace falta offload — parte de capas en GPU, el resto en RAM del sistema.

Funciona, pero más lento: unos 18 tok/s, algo por debajo del Mac M4 Max. Mover datos entre CPU y GPU cuesta tiempo.

La RTX 5090 ya está lanzada con 32 GB de GDDR7. Es mejor candidata que la RTX 4090 para intentar 70B Q4 en una sola tarjeta, aunque los contextos largos y el overhead pueden seguir exigiendo offload; precio y disponibilidad pueden variar.

La ventaja de CUDA es el ecosistema. ¿Fine-tuning? La cadena de herramientas NVIDIA es la más completa. PyTorch y Hugging Face priorizan CUDA. Apple Silicon y AMD no compiten ahí.

Cómo saber qué enfoque te conviene

Sin darle vueltas: sigue este flujo paso a paso.

Paso 1: mira qué tienes ya

¿Ya tienes una 5700XT?

  • Puedes probar el workaround de ROCm, pero prepárate para liarte
  • En la práctica solo aguantará modelos 7B (12B ya requiere offload parcial)
  • Encaja si quieres aprender ROCm y no te importan los tropiezos

¿Ya tienes un Mac?

  • Revisa la RAM: 64 GB permiten 70B Q5; 128 GB, más holgado
  • M4 Pro/Max rinden mejor; la base M4 también sirve
  • Pruébalo directamente: suele funcionar a la primera

¿No tienes nada?

  • Mira el presupuesto en el siguiente paso

Paso 2: el presupuesto decide

Rango de presupuestoEnfoque recomendadoNotas
<$5005700XT de segunda mano o Mac Mini M4 base5700XT arriesgada; M4 base con 16 GB solo para modelos pequeños
$500-2000RTX 4090 o Mac Mini M4 ProRTX 4090 con offload para 70B; M4 Pro 24 GB encaja mejor con 7B/13B y algunos 32B
$2000+RTX 5090 o Mac Studio M4 MaxFine-tuning → NVIDIA; inferencia pura → Mac

Paso 3: ¿para qué lo quieres?

¿Solo probar y jugar?

  • Cualquier hardware que corra 7B vale. No hace falta complicarse con 70B para sentir la inferencia local.

¿Uso diario y estabilidad?

  • La serie Mac M4 es lo más tranquilo: instalas y usas, sin pelear con versiones de CUDA ni configs de ROCm.

¿Fine-tuning?

  • NVIDIA CUDA, sin alternativa real: más soporte, más tutoriales, menos sorpresas.

¿Máxima velocidad de inferencia?

  • MLX en Mac M4 Max suele ir 30-50 % más rápido que llama.cpp; lo vemos abajo.

La mayoría encaja en el segundo caso — uso estable. Mac gana ahí: sin drivers raros ni problemas de compatibilidad, listo al sacarlo de la caja.

MLX vs llama.cpp en Mac

En Mac hay otra duda: ¿MLX o llama.cpp?

Comparativa de rendimiento

Según pruebas de Compute Market:

EscenarioMLXllama.cppDiferencia
Prompt corto (<512 tokens)Más rápidoReferenciaMLX 30-50 % más rápido
Prompt largo (>2048 tokens)ReferenciaMás rápidollama.cpp ligeramente mejor
Velocidad global~25 tok/s~20 tok/sMLX por delante

MLX está optimizado por Apple para Silicon y usa Metal directamente. llama.cpp es multiplataforma; también soporta Metal, pero no tan a fondo.

¿Cómo elegir?

¿Inferencia pura y velocidad?

  • MLX. Con mlx_lm.generate arrancas rápido, setup mínimo.

¿Necesitas la cadena de herramientas de llama.cpp?

  • Si usas utilidades de terceros que dependen de llama.cpp, o quieres mover el mismo GGUF entre dispositivos, elige llama.cpp: mejor compatibilidad en casi cualquier plataforma.

¿No estás seguro?

  • Prueba los dos. La instalación es sencilla; un par de ejecuciones y verás cuál encaja con tu ritmo.

Yo me inclino por MLX: mi caso principal es inferencia local y quiero velocidad. La compatibilidad de toolchain no me urge.

Resumen

Para cerrar, una tabla de decisión rápida:

Tu situaciónEnfoque recomendadoMotivo
Ya tienes Mac (64 GB+ RAM)Úsalo con MLXMás tranquilo, buen rendimiento
Sin hardware, presupuesto <$500Mac Mini M4 baseMás estable que 5700XT, menos riesgo
$500-2000 y quieres estabilidadMac Mini M4 Pro o RTX 409024 GB van mejor para 7B/13B; 70B necesita 64 GB+ u offload
$2000+ y fine-tuningRTX 4090/5090Ecosistema CUDA maduro
Quieres aprender ROCm aunque sea más complejo5700XT de segunda manoBarata, pero prepárate para tropiezos

En una frase: Mac = tranquilo y estable; CUDA = ecosistema completo; AMD = buena relación precio/rendimiento pero más lío.

Si buscas algo serio sin perder horas en configuración, elige Mac. Si el presupuesto aprieta y aceptas tropiezos, prueba 5700XT, pero no esperes milagros con 70B. Para fine-tuning, NVIDIA CUDA es la opción.

¿Quieres probar ya? Con Mac, instala Ollama o MLX y corre un 7B para sentir la inferencia local. Sin Mac, revisa si tu hardware actual aguanta un modelo pequeño — 70B no es el punto de partida; lo importante es arrancar.

FAQ

¿Cuánta VRAM hace falta para ejecutar Llama 70B?
La versión completa FP16 requiere 140 GB; la cuantizada Q4_K_M necesita 35-40 GB. Sumando el KV Cache, hacen falta 40-45 GB de memoria disponible.
¿Mac M4 o NVIDIA conviene más para modelos grandes?
Para inferencia pura, Mac (estable y sencillo); para fine-tuning, NVIDIA (ecosistema más completo). Mac M4 Max alcanza 20-28 tok/s; RTX 4090 con offload ronda 18 tok/s.
¿Qué hardware elegir con presupuesto ajustado?
Con $500-2000, RTX 4090 o Mac Mini M4 Pro para 7B/13B y algunos 32B. Para 70B Q4 estable, prioriza un Mac con 64 GB+ de memoria unificada o dos RTX 3090. La RTX 5090 es mejor para intentos en una sola tarjeta, pero aún puede requerir offload. Por debajo de $500, no recomendamos una 5700XT de segunda mano.
¿Puede un AMD 5700XT ejecutar Llama 70B?
No. Con 8 GB de VRAM solo alcanza para modelos 7B, y ROCm no soporta oficialmente la arquitectura RDNA1; los workarounds son inestables.
¿MLX o llama.cpp en Mac?
Con prompts cortos, MLX es más rápido (30-50 %). Con prompts largos, llama.cpp gana ligeramente. Para compatibilidad multiplataforma usa llama.cpp; para inferencia pura, MLX.

7 min de lectura · Publicado el: 28 may 2026 · Actualizado el: 21 ago 2026

Comentarios

Inicia sesión con GitHub para dejar un comentario

Easton BlogEaston Blog