Changer le thème

Llama 70B en local : guide comparatif 5700XT, Mac M4 et CUDA

Easton editorial illustration: 70B 权重块, 5700XT 测试架, M4 统一内存托盘, CUDA 双层 offload 试验架
20-28 tok/s
Mac M4 Max 70B Q4
Meilleures performances grâce à la mémoire unifiée
18 tok/s
RTX 4090 70B offload
Surcharge liée aux transferts CPU-GPU
~40 Go
Besoin VRAM Q4_K_M
Environ 45 Go avec le KV Cache
数据来源: Tests du forum Reddit LocalLLaMA et de blogs techniques

Vous voulez exécuter Llama 70B en local ? Votre AMD 5700XT 8 Go de VRAM suffit-elle ? Un Mac M4 peut-il le faire ?

La réponse pourrait vous surprendre. La version complète FP16 du modèle 70B exige 140 Go de VRAM — hors de portée pour le matériel grand public. Mais la quantification abaisse le seuil à environ 40 Go, et la donne devient soudain intéressante.

Cet article compare trois approches courantes avec des données de test : AMD 5700XT (le favori des bricoleurs), Mac M4 (l’avantage décisif de la mémoire unifiée) et NVIDIA CUDA (l’écosystème historique). En cinq minutes, vous saurez quelle option vous convient.

Les vrais besoins en VRAM pour Llama 70B

La quantification, en résumé, consiste à « compresser » le modèle. En FP16, chaque paramètre occupe 2 octets ; 70 milliards de paramètres — 140 Go de VRAM. Même avec les 24 Go d’une RTX 4090, ce n’est pas suffisant.

La solution : les versions quantifiées au format GGUF.

Comment choisir le niveau de quantification ?

Les niveaux de quantification diffèrent fortement en consommation mémoire :

NiveauBesoin VRAMPerte de précisionCas d’usage
Q8_0~75 GoMinimaleRecherche, recherche de précision
Q6_K~55 GoFaible64 Go+ de RAM
Q5_K_M~45 GoAcceptableMac 64 Go de RAM
Q4_K_M~35-40 GoBon compromisMatériel grand public
Q3_K_M~30 GoNotableCompression extrême

Je recommande Q4_K_M. Ce niveau offre un bon équilibre entre précision et consommation mémoire. Q3 fonctionne aussi, mais la perte de qualité se ressent — réponses moins fiables, raisonnement affaibli. Q5 et au-delà sont meilleurs, mais exigent plus de VRAM.

N’oubliez pas le KV Cache. Pendant l’inférence, le modèle stocke le contexte ; comptez environ 5 Go supplémentaires. En pratique, pour Q4_K_M, prévoyez 40-45 Go de mémoire disponible.

Comparaison des trois configurations matérielles

Voici le tableau synthétique. Les données proviennent du forum Reddit LocalLLaMA et de plusieurs blogs techniques.

SolutionVRAM / RAMModèles exécutablesPerf. 70B Q4Fourchette de prixDifficulté
AMD 5700XT8 Go VRAM7B complet, 12B partielNon recommandéOccasion 150-200 $Élevée
Mac M4 Max128 Go mémoire unifiée70B Q4/Q520-28 tok/s3500 $+Faible
NVIDIA RTX 409024 Go VRAM32B complet, 70B offload18 tok/s (offload)1500-2000 $Moyenne
NVIDIA RTX 509032 Go VRAMTentative 70B Q4 en carte unique / offloadSelon le contexte2000 $+Moyenne

AMD 5700XT : le cauchemar des bricoleurs

Franchement, faire tourner Llama 70B sur une 5700XT revient à forcer la machine. Avec 8 Go de VRAM, même un 7B Q4 tient à peine ; le 70B est hors de question. Certains insistent quand même — j’ai moi-même testé les contournements ROCm.

Résultat : instabilité. Le modèle démarre, puis plante sans prévenir. AMD ne supporte officiellement pas ROCm sur RDNA1 (architecture de la 5700XT). On s’appuie sur des overrides communautaires :

HSA_OVERRIDE_GFX_VERSION=10.1.0

Cette astuce trompe ROCm, mais les performances restent médiocres et la stabilité faible. Pour apprendre et expérimenter, pourquoi pas. Pour un usage sérieux, passez votre chemin.

Mac M4 : la mémoire unifiée comme atout majeur

L’architecture mémoire unifiée d’Apple Silicon change la donne pour les grands modèles. Sur un M4 Max 128 Go, RAM système et VRAM partagent le même pool — pas de « VRAM insuffisante, offload vers la RAM ».

Les chiffres sont convaincants : 20-28 tok/s, très confortable en inférence locale. La configuration est simple : installez Ollama ou utilisez MLX, quelques commandes suffisent.

Seul bémol : le prix. Un M4 Max démarre à 3500 $+. Mais si vous avez déjà besoin d’un Mac pour d’autres tâches, l’exécution d’un grand modèle devient un bonus raisonnable.

NVIDIA CUDA : écosystème mature, offload pour les grands modèles

Les 24 Go d’une RTX 4090 gèrent largement un 32B. Pour le 70B, ce n’est pas assez : il faut l’offload — une partie des couches sur le GPU, le reste en RAM système.

Ça fonctionne, mais la vitesse baisse. Comptez environ 18 tok/s, un peu en dessous du Mac M4 Max, à cause des allers-retours CPU-GPU.

La RTX 5090 est désormais commercialisée avec 32 Go de GDDR7. C’est une meilleure candidate que la RTX 4090 pour tenter Llama 70B Q4 sur une seule carte, mais les longs contextes et l’overhead peuvent encore imposer de l’offload ; prix et disponibilité varient.

L’avantage de CUDA, c’est l’écosystème. Fine-tuning ? La chaîne d’outils NVIDIA est la plus aboutie. PyTorch et Hugging Face privilégient CUDA. Apple Silicon et AMD ne rivalisent pas sur ce terrain.

Comment choisir la bonne solution

Suivez ce processus étape par étape :

Étape 1 : inventorier votre matériel

Vous avez déjà une 5700XT ?

  • Testez les contournements ROCm, mais préparez-vous à bricoler
  • En pratique, seuls les modèles 7B tournent correctement (12B nécessite déjà un offload partiel)
  • Convient à ceux qui veulent comprendre ROCm et accepter les échecs

Vous avez déjà un Mac ?

  • Vérifiez la RAM : 64 Go pour Llama 70B Q5, 128 Go pour plus de confort
  • M4 Pro/Max offrent de meilleures performances ; la version M4 de base reste utilisable
  • Lancez un test : le taux de réussite est élevé

Vous partez de zéro ?

  • Passez à l’étape budget

Étape 2 : le budget oriente le choix

BudgetSolution recommandéeRemarque
< 500 $5700XT d’occasion ou Mac Mini M4 entrée de gamme5700XT risquée ; M4 16 Go ne gère que les petits modèles
500-2000 $RTX 4090 ou Mac Mini M4 ProRTX 4090 via offload pour 70B ; M4 Pro 24 Go convient plutôt aux 7B/13B et à certains 32B
2000 $+RTX 5090 ou Mac Studio M4 MaxFine-tuning → NVIDIA ; inférence pure → Mac

Étape 3 : quel est votre objectif ?

Juste essayer ?

  • Tout matériel capable de faire tourner un 7B suffit. Pas besoin de viser le 70B pour découvrir l’inférence locale.

Usage quotidien, stabilité ?

  • La gamme Mac M4 est la plus sereine. Installez le logiciel et c’est prêt — pas de versions CUDA ni de config ROCm.

Fine-tuning et entraînement ?

  • NVIDIA CUDA, sans hésiter. Écosystème, tutoriels et pièges maîtrisés.

Vitesse d’inférence maximale ?

  • MLX sur Mac M4 Max bat llama.cpp de 30 à 50 % — détail ci-dessous.

Pour la plupart des utilisateurs — usage régulier, configuration simple — Mac prend l’avantage. Pas de pilotes graphiques à chiner, pas de soucis de compatibilité : prêt à l’emploi.

MLX vs llama.cpp sur Mac

Les utilisateurs Mac ont une question supplémentaire : MLX ou llama.cpp ?

Comparaison des performances

D’après les tests de Compute Market :

ScénarioMLXllama.cppÉcart
Prompt court (<512 tokens)Plus rapideRéférenceMLX +30-50 %
Prompt long (>2048 tokens)RéférencePlus rapidellama.cpp légèrement devant
Vitesse globale~25 tok/s~20 tok/sMLX en tête

MLX est le framework optimisé par Apple pour Silicon, avec accès direct à l’accélération Metal. llama.cpp est multi-plateforme ; il supporte Metal, mais moins profondément que MLX.

Comment choisir ?

Inférence pure, vitesse prioritaire ?

  • MLX. La commande mlx_lm.generate suffit : configuration simple, bon débit.

Compatibilité avec l’écosystème llama.cpp ?

  • Outils tiers basés sur llama.cpp, ou même fichier GGUF sur plusieurs appareils → llama.cpp. Meilleure compatibilité, toutes plateformes.

Vous hésitez ?

  • Testez les deux. L’installation est rapide ; un essai concret vaut mieux qu’une longue comparaison théorique.

Je privilégie MLX : mon usage principal est l’inférence locale, la vitesse prime. La compatibilité outillage n’est pas mon critère décisif.

Conclusion

Tableau de décision rapide :

Votre situationSolution recommandéePourquoi
Mac existant (64 Go+ RAM)Utilisez-le, choisissez MLXLe plus simple, bonnes performances
Pas de matériel, budget < 500 $Mac Mini M4 entrée de gammePlus stable qu’une 5700XT
Budget 500-2000 $, stabilitéMac Mini M4 Pro ou RTX 409024 Go conviennent mieux aux 7B/13B ; 70B demande 64 Go+ ou offload
Budget 2000 $+, fine-tuningRTX 4090/5090Écosystème CUDA mature
Apprendre ROCm en bricolant5700XT d’occasionPeu cher, mais préparez-vous aux galères

En une phrase : Mac pour la sérénité, CUDA pour l’écosystème complet, AMD pour le rapport qualité-prix au prix de la complexité.

Pour un usage « sérieux » sans perdre de temps en configuration → Mac. Budget serré et envie de bricoler → 5700XT, sans viser le 70B. Fine-tuning → NVIDIA CUDA, point final.

Prêt à essayer ? Sur Mac, installez Ollama ou MLX et lancez un 7B pour commencer. Sans Mac, vérifiez d’abord si votre matériel actuel gère un petit modèle — le 70B n’est pas le point de départ ; l’essentiel est de démarrer.

FAQ

De combien de VRAM ai-je besoin pour exécuter Llama 70B ?
La version complète FP16 requiert 140 Go ; la version quantifiée Q4_K_M en demande 35-40 Go. Avec le KV Cache, comptez 40-45 Go de mémoire disponible.
Mac M4 ou NVIDIA : lequel est le plus adapté aux grands modèles ?
Pour l'inférence pure, choisissez Mac (stable et simple) ; pour le fine-tuning, NVIDIA (écosystème complet). Mac M4 Max atteint 20-28 tok/s, RTX 4090 en offload environ 18 tok/s.
Quel matériel choisir avec un budget limité ?
Budget 500-2000 $ : RTX 4090 ou Mac Mini M4 Pro pour 7B/13B et certains 32B. Pour un 70B Q4 stable, privilégiez un Mac avec 64 Go+ de mémoire unifiée ou deux RTX 3090. La RTX 5090 est meilleure pour une tentative en carte unique, mais peut encore exiger de l'offload ; en dessous de 500 $, évitez une 5700XT d'occasion.
Une AMD 5700XT peut-elle exécuter Llama 70B ?
Non. 8 Go de VRAM ne suffisent que pour un modèle 7B, et ROCm ne prend pas officiellement en charge l'architecture RDNA1 ; les contournements restent instables.
Sur Mac, MLX ou llama.cpp ?
Pour les prompts courts, MLX est plus rapide (30-50 % d'avance) ; pour les longs prompts, llama.cpp l'emporte légèrement. Choisissez llama.cpp pour la compatibilité multi-plateforme, MLX pour l'inférence pure.

7 min de lecture · Publié le: 28 mai 2026 · Mis à jour le: 27 juil. 2026

Commentaires

Connectez-vous avec GitHub pour laisser un commentaire

Easton BlogEaston Blog