Llama 70B en local : guide comparatif 5700XT, Mac M4 et CUDA

Vous voulez exécuter Llama 70B en local ? Votre AMD 5700XT 8 Go de VRAM suffit-elle ? Un Mac M4 peut-il le faire ?
La réponse pourrait vous surprendre. La version complète FP16 du modèle 70B exige 140 Go de VRAM — hors de portée pour le matériel grand public. Mais la quantification abaisse le seuil à environ 40 Go, et la donne devient soudain intéressante.
Cet article compare trois approches courantes avec des données de test : AMD 5700XT (le favori des bricoleurs), Mac M4 (l’avantage décisif de la mémoire unifiée) et NVIDIA CUDA (l’écosystème historique). En cinq minutes, vous saurez quelle option vous convient.
Les vrais besoins en VRAM pour Llama 70B
La quantification, en résumé, consiste à « compresser » le modèle. En FP16, chaque paramètre occupe 2 octets ; 70 milliards de paramètres — 140 Go de VRAM. Même avec les 24 Go d’une RTX 4090, ce n’est pas suffisant.
La solution : les versions quantifiées au format GGUF.
Comment choisir le niveau de quantification ?
Les niveaux de quantification diffèrent fortement en consommation mémoire :
| Niveau | Besoin VRAM | Perte de précision | Cas d’usage |
|---|---|---|---|
| Q8_0 | ~75 Go | Minimale | Recherche, recherche de précision |
| Q6_K | ~55 Go | Faible | 64 Go+ de RAM |
| Q5_K_M | ~45 Go | Acceptable | Mac 64 Go de RAM |
| Q4_K_M | ~35-40 Go | Bon compromis | Matériel grand public |
| Q3_K_M | ~30 Go | Notable | Compression extrême |
Je recommande Q4_K_M. Ce niveau offre un bon équilibre entre précision et consommation mémoire. Q3 fonctionne aussi, mais la perte de qualité se ressent — réponses moins fiables, raisonnement affaibli. Q5 et au-delà sont meilleurs, mais exigent plus de VRAM.
N’oubliez pas le KV Cache. Pendant l’inférence, le modèle stocke le contexte ; comptez environ 5 Go supplémentaires. En pratique, pour Q4_K_M, prévoyez 40-45 Go de mémoire disponible.
Comparaison des trois configurations matérielles
Voici le tableau synthétique. Les données proviennent du forum Reddit LocalLLaMA et de plusieurs blogs techniques.
| Solution | VRAM / RAM | Modèles exécutables | Perf. 70B Q4 | Fourchette de prix | Difficulté |
|---|---|---|---|---|---|
| AMD 5700XT | 8 Go VRAM | 7B complet, 12B partiel | Non recommandé | Occasion 150-200 $ | Élevée |
| Mac M4 Max | 128 Go mémoire unifiée | 70B Q4/Q5 | 20-28 tok/s | 3500 $+ | Faible |
| NVIDIA RTX 4090 | 24 Go VRAM | 32B complet, 70B offload | 18 tok/s (offload) | 1500-2000 $ | Moyenne |
| NVIDIA RTX 5090 | 32 Go VRAM | Tentative 70B Q4 en carte unique / offload | Selon le contexte | 2000 $+ | Moyenne |
AMD 5700XT : le cauchemar des bricoleurs
Franchement, faire tourner Llama 70B sur une 5700XT revient à forcer la machine. Avec 8 Go de VRAM, même un 7B Q4 tient à peine ; le 70B est hors de question. Certains insistent quand même — j’ai moi-même testé les contournements ROCm.
Résultat : instabilité. Le modèle démarre, puis plante sans prévenir. AMD ne supporte officiellement pas ROCm sur RDNA1 (architecture de la 5700XT). On s’appuie sur des overrides communautaires :
HSA_OVERRIDE_GFX_VERSION=10.1.0
Cette astuce trompe ROCm, mais les performances restent médiocres et la stabilité faible. Pour apprendre et expérimenter, pourquoi pas. Pour un usage sérieux, passez votre chemin.
Mac M4 : la mémoire unifiée comme atout majeur
L’architecture mémoire unifiée d’Apple Silicon change la donne pour les grands modèles. Sur un M4 Max 128 Go, RAM système et VRAM partagent le même pool — pas de « VRAM insuffisante, offload vers la RAM ».
Les chiffres sont convaincants : 20-28 tok/s, très confortable en inférence locale. La configuration est simple : installez Ollama ou utilisez MLX, quelques commandes suffisent.
Seul bémol : le prix. Un M4 Max démarre à 3500 $+. Mais si vous avez déjà besoin d’un Mac pour d’autres tâches, l’exécution d’un grand modèle devient un bonus raisonnable.
NVIDIA CUDA : écosystème mature, offload pour les grands modèles
Les 24 Go d’une RTX 4090 gèrent largement un 32B. Pour le 70B, ce n’est pas assez : il faut l’offload — une partie des couches sur le GPU, le reste en RAM système.
Ça fonctionne, mais la vitesse baisse. Comptez environ 18 tok/s, un peu en dessous du Mac M4 Max, à cause des allers-retours CPU-GPU.
La RTX 5090 est désormais commercialisée avec 32 Go de GDDR7. C’est une meilleure candidate que la RTX 4090 pour tenter Llama 70B Q4 sur une seule carte, mais les longs contextes et l’overhead peuvent encore imposer de l’offload ; prix et disponibilité varient.
L’avantage de CUDA, c’est l’écosystème. Fine-tuning ? La chaîne d’outils NVIDIA est la plus aboutie. PyTorch et Hugging Face privilégient CUDA. Apple Silicon et AMD ne rivalisent pas sur ce terrain.
Comment choisir la bonne solution
Suivez ce processus étape par étape :
Étape 1 : inventorier votre matériel
Vous avez déjà une 5700XT ?
- Testez les contournements ROCm, mais préparez-vous à bricoler
- En pratique, seuls les modèles 7B tournent correctement (12B nécessite déjà un offload partiel)
- Convient à ceux qui veulent comprendre ROCm et accepter les échecs
Vous avez déjà un Mac ?
- Vérifiez la RAM : 64 Go pour Llama 70B Q5, 128 Go pour plus de confort
- M4 Pro/Max offrent de meilleures performances ; la version M4 de base reste utilisable
- Lancez un test : le taux de réussite est élevé
Vous partez de zéro ?
- Passez à l’étape budget
Étape 2 : le budget oriente le choix
| Budget | Solution recommandée | Remarque |
|---|---|---|
| < 500 $ | 5700XT d’occasion ou Mac Mini M4 entrée de gamme | 5700XT risquée ; M4 16 Go ne gère que les petits modèles |
| 500-2000 $ | RTX 4090 ou Mac Mini M4 Pro | RTX 4090 via offload pour 70B ; M4 Pro 24 Go convient plutôt aux 7B/13B et à certains 32B |
| 2000 $+ | RTX 5090 ou Mac Studio M4 Max | Fine-tuning → NVIDIA ; inférence pure → Mac |
Étape 3 : quel est votre objectif ?
Juste essayer ?
- Tout matériel capable de faire tourner un 7B suffit. Pas besoin de viser le 70B pour découvrir l’inférence locale.
Usage quotidien, stabilité ?
- La gamme Mac M4 est la plus sereine. Installez le logiciel et c’est prêt — pas de versions CUDA ni de config ROCm.
Fine-tuning et entraînement ?
- NVIDIA CUDA, sans hésiter. Écosystème, tutoriels et pièges maîtrisés.
Vitesse d’inférence maximale ?
- MLX sur Mac M4 Max bat llama.cpp de 30 à 50 % — détail ci-dessous.
Pour la plupart des utilisateurs — usage régulier, configuration simple — Mac prend l’avantage. Pas de pilotes graphiques à chiner, pas de soucis de compatibilité : prêt à l’emploi.
MLX vs llama.cpp sur Mac
Les utilisateurs Mac ont une question supplémentaire : MLX ou llama.cpp ?
Comparaison des performances
D’après les tests de Compute Market :
| Scénario | MLX | llama.cpp | Écart |
|---|---|---|---|
| Prompt court (<512 tokens) | Plus rapide | Référence | MLX +30-50 % |
| Prompt long (>2048 tokens) | Référence | Plus rapide | llama.cpp légèrement devant |
| Vitesse globale | ~25 tok/s | ~20 tok/s | MLX en tête |
MLX est le framework optimisé par Apple pour Silicon, avec accès direct à l’accélération Metal. llama.cpp est multi-plateforme ; il supporte Metal, mais moins profondément que MLX.
Comment choisir ?
Inférence pure, vitesse prioritaire ?
- MLX. La commande
mlx_lm.generatesuffit : configuration simple, bon débit.
Compatibilité avec l’écosystème llama.cpp ?
- Outils tiers basés sur llama.cpp, ou même fichier GGUF sur plusieurs appareils → llama.cpp. Meilleure compatibilité, toutes plateformes.
Vous hésitez ?
- Testez les deux. L’installation est rapide ; un essai concret vaut mieux qu’une longue comparaison théorique.
Je privilégie MLX : mon usage principal est l’inférence locale, la vitesse prime. La compatibilité outillage n’est pas mon critère décisif.
Conclusion
Tableau de décision rapide :
| Votre situation | Solution recommandée | Pourquoi |
|---|---|---|
| Mac existant (64 Go+ RAM) | Utilisez-le, choisissez MLX | Le plus simple, bonnes performances |
| Pas de matériel, budget < 500 $ | Mac Mini M4 entrée de gamme | Plus stable qu’une 5700XT |
| Budget 500-2000 $, stabilité | Mac Mini M4 Pro ou RTX 4090 | 24 Go conviennent mieux aux 7B/13B ; 70B demande 64 Go+ ou offload |
| Budget 2000 $+, fine-tuning | RTX 4090/5090 | Écosystème CUDA mature |
| Apprendre ROCm en bricolant | 5700XT d’occasion | Peu cher, mais préparez-vous aux galères |
En une phrase : Mac pour la sérénité, CUDA pour l’écosystème complet, AMD pour le rapport qualité-prix au prix de la complexité.
Pour un usage « sérieux » sans perdre de temps en configuration → Mac. Budget serré et envie de bricoler → 5700XT, sans viser le 70B. Fine-tuning → NVIDIA CUDA, point final.
Prêt à essayer ? Sur Mac, installez Ollama ou MLX et lancez un 7B pour commencer. Sans Mac, vérifiez d’abord si votre matériel actuel gère un petit modèle — le 70B n’est pas le point de départ ; l’essentiel est de démarrer.
FAQ
De combien de VRAM ai-je besoin pour exécuter Llama 70B ?
Mac M4 ou NVIDIA : lequel est le plus adapté aux grands modèles ?
Quel matériel choisir avec un budget limité ?
Une AMD 5700XT peut-elle exécuter Llama 70B ?
Sur Mac, MLX ou llama.cpp ?
7 min de lecture · Publié le: 28 mai 2026 · Mis à jour le: 27 juil. 2026
Guide Ollama LLM local
Si vous arrivez depuis la recherche, le plus rapide est de passer à l’article précédent ou suivant de cette série.
Précédent
Paramètres Modelfile Ollama : guide complet pour créer des modèles personnalisés
Guide détaillé des 10 paramètres clés du Modelfile Ollama, avec conseils d'optimisation pour temperature, num_ctx, etc. Quatre modèles prêts à l'emploi pour créer votre modèle personnalisé.
Partie 4 sur 18
Suivant
Tableau de sélection matérielle Ollama : guide VRAM, quantification et GPU (2026)
Un tableau complet de sélection matérielle Ollama : besoins VRAM pour les modèles 7B/13B/70B, comparaison des quantifications Q4/Q8, et les trois accélérateurs NVIDIA CUDA, AMD ROCm et Apple Metal. Recommandations par niveau, du RTX 3060 au 5090, pour faire correspondre carte graphique et modèle.
Partie 6 sur 18



Commentaires
Connectez-vous avec GitHub pour laisser un commentaire