Tableau de sélection matérielle Ollama : guide VRAM, quantification et GPU (2026)

Vous voulez faire tourner un modèle 7B en local : combien de VRAM faut-il vraiment ? Et pour un 13B ? Certains disent que 8 Go suffisent, d’autres qu’il en faut au moins 16 — à qui faire confiance ?
Cette question m’a occupé pendant des mois. L’année dernière, en découvrant Ollama, j’ai acheté une RTX 3060 12 Go en me disant que « 12 Go, ça devrait aller ». Résultat sur un 13B : saturation VRAM, vitesse tombée à 3 tokens/s, comme une page web qui charge au ralenti.
J’ai compris ensuite : la limite VRAM est une limite dure. La franchir, c’est l’enfer ; rester en dessous, c’est le ciel.
Cet article regroupe les cartes courantes, les tailles de modèles et les niveaux de quantification dans des tableaux comparatifs. À la fin, vous saurez quels modèles votre GPU peut exécuter et quelle carte correspond à votre budget.
1. Tableau central : besoins VRAM en un coup d’œil
Commençons par la formule. Le besoin VRAM se résume à peu près à :
Besoin VRAM ≈ paramètres (B) × bits de quantification ÷ 8 + KV Cache (1-2 Go)
La formule est simple, mais elle fixe la taille maximale du modèle. Exemple : un 7B en Q4 (4 bits) donne environ 7 × 4 ÷ 8 = 3,5 Go ; avec KV Cache et marge d’exécution, comptez 4 à 6 Go en pratique.
Voici le tableau complet — à garder sous la main :
| Taille du modèle | Q4_K_M | Q5_K_M | Q8_0 | FP16 | Carte recommandée |
|---|---|---|---|---|---|
| 7B | 4-6 Go | 5-6 Go | 7-8 Go | 14 Go | RTX 3060 12 Go |
| 13B | 8-10 Go | 10-12 Go | 13-14 Go | 26 Go | RTX 4060 Ti 16 Go |
| 32B | 20-24 Go | 24-28 Go | 32-36 Go | 64 Go | RTX 4090 24 Go |
| 70B | 40-48 Go | 48-56 Go | 70-80 Go | 140 Go | Deux RTX 3090 / Mac M4 Max 128 Go |
Point clé du tableau : en cas de VRAM insuffisante, les performances chutent de 5 à 20 fois.
J’ai testé une RTX 3060 12 Go sur un 13B en Q4_K_M. La VRAM tenait juste à la limite — parfois ça passait, parfois saturation. Quand Ollama bascule une partie des données en RAM système, la vitesse passe de 45 tokens/s à 2-3 tokens/s. Comme passer d’une sportive à un tricycle.
À l’achat, mieux vaut 2 Go de marge en plus que de coller exactement au seuil.
2. Quantification : Q4 vs Q5 vs Q8 en pratique
La quantification est le levier principal pour réduire la VRAM.
Le FP16 stocke chaque paramètre sur 16 bits. Le Q4 compresse à 4 bits et divise le besoin mémoire par deux environ. La question : est-ce que la compression nuit à la qualité ?
Oui — mais moins que vous ne le pensez.
Données mesurées :
| Niveau de quantification | VRAM modèle 7B | Perte de qualité | Cas d’usage |
|---|---|---|---|
| Q4_K_M | 4,5 Go | 1-3 % | Usage quotidien (recommandé) |
| Q5_K_M | 5,7 Go | <1 % | Recherche de précision |
| Q8_0 | 7,7 Go | <0,5 % | Qualité maximale |
| FP16 | 14 Go | 0 % | Recherche / référence |
Q4_K_M est le choix par défaut. Perte de 1 à 3 %, rarement perceptible. J’ai rédigé des articles techniques avec Llama 3.1 8B en Q4_K_M : face au FP16, la différence est difficile à voir.
Q5_K_M convient avec 16 Go+ de VRAM. Sur une RTX 4060 Ti 16 Go, Q5 améliore le raisonnement mathématique et les longs textes.
Q8_0 approche la qualité native. Sauf évaluation ou recherche, peu d’intérêt : VRAM doublée pour un gain limité.
À éviter : Q3 et Q2. Perte de qualité nette, réponses incohérentes. Sauf VRAM vraiment contrainte (4 Go), à ne pas utiliser.
Recommandation : commencez par Q4_K_M ; passez à Q5 si la qualité ne suffit pas. Dans la majorité des cas, Q4 suffit.
3. Trois accélérateurs : CUDA vs Metal vs ROCm
Le choix ne se limite pas à la VRAM : l’accélération compte aussi.
Ollama prend en charge quatre backends GPU : NVIDIA CUDA, Apple Metal, AMD ROCm et Vulkan. Chacun a ses forces ; un mauvais choix peut diviser les performances par deux.
Tableau comparatif :
| Accélération | Matériel | Perf. 7B | Systèmes | Maturité |
|---|---|---|---|---|
| CUDA | GPU NVIDIA | 30-80 tok/s | Win/Linux | ★★★★★ |
| Metal | Apple M1-M4 | 20-50 tok/s | macOS | ★★★★★ |
| ROCm | AMD RX 7000 | 25-60 tok/s | surtout Linux | ★★★☆☆ |
| Vulkan | AMD/Intel | 15-40 tok/s | multiplateforme | ★★★☆☆ |
CUDA : le choix le plus fiable
NVIDIA CUDA est aujourd’hui la solution la plus mature. Pilotes stables, communauté large, documentation complète. Ollama détecte CUDA automatiquement, sans configuration complexe.
Ma RTX 3060 avec CUDA sur Llama 3.1 8B Q4 tourne autour de 45 tokens/s. Fluide et réactif.
Le seul inconvénient : le prix. Les cartes NVIDIA sont chères ; une RTX 4090 tourne autour de 1 800 $.
Metal : le choix des utilisateurs Mac
Apple Metal performe bien sur Mac. M1 à M4 sont pris en charge ; la mémoire unifiée permet de charger des modèles plus grands en partageant VRAM et RAM.
L’accélération Apple Metal est l’avantage clé sur Mac. Sur Apple Silicon, Ollama utilise Metal automatiquement ; avec assez de mémoire unifiée, la configuration reste simple.
OLLAMA_ORIGINS n’est pas un interrupteur de performance. La variable configure les origines navigateur/CORS autorisées et n’active pas MLX :
# Ollama utilise Metal automatiquement sur Apple Silicon
# OLLAMA_ORIGINS autorise seulement des origines navigateur supplémentaires pour l’API Ollama
ollama serve
Prérequis : au moins 32 Go de mémoire unifiée. En dessous de 16 Go, les gros modèles peinent.
ROCm : le parcours difficile d’AMD
AMD ROCm est correct sous Linux ; sous Windows, c’est plus laborieux. Support officiel Linux ; version Windows encore expérimentale, bugs et compatibilité limités.
Carte AMD + Windows : préférez Vulkan :
OLLAMA_VULKAN=1 ollama serve
Vulkan est multiplateforme ; un peu plus lent que CUDA, mais stable.
Conseil : sans envie de bricolage, NVIDIA CUDA. Sur Mac, Metal automatique. Côté AMD : Linux + ROCm, ou Windows + Vulkan.
4. Recommandations par modèle de GPU : de l’entrée de gamme au flagship
Tableau par budget.
Entrée de gamme (budget 200-400 $)
| Modèle | VRAM | Modèles adaptés | Performance | Prix |
|---|---|---|---|---|
| RTX 3060 12 Go | 12 Go | 7B Q4, 13B Q4 | 40-60 tok/s | 250 $ |
| RX 6600 8 Go | 8 Go | 7B Q4 | 30-45 tok/s | 200 $ |
La RTX 3060 12 Go est le meilleur choix d’entrée. 12 Go pour 7B et 13B en Q4, excellent rapport qualité-prix. Question fréquente : RTX 4060 8 Go ou RTX 3060 12 Go pour les LLM ?
Réponse claire : 3060 12 Go. La 4060 calcule plus vite, mais 8 Go de VRAM bloquent un 13B.
La RX 6600 convient si le budget est très serré et que vous ne visez que du 7B. Sous Windows, Vulkan demande plus de configuration qu’NVIDIA.
Milieu de gamme (budget 400-800 $)
| Modèle | VRAM | Modèles adaptés | Performance | Prix |
|---|---|---|---|---|
| RTX 4060 Ti 16 Go | 16 Go | 13B Q4/Q8, 14B Q4 | 50-80 tok/s | 400 $ |
| RTX 4070 Super 12 Go | 12 Go | 7B Q8, 13B Q4 | 60-90 tok/s | 600 $ |
La RTX 4060 Ti 16 Go est mon modèle le plus recommandé. 16 Go au bon endroit : 13B en Q8 ou 14B en Q4, pour environ 400 $.
La RTX 4070 Super est plus rapide mais limitée à 12 Go : 13B Q4 max. Vitesse avant tout → 4070 Super ; taille de modèle → 4060 Ti 16 Go.
Haut de gamme (budget 1 200-2 000 $)
| Modèle | VRAM | Modèles adaptés | Performance | Prix |
|---|---|---|---|---|
| RTX 4090 24 Go | 24 Go | 32B Q4, 70B avec offload* | 80-150 tok/s | 1 800 $ |
| RTX 5090 32 Go | 32 Go | 32B Q8, 70B Q4 avec offload* | Selon le modèle | 2 000 $ |
| RX 7900 XTX 24 Go | 24 Go | 32B Q4 | 60-100 tok/s | 900 $ |
*Note : une carte seule de 24/32 Go exige de l’offload et/ou une quantification plus agressive pour du 70B. Pour un 70B Q4 plus stable, deux RTX 3090 ou 48 Go+ de mémoire sont plus réalistes.
La RTX 4090 reste le flagship actuel : 32B Q4 sans problème ; 70B avec offload, quantification plus poussée ou double carte.
La RTX 5090 32 Go (2026) dispose officiellement de 32 Go de GDDR7. Elle est meilleure qu’une 4090 pour tenter du 70B Q4 sur une seule carte, mais les longs contextes et l’overhead peuvent encore imposer de l’offload ; ne la considérez pas comme une solution complète pour 70B Q5/Q8.
La RX 7900 XTX offre 24 Go pour environ 900 $, mais ROCm sous Windows reste instable ; plutôt pour Linux.
Recommandations Mac
| Puce | Mémoire unifiée | Modèles adaptés | Performance |
|---|---|---|---|
| M4 Pro | 24 Go | 14B Q4 | 35-55 tok/s |
| M4 Max | 128 Go | 70B Q4 | 28-30 tok/s |
| M3 Ultra | 192 Go | 70B+, multi-modèles | 25-35 tok/s |
La mémoire unifiée Mac permet des modèles plus grands. Un M4 Max 128 Go exécute un 70B Q4 complet sans compromis de quantification.
En revanche, la vitesse : un M4 Max sur 70B tourne autour de 28-30 tok/s, bien en dessous d’une RTX 4090. Vitesse → NVIDIA ; intégrité du modèle et simplicité → Mac.
Meilleur rapport qualité-prix : RTX 3090 24 Go d’occasion
Option souvent oubliée : RTX 3090 24 Go d’occasion.
Sur le marché d’occasion, environ 600 $. Une seule carte de 24 Go convient très bien à 32B Q4 ; pour viser 70B Q4, deux 3090 sont plus réalistes, ou il faut accepter un offload lourd et une quantification plus agressive. Moins rapide qu’une 4090, mais la moitié du prix.
Un proche utilise une 3090 d’occasion depuis plus d’un an sans souci — à condition de choisir un vendeur fiable et d’éviter les cartes de minage.
5. Processus de décision d’achat
Après ces quatre chapitres, trop de tableaux ? Voici un parcours simple.
Étape 1 : définir le modèle cible
Quel modèle voulez-vous exécuter ?
- Dialogue quotidien, rédaction : 7B suffit (Llama 3.1 8B, Qwen 2.5 7B)
- Code, Q&R technique : 13B-14B (Qwen 2.5 14B, DeepSeek Coder)
- Raisonnement complexe, longs textes : 32B-70B (DeepSeek V3, Qwen 2.5 72B)
La plupart visent 7B ou 13B. Le 70B n’est utile que pour des besoins spécifiques.
Étape 2 : choisir la quantification
- VRAM serrée : Q4_K_M (par défaut)
- VRAM confortable : Q5_K_M (plus de précision)
- Recherche / comparaison : Q8_0 ou FP16
Commencez par Q4_K_M : qualité suffisante dans la majorité des cas, besoin mémoire réduit.
Étape 3 : croiser avec le tableau VRAM
Revenez au tableau du chapitre 1 pour votre combinaison modèle + quantification.
Exemple : Llama 3.1 8B en Q4_K_M → 4-6 Go. Prévoyez au moins 8 Go de VRAM (marge de 2 Go).
Étape 4 : choisir la carte selon le budget
- Budget 200-400 $ : RTX 3060 12 Go
- Budget 400-800 $ : RTX 4060 Ti 16 Go
- Budget 1 200 $+ : RTX 4090 24 Go ou RTX 5090 32 Go
- Utilisateurs Mac : M4 Max 128 Go
Étape 5 : vérifier la plateforme
- Windows : NVIDIA CUDA le plus stable ; AMD → Vulkan
- Linux : CUDA NVIDIA et ROCm AMD stables
- macOS : Apple Metal automatique ; vérifiez surtout la capacité de mémoire unifiée
Exemple de décision
Objectif : Llama 3.3 70B.
- Modèle : 70B
- Quantification : Q4_K_M (rapport qualité-prix)
- VRAM : 40-48 Go (tableau)
- Budget : environ 1 500 $
- Plateforme : Windows
Analyse :
- RTX 4090 24 Go : insuffisante seule ; double carte ou quantification agressive
- RTX 5090 32 Go : meilleure candidate en carte unique pour tenter 70B Q4, mais les longs contextes peuvent encore exiger de l’offload
- Deux RTX 3090 24 Go d’occasion : ~1 200 $, 48 Go, bon rapport qualité-prix
- Mac M4 Max 128 Go : exécution complète, vitesse plus faible
Recommandation finale : budget serré → deux RTX 3090 d’occasion ; confort CUDA en carte unique → RTX 5090 32 Go ; utilisateur Mac → M4 Max 128 Go, meilleure option monoposte pour un 70B complet.
Synthèse
La logique du choix matériel en une phrase : la VRAM fixe le plafond, la quantification fixe le plancher.
Un tableau, une liste de recommandations, trois accélérateurs comparés — les hésitations devraient être levées.
Si vous hésitez encore, retenez cette règle :
- Budget limité : RTX 3060 12 Go, entrée de gamme, 7B et 13B
- Performance : RTX 4090 24 Go ou 4060 Ti 16 Go, du milieu de gamme au flagship
- Mac : M4 Max 128 Go, seule option monoposte pour un 70B complet
- Meilleur rapport qualité-prix : RTX 3090 24 Go d’occasion, excellente pour 32B sur une carte ; pour 70B, utilisez deux cartes
Pour aller plus loin avec Ollama, consultez le guide d’accélération GPU et le guide de gestion des modèles.
FAQ
Combien de VRAM faut-il réellement pour un modèle 7B ?
RTX 3060 12 Go ou RTX 4060 8 Go : laquelle convient le mieux aux LLM ?
La quantification Q4 dégrade-t-elle nettement la qualité du modèle ?
Une carte AMD peut-elle faire tourner Ollama ?
Comment obtenir les meilleures performances sur Mac ?
Budget serré mais besoin d'un modèle 70B : que faire ?
9 min de lecture · Publié le: 28 mai 2026 · Mis à jour le: 27 juil. 2026
Guide Ollama LLM local
Si vous arrivez depuis la recherche, le plus rapide est de passer à l’article précédent ou suivant de cette série.
Précédent
Llama 70B en local : guide comparatif 5700XT, Mac M4 et CUDA
Vous voulez exécuter Llama 70B en local ? Cet article compare trois solutions — AMD 5700XT, Mac M4 et NVIDIA CUDA — avec des données de test pour choisir le matériel adapté : besoins en VRAM, performances et pièges à éviter.
Partie 5 sur 18
Suivant
Accélération GPU Ollama : guide pratique CUDA, ROCm et Metal sur toutes les plateformes
Guide complet de l'accélération GPU Ollama : configuration NVIDIA CUDA, AMD ROCm et Apple Metal, avec étapes de vérification, réglage multi-GPU et dépannage pour multiplier par 10 à 20 la vitesse d'inférence LLM locale.
Partie 7 sur 18



Commentaires
Connectez-vous avec GitHub pour laisser un commentaire