Changer le thème

Tableau de sélection matérielle Ollama : guide VRAM, quantification et GPU (2026)

Easton editorial illustration: central VRAM capacity gauge matching 7B, 13B, and 70B model blocks to CUDA, ROCm, and Metal docks
4-6 Go
Besoin VRAM 7B Q4
Fonctionne sur une carte d'entrée de gamme
40-48 Go
Besoin VRAM 70B Q4
Nécessite 48 Go+ de mémoire ou double GPU
Automatique
Accélération Metal sur Mac
Aucun interrupteur supplémentaire sur Apple Silicon
数据来源: Données de tests et documentation officielle

Vous voulez faire tourner un modèle 7B en local : combien de VRAM faut-il vraiment ? Et pour un 13B ? Certains disent que 8 Go suffisent, d’autres qu’il en faut au moins 16 — à qui faire confiance ?

Cette question m’a occupé pendant des mois. L’année dernière, en découvrant Ollama, j’ai acheté une RTX 3060 12 Go en me disant que « 12 Go, ça devrait aller ». Résultat sur un 13B : saturation VRAM, vitesse tombée à 3 tokens/s, comme une page web qui charge au ralenti.

J’ai compris ensuite : la limite VRAM est une limite dure. La franchir, c’est l’enfer ; rester en dessous, c’est le ciel.

Cet article regroupe les cartes courantes, les tailles de modèles et les niveaux de quantification dans des tableaux comparatifs. À la fin, vous saurez quels modèles votre GPU peut exécuter et quelle carte correspond à votre budget.

1. Tableau central : besoins VRAM en un coup d’œil

Commençons par la formule. Le besoin VRAM se résume à peu près à :

Besoin VRAM ≈ paramètres (B) × bits de quantification ÷ 8 + KV Cache (1-2 Go)

La formule est simple, mais elle fixe la taille maximale du modèle. Exemple : un 7B en Q4 (4 bits) donne environ 7 × 4 ÷ 8 = 3,5 Go ; avec KV Cache et marge d’exécution, comptez 4 à 6 Go en pratique.

Voici le tableau complet — à garder sous la main :

Taille du modèleQ4_K_MQ5_K_MQ8_0FP16Carte recommandée
7B4-6 Go5-6 Go7-8 Go14 GoRTX 3060 12 Go
13B8-10 Go10-12 Go13-14 Go26 GoRTX 4060 Ti 16 Go
32B20-24 Go24-28 Go32-36 Go64 GoRTX 4090 24 Go
70B40-48 Go48-56 Go70-80 Go140 GoDeux RTX 3090 / Mac M4 Max 128 Go

Point clé du tableau : en cas de VRAM insuffisante, les performances chutent de 5 à 20 fois.

J’ai testé une RTX 3060 12 Go sur un 13B en Q4_K_M. La VRAM tenait juste à la limite — parfois ça passait, parfois saturation. Quand Ollama bascule une partie des données en RAM système, la vitesse passe de 45 tokens/s à 2-3 tokens/s. Comme passer d’une sportive à un tricycle.

À l’achat, mieux vaut 2 Go de marge en plus que de coller exactement au seuil.

2. Quantification : Q4 vs Q5 vs Q8 en pratique

La quantification est le levier principal pour réduire la VRAM.

Le FP16 stocke chaque paramètre sur 16 bits. Le Q4 compresse à 4 bits et divise le besoin mémoire par deux environ. La question : est-ce que la compression nuit à la qualité ?

Oui — mais moins que vous ne le pensez.

Données mesurées :

Niveau de quantificationVRAM modèle 7BPerte de qualitéCas d’usage
Q4_K_M4,5 Go1-3 %Usage quotidien (recommandé)
Q5_K_M5,7 Go<1 %Recherche de précision
Q8_07,7 Go<0,5 %Qualité maximale
FP1614 Go0 %Recherche / référence

Q4_K_M est le choix par défaut. Perte de 1 à 3 %, rarement perceptible. J’ai rédigé des articles techniques avec Llama 3.1 8B en Q4_K_M : face au FP16, la différence est difficile à voir.

Q5_K_M convient avec 16 Go+ de VRAM. Sur une RTX 4060 Ti 16 Go, Q5 améliore le raisonnement mathématique et les longs textes.

Q8_0 approche la qualité native. Sauf évaluation ou recherche, peu d’intérêt : VRAM doublée pour un gain limité.

À éviter : Q3 et Q2. Perte de qualité nette, réponses incohérentes. Sauf VRAM vraiment contrainte (4 Go), à ne pas utiliser.

Recommandation : commencez par Q4_K_M ; passez à Q5 si la qualité ne suffit pas. Dans la majorité des cas, Q4 suffit.

3. Trois accélérateurs : CUDA vs Metal vs ROCm

Le choix ne se limite pas à la VRAM : l’accélération compte aussi.

Ollama prend en charge quatre backends GPU : NVIDIA CUDA, Apple Metal, AMD ROCm et Vulkan. Chacun a ses forces ; un mauvais choix peut diviser les performances par deux.

Tableau comparatif :

AccélérationMatérielPerf. 7BSystèmesMaturité
CUDAGPU NVIDIA30-80 tok/sWin/Linux★★★★★
MetalApple M1-M420-50 tok/smacOS★★★★★
ROCmAMD RX 700025-60 tok/ssurtout Linux★★★☆☆
VulkanAMD/Intel15-40 tok/smultiplateforme★★★☆☆

CUDA : le choix le plus fiable

NVIDIA CUDA est aujourd’hui la solution la plus mature. Pilotes stables, communauté large, documentation complète. Ollama détecte CUDA automatiquement, sans configuration complexe.

Ma RTX 3060 avec CUDA sur Llama 3.1 8B Q4 tourne autour de 45 tokens/s. Fluide et réactif.

Le seul inconvénient : le prix. Les cartes NVIDIA sont chères ; une RTX 4090 tourne autour de 1 800 $.

Metal : le choix des utilisateurs Mac

Apple Metal performe bien sur Mac. M1 à M4 sont pris en charge ; la mémoire unifiée permet de charger des modèles plus grands en partageant VRAM et RAM.

L’accélération Apple Metal est l’avantage clé sur Mac. Sur Apple Silicon, Ollama utilise Metal automatiquement ; avec assez de mémoire unifiée, la configuration reste simple.

OLLAMA_ORIGINS n’est pas un interrupteur de performance. La variable configure les origines navigateur/CORS autorisées et n’active pas MLX :

# Ollama utilise Metal automatiquement sur Apple Silicon
# OLLAMA_ORIGINS autorise seulement des origines navigateur supplémentaires pour l’API Ollama
ollama serve

Prérequis : au moins 32 Go de mémoire unifiée. En dessous de 16 Go, les gros modèles peinent.

ROCm : le parcours difficile d’AMD

AMD ROCm est correct sous Linux ; sous Windows, c’est plus laborieux. Support officiel Linux ; version Windows encore expérimentale, bugs et compatibilité limités.

Carte AMD + Windows : préférez Vulkan :

OLLAMA_VULKAN=1 ollama serve

Vulkan est multiplateforme ; un peu plus lent que CUDA, mais stable.

Conseil : sans envie de bricolage, NVIDIA CUDA. Sur Mac, Metal automatique. Côté AMD : Linux + ROCm, ou Windows + Vulkan.

4. Recommandations par modèle de GPU : de l’entrée de gamme au flagship

Tableau par budget.

Entrée de gamme (budget 200-400 $)

ModèleVRAMModèles adaptésPerformancePrix
RTX 3060 12 Go12 Go7B Q4, 13B Q440-60 tok/s250 $
RX 6600 8 Go8 Go7B Q430-45 tok/s200 $

La RTX 3060 12 Go est le meilleur choix d’entrée. 12 Go pour 7B et 13B en Q4, excellent rapport qualité-prix. Question fréquente : RTX 4060 8 Go ou RTX 3060 12 Go pour les LLM ?

Réponse claire : 3060 12 Go. La 4060 calcule plus vite, mais 8 Go de VRAM bloquent un 13B.

La RX 6600 convient si le budget est très serré et que vous ne visez que du 7B. Sous Windows, Vulkan demande plus de configuration qu’NVIDIA.

Milieu de gamme (budget 400-800 $)

ModèleVRAMModèles adaptésPerformancePrix
RTX 4060 Ti 16 Go16 Go13B Q4/Q8, 14B Q450-80 tok/s400 $
RTX 4070 Super 12 Go12 Go7B Q8, 13B Q460-90 tok/s600 $

La RTX 4060 Ti 16 Go est mon modèle le plus recommandé. 16 Go au bon endroit : 13B en Q8 ou 14B en Q4, pour environ 400 $.

La RTX 4070 Super est plus rapide mais limitée à 12 Go : 13B Q4 max. Vitesse avant tout → 4070 Super ; taille de modèle → 4060 Ti 16 Go.

Haut de gamme (budget 1 200-2 000 $)

ModèleVRAMModèles adaptésPerformancePrix
RTX 4090 24 Go24 Go32B Q4, 70B avec offload*80-150 tok/s1 800 $
RTX 5090 32 Go32 Go32B Q8, 70B Q4 avec offload*Selon le modèle2 000 $
RX 7900 XTX 24 Go24 Go32B Q460-100 tok/s900 $

*Note : une carte seule de 24/32 Go exige de l’offload et/ou une quantification plus agressive pour du 70B. Pour un 70B Q4 plus stable, deux RTX 3090 ou 48 Go+ de mémoire sont plus réalistes.

La RTX 4090 reste le flagship actuel : 32B Q4 sans problème ; 70B avec offload, quantification plus poussée ou double carte.

La RTX 5090 32 Go (2026) dispose officiellement de 32 Go de GDDR7. Elle est meilleure qu’une 4090 pour tenter du 70B Q4 sur une seule carte, mais les longs contextes et l’overhead peuvent encore imposer de l’offload ; ne la considérez pas comme une solution complète pour 70B Q5/Q8.

La RX 7900 XTX offre 24 Go pour environ 900 $, mais ROCm sous Windows reste instable ; plutôt pour Linux.

Recommandations Mac

PuceMémoire unifiéeModèles adaptésPerformance
M4 Pro24 Go14B Q435-55 tok/s
M4 Max128 Go70B Q428-30 tok/s
M3 Ultra192 Go70B+, multi-modèles25-35 tok/s

La mémoire unifiée Mac permet des modèles plus grands. Un M4 Max 128 Go exécute un 70B Q4 complet sans compromis de quantification.

En revanche, la vitesse : un M4 Max sur 70B tourne autour de 28-30 tok/s, bien en dessous d’une RTX 4090. Vitesse → NVIDIA ; intégrité du modèle et simplicité → Mac.

Meilleur rapport qualité-prix : RTX 3090 24 Go d’occasion

Option souvent oubliée : RTX 3090 24 Go d’occasion.

Sur le marché d’occasion, environ 600 $. Une seule carte de 24 Go convient très bien à 32B Q4 ; pour viser 70B Q4, deux 3090 sont plus réalistes, ou il faut accepter un offload lourd et une quantification plus agressive. Moins rapide qu’une 4090, mais la moitié du prix.

Un proche utilise une 3090 d’occasion depuis plus d’un an sans souci — à condition de choisir un vendeur fiable et d’éviter les cartes de minage.

5. Processus de décision d’achat

Après ces quatre chapitres, trop de tableaux ? Voici un parcours simple.

Étape 1 : définir le modèle cible

Quel modèle voulez-vous exécuter ?

  • Dialogue quotidien, rédaction : 7B suffit (Llama 3.1 8B, Qwen 2.5 7B)
  • Code, Q&R technique : 13B-14B (Qwen 2.5 14B, DeepSeek Coder)
  • Raisonnement complexe, longs textes : 32B-70B (DeepSeek V3, Qwen 2.5 72B)

La plupart visent 7B ou 13B. Le 70B n’est utile que pour des besoins spécifiques.

Étape 2 : choisir la quantification

  • VRAM serrée : Q4_K_M (par défaut)
  • VRAM confortable : Q5_K_M (plus de précision)
  • Recherche / comparaison : Q8_0 ou FP16

Commencez par Q4_K_M : qualité suffisante dans la majorité des cas, besoin mémoire réduit.

Étape 3 : croiser avec le tableau VRAM

Revenez au tableau du chapitre 1 pour votre combinaison modèle + quantification.

Exemple : Llama 3.1 8B en Q4_K_M → 4-6 Go. Prévoyez au moins 8 Go de VRAM (marge de 2 Go).

Étape 4 : choisir la carte selon le budget

  • Budget 200-400 $ : RTX 3060 12 Go
  • Budget 400-800 $ : RTX 4060 Ti 16 Go
  • Budget 1 200 $+ : RTX 4090 24 Go ou RTX 5090 32 Go
  • Utilisateurs Mac : M4 Max 128 Go

Étape 5 : vérifier la plateforme

  • Windows : NVIDIA CUDA le plus stable ; AMD → Vulkan
  • Linux : CUDA NVIDIA et ROCm AMD stables
  • macOS : Apple Metal automatique ; vérifiez surtout la capacité de mémoire unifiée

Exemple de décision

Objectif : Llama 3.3 70B.

  1. Modèle : 70B
  2. Quantification : Q4_K_M (rapport qualité-prix)
  3. VRAM : 40-48 Go (tableau)
  4. Budget : environ 1 500 $
  5. Plateforme : Windows

Analyse :

  • RTX 4090 24 Go : insuffisante seule ; double carte ou quantification agressive
  • RTX 5090 32 Go : meilleure candidate en carte unique pour tenter 70B Q4, mais les longs contextes peuvent encore exiger de l’offload
  • Deux RTX 3090 24 Go d’occasion : ~1 200 $, 48 Go, bon rapport qualité-prix
  • Mac M4 Max 128 Go : exécution complète, vitesse plus faible

Recommandation finale : budget serré → deux RTX 3090 d’occasion ; confort CUDA en carte unique → RTX 5090 32 Go ; utilisateur Mac → M4 Max 128 Go, meilleure option monoposte pour un 70B complet.

Synthèse

La logique du choix matériel en une phrase : la VRAM fixe le plafond, la quantification fixe le plancher.

Un tableau, une liste de recommandations, trois accélérateurs comparés — les hésitations devraient être levées.

Si vous hésitez encore, retenez cette règle :

  • Budget limité : RTX 3060 12 Go, entrée de gamme, 7B et 13B
  • Performance : RTX 4090 24 Go ou 4060 Ti 16 Go, du milieu de gamme au flagship
  • Mac : M4 Max 128 Go, seule option monoposte pour un 70B complet
  • Meilleur rapport qualité-prix : RTX 3090 24 Go d’occasion, excellente pour 32B sur une carte ; pour 70B, utilisez deux cartes

Pour aller plus loin avec Ollama, consultez le guide d’accélération GPU et le guide de gestion des modèles.

FAQ

Combien de VRAM faut-il réellement pour un modèle 7B ?
En quantification Q4_K_M, comptez 4 à 6 Go, plus le KV Cache et la marge d'exécution : prévoyez au moins une carte avec 8 Go de VRAM.
RTX 3060 12 Go ou RTX 4060 8 Go : laquelle convient le mieux aux LLM ?
La 3060 12 Go. La 4060 est plus puissante en calcul, mais 8 Go de VRAM est un plafond dur : un modèle 13B saturera la mémoire. La VRAM compte plus que la puissance de calcul.
La quantification Q4 dégrade-t-elle nettement la qualité du modèle ?
Non. Q4_K_M n'entraîne qu'une perte de 1 à 3 %, imperceptible dans la plupart des cas. Sauf pour l'évaluation de modèles, Q4 suffit.
Une carte AMD peut-elle faire tourner Ollama ?
Oui. Sous Linux, ROCm est assez stable ; sous Windows, préférez Vulkan (définir OLLAMA_VULKAN=1).
Comment obtenir les meilleures performances sur Mac ?
Sur Apple Silicon, Ollama utilise Metal automatiquement. N’utilisez pas OLLAMA_ORIGINS comme interrupteur MLX : cette variable configure seulement les origines navigateur/CORS autorisées. Pour une accélération MLX, utilisez un runtime MLX séparé.
Budget serré mais besoin d'un modèle 70B : que faire ?
Deux RTX 3090 24 Go d'occasion = 48 Go de VRAM pour environ 1 200 $, le meilleur rapport qualité-prix. Ou un Mac M4 Max 128 Go en solution monoposte.

9 min de lecture · Publié le: 28 mai 2026 · Mis à jour le: 27 juil. 2026

Commentaires

Connectez-vous avec GitHub pour laisser un commentaire

Easton BlogEaston Blog