Accélération GPU Ollama : guide pratique CUDA, ROCm et Metal sur toutes les plateformes

Mise à jour du 2026-06-08 : revérifié avec la doc officielle de support matériel d’Ollama — AMD ROCm exige désormais officiellement ROCm v7/HIP7 sous Linux et Windows (ce n’est plus une preview réservée à Windows), et Apple Silicon est passé à un backend MLX dans Ollama 0.19 (preview, mars 2026), activable via OLLAMA_BACKEND=mlx. Les commandes et chiffres ci-dessous sont mis à jour en conséquence.
Les mots défilent ligne par ligne dans le terminal — je regarde l’horloge : 47 secondes. C’est le temps pour faire tourner Llama 3 8B sur un vieux portable, CPU à fond, ventilateur en hurlant, environ 5 tokens par seconde. Expérience assez dissuasive : je voulais m’en servir pour m’aider à coder, mais le temps d’attente suffisait à aller chercher la réponse sur Google.
Puis j’ai installé la même carte dans un PC fixe, avec les pilotes CUDA — même modèle, mêmes paramètres — 3 secondes.
Ce n’est pas exagéré : d’une minute à quelques secondes. Ce sentiment de « j’ai posé ma question, je veux la réponse maintenant » revient enfin.
Cet article vise à vous aider à configurer l’accélération GPU d’Ollama. Que vous soyez sur NVIDIA, AMD ou Apple Silicon, je détaille la configuration, la vérification et comment sortir des impasses. Gagnez ce temps d’attente pour faire des choses plus intéressantes.
L’accélération GPU en chiffres : de 30 secondes à 3 secondes
Conclusion d’abord : avec un GPU, l’inférence locale peut être 10 à 20 fois plus rapide. Ce n’est pas du marketing — ce sont mes mesures et le consensus de la communauté.
Vous vous demandez peut-être : le CPU ne suffit pas ? Pourquoi se compliquer avec le GPU ?
Ça tourne, oui, mais l’expérience n’a rien à voir. En CPU sur un modèle 7B, comptez 3-8 tokens/s ; une réponse de 500 mots prend 20-60 secondes. En GPU, 40-80 tokens/s — quelques secondes. Ce n’est pas « un peu plus rapide », c’est le passage de « utilisable » à « vraiment pratique ».
Votre carte est-elle compatible ?
Ollama prend en charge trois plateformes GPU, chacune avec ses exigences :
Cartes NVIDIA : les plus répandues et les plus simples. Compute Capability 5.0+ requis — en pratique, GTX 900 et au-delà. GTX 1060, RTX 3060, RTX 4090, tout ça fonctionne. J’ai une RTX 3060 12 Go : les modèles jusqu’à 14B passent sans souci.
Cartes AMD : un peu plus de travail, mais ça tourne. Linux et Windows exigent désormais tous deux la pile de pilotes ROCm v7 / HIP7 (Windows est pris en charge officiellement, ce n’est plus une preview). Les modèles RX 6000 et RX 7000 sont stables ; les toutes dernières cartes RDNA4 (RX 9000, gfx1200/1201) peuvent nécessiter des builds plus récents ou un remplacement manuel de bibliothèque, et les anciennes cartes des réglages supplémentaires.
Apple Silicon : M1/M2/M3/M4 entièrement supportés, activation automatique. Les utilisateurs Mac n’ont quasi rien à configurer — Metal s’active dès l’installation d’Ollama. Depuis 2026, le backend MLX offre un gain supplémentaire.
Assez de VRAM ?
Point souvent négligé : la VRAM est une contrainte dure pour l’inférence GPU.
Ordre de grandeur : un modèle 7B en quantification 4-bit ≈ 5-6 Go de VRAM ; 14B ≈ 10-12 Go ; 70B ≈ 40 Go+. La VRAM de votre carte fixe directement la taille du modèle. Ma RTX 3060 12 Go gère Llama 3 8B confortablement ; Mixtral 8x7B, c’est serré — une partie tombe en RAM CPU.
Avant de configurer le GPU, identifiez modèle de carte et taille de VRAM.
NVIDIA CUDA : la solution la plus simple (avec quelques pièges)
Si vous avez une carte NVIDIA, la configuration est probablement la plus facile des trois plateformes.
Vérifier que les pilotes sont installés
Ouvrez un terminal et tapez :
nvidia-smi
Si un tableau s’affiche avec modèle, VRAM et version du pilote, c’est bon. Ollama détecte et utilise CUDA automatiquement — pas besoin d’installer le CUDA Toolkit séparément : Ollama embarque les bibliothèques nécessaires.
Si la commande est introuvable, installez les pilotes. Sous Ubuntu :
sudo apt install nvidia-driver-535 # ou une version plus récente
Redémarrez, puis relancez nvidia-smi.
Plusieurs cartes ?
Si le modèle tient entièrement dans la VRAM disponible d’un seul GPU, Ollama le charge sur cette carte afin de limiter les transferts sur le bus PCI. Il ne le répartit automatiquement entre les GPU disponibles que lorsqu’aucune carte ne suffit. Vous pouvez néanmoins sélectionner des cartes précises pour en réserver une à d’autres tâches :
# Utiliser uniquement la carte 0
export CUDA_VISIBLE_DEVICES=0
# Utiliser les cartes 0 et 2
export CUDA_VISIBLE_DEVICES=0,2
Ajoutez la ligne à ~/.bashrc ou à la config systemd pour la persistance.
Ollama dans Docker ?
Docker n’expose pas le GPU par défaut — configuration supplémentaire requise.
Avec le nvidia-container-toolkit officiel :
# Installer le toolkit
sudo apt install nvidia-container-toolkit
# Configurer le runtime Docker
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
Lancez le conteneur Ollama avec --gpus all :
docker run -d --gpus all -v ollama:/root/.ollama -p 11434:11434 ollama/ollama
Confirmer que le GPU est utilisé
Pendant l’exécution d’un modèle, dans un autre terminal :
ollama ps
La sortie indique le modèle en cours et l’utilisation GPU. Une ligne du type GPU: 100% confirme l’accélération.
nvidia-smi -l 1 permet aussi de surveiller la VRAM en temps réel — elle doit monter nettement pendant l’inférence.
AMD ROCm : un peu plus de configuration, même vitesse une fois lancé
Je connais la frustration AMD — la plupart des tutos parlent NVIDIA, la doc ROCm est fragmentée. Bonne nouvelle : le support ROCm d’Ollama est bien plus stable ; il faut juste quelques étapes de plus.
Sous Linux : ROCm v7
Sur Ubuntu 22.04 ou plus récent, l’installation reste raisonnable :
# Ajouter le dépôt AMD officiel
sudo apt update
sudo apt install amdgpu-install
sudo amdgpu-install --usecase=rocm
# Ajouter l'utilisateur au groupe render
sudo usermod -aG render,video $USER
# Redémarrer
sudo reboot
Après redémarrage, rocminfo doit lister votre GPU. Installez Ollama — la version AMD détecte ROCm sans config additionnelle.
Sous Windows : désormais pris en charge officiellement
Le support AMD sous Windows a beaucoup mûri cette année. Ollama exige maintenant la pile ROCm v7 / HIP7 sous Windows aussi (installez AMD Adrenalin), et non plus l’ancienne preview v6.1. Les RX 7000/6000 tournent le plus souvent directement ; les toutes dernières cartes RDNA4 (RX 9000, gfx1200/1201) peuvent buter sur des lacunes de kernels et demander un build plus récent ou un remplacement manuel de bibliothèque.
Si une carte très récente refuse de démarrer, repliez-vous sur WSL2 + Ubuntu pour Ollama — souvent plus stable.
Anciennes cartes : HSA_OVERRIDE
Les architectures AMD ont des noms complexes ; ROCm ne supporte officiellement que les plus récentes (gfx900, gfx1030…). Une RX 580 (gfx803) n’est pas reconnue par défaut.
Forcer la compatibilité :
export HSA_OVERRIDE_GFX_VERSION=10.3.0 # mode compatibilité gfx1030
Pas garanti partout, mais efficace sur pas mal de cartes anciennes. Sinon, retour CPU.
Configuration multi-GPU
Comme NVIDIA :
export ROCR_VISIBLE_DEVICES=0,1 # cartes 0 et 1
Numéros des cartes via rocm-smi.
Architectures AMD courantes
| Modèle carte | Architecture | Support ROCm |
|---|---|---|
| RX 7900 XTX | gfx1100 | Natif |
| RX 6800 XT | gfx1030 | Natif |
| RX 5700 XT | gfx1010 | Natif |
| RX 580 | gfx803 | HSA_OVERRIDE requis |
| Vega 56/64 | gfx900 | Natif |
La config AMD demande plus d’essais que NVIDIA ; une fois en place, les perfs sont comparables.
Apple Metal : le bonus caché pour les Mac
Sur Apple Silicon (M1/M2/M3/M4) : rien à configurer.
Vraiment rien. Installez Ollama, lancez un modèle — Metal s’active automatiquement. Le framework Metal est intégré à Ollama ; le système charge le modèle sur le GPU.
Performances des puces M
Mesures communautaires :
- M1/M2 8 Go : modèle 7B, ~15-20 tok/s
- M2 Pro 16 Go : modèle 14B, ~25-30 tok/s
- M3 Max 36 Go : modèles 30B+, 30+ tok/s
Loin d’un RTX 4090 « réponse instantanée », mais largement suffisant pour l’aide au code, la traduction ou la relecture.
Nouveauté 2026 : backend MLX
Depuis Ollama 0.19 (publié en preview en mars 2026), l’inférence sur Apple Silicon ne passe plus par llama.cpp mais par le framework MLX d’Apple — il exploite directement la mémoire unifiée et supprime l’étape de copie CPU↔GPU.
D’après les chiffres d’Ollama, MLX accélère le décodage d’environ 1,6 à 2x (int4 : ~85 → ~134 tok/s) et réduit le temps jusqu’au premier token. Sur M5/M5 Pro/M5 Max, il exploite aussi les nouveaux GPU Neural Accelerators.
La plupart du temps, rien à activer : à partir de 0.19+, Apple Silicon utilise MLX automatiquement. Pour le forcer explicitement (ou déboguer), démarrez le serveur avec la variable d’environnement :
OLLAMA_BACKEND=mlx ollama serve
Deux réserves : MLX est encore en preview et réclame 32 Go+ de mémoire unifiée pour être stable ; seules certaines architectures de modèles sont prises en charge — les autres repassent silencieusement sur Metal.
Vérifier que le GPU travaille
Moniteur d’activité → Historique GPU. Pendant l’inférence, l’utilisation GPU doit monter. Si seul le CPU bouge, Metal n’est probablement pas actif — rare ; une réinstallation d’Ollama règle souvent le problème.
Échec de détection GPU : dépannage courant
Configurer le matériel, c’est souvent tomber dans des pièges. Voici ce que j’ai rencontré.
Problème 1 : no compatible GPUs were discovered
Ollama ne trouve aucune carte utilisable.
Causes possibles :
- Pilotes absents ou trop anciens
- Modèle non supporté (ex. GTX 700)
- Conteneur Docker sans accès GPU
Étapes :
# NVIDIA : pilotes
nvidia-smi
# AMD : ROCm
rocminfo
# Si erreur, installer les pilotes d'abord
Problème 2 : Not compiled with GPU offload support
Version Ollama sans support GPU.
Solution : retélécharger la bonne version sur le site. Sous AMD, la build ROCm a un lien distinct — ne pas confondre avec CUDA.
Problème 3 : Pilote NVIDIA trop ancien
Minimum pilote 450+. En dessous, CUDA ne fonctionne pas.
# Version actuelle
nvidia-smi | grep "Driver Version"
# Mise à jour si nécessaire
sudo apt install nvidia-driver-535
Problème 4 : Pilote amdgpu manquant (Linux)
ROCm requiert le pilote amdgpu. Certains systèmes chargent encore l’ancien radeon.
# Pilote chargé
lsmod | grep amdgpu
# Si vide
sudo apt install amdgpu-dkms
Problème 5 : SELinux bloque l’accès GPU du conteneur
Sur CentOS/RHEL, SELinux peut empêcher l’accès GPU.
Temporaire :
sudo setenforce 0
Permanent : ajuster la politique SELinux (doc Red Hat) — ou passer à Ubuntu, plus simple.
Commandes de vérification
# 1. Carte reconnue par le système
nvidia-smi # NVIDIA
rocminfo # AMD
system_profiler SPDisplaysDataType # macOS
# 2. État du processus Ollama
ollama ps
# 3. Surveillance GPU (pendant l'inférence)
watch -n 1 nvidia-smi # NVIDIA
rocm-smi -a # AMD
# 4. Variables d'environnement
echo $CUDA_VISIBLE_DEVICES
echo $ROCR_VISIBLE_DEVICES
La plupart des problèmes se localisent avec ces commandes. Sinon, cherchez dans les Issues GitHub d’Ollama.
Pour aller plus loin
- Guide de sélection matérielle Ollama pour LLM local
- Guide complet d’optimisation des performances Ollama
- Ordonnancement multi-GPU Ollama en pratique
En résumé
Tableau rapide :
| Plateforme | Prérequis | Difficulté | Recommandation |
|---|---|---|---|
| NVIDIA | Pilote 450+ | Simple (quasi zéro config) | Premier choix |
| AMD (Linux) | ROCm v7 | Moyenne (quelques commandes) | Deuxième choix |
| AMD (Windows) | Pilote ROCm v7 / HIP7 | Moyenne (RDNA4 récents : patchs possibles) | Deuxième choix |
| Apple Silicon | Aucun | La plus simple | Idéal pour Mac |
L’accélération GPU se configure une fois, profite longtemps. Du « ça tourne » en CPU au « c’est fluide » en GPU, l’écart est réel. Quelle plateforme utilisez-vous ? Des blocages en config ? Partagez en commentaire — je répondrai autant que possible.
Configuration de l'accélération GPU Ollama
Processus complet de configuration GPU sur les trois plateformes
⏱️ Estimated time: 30 min
- 1
Step 1: Identifier la carte et les pilotes
Selon votre type de carte, choisissez la méthode de vérification :
- NVIDIA : exécutez nvidia-smi pour voir les infos carte
- AMD : exécutez rocminfo pour confirmer la reconnaissance ROCm
- macOS : aucune vérification nécessaire, Metal s'active automatiquement - 2
Step 2: Configuration NVIDIA CUDA
La solution la plus simple — installez les pilotes et c'est tout :
1. Pilotes : sudo apt install nvidia-driver-535
2. Redémarrez le système
3. Vérification : nvidia-smi doit afficher les infos carte
4. Ollama détecte CUDA automatiquement, sans config supplémentaire - 3
Step 3: Configuration AMD ROCm (Linux)
Installation de ROCm v7 :
1. Installation : sudo apt install amdgpu-install
2. Configuration : sudo amdgpu-install --usecase=rocm
3. Permissions : sudo usermod -aG render,video $USER
4. Après redémarrage, vérifiez avec rocminfo
5. Anciennes cartes : export HSA_OVERRIDE_GFX_VERSION=10.3.0 - 4
Step 4: Vérifier que l'accélération GPU est active
Confirmez que le GPU travaille pendant l'exécution du modèle :
- Exécutez ollama ps pour voir l'utilisation GPU
- NVIDIA : nvidia-smi -l 1 en temps réel
- AMD : rocm-smi -a en temps réel
- macOS : Moniteur d'activité, onglet Historique GPU - 5
Step 5: Configuration multi-GPU
Spécifier quelles cartes utiliser :
- NVIDIA : export CUDA_VISIBLE_DEVICES=0,2
- AMD : export ROCR_VISIBLE_DEVICES=0,1
- Ajoutez la variable à ~/.bashrc pour la persistance
FAQ
Quelles plateformes GPU Ollama prend-il en charge ?
Que faire si ma VRAM est insuffisante ?
Comment confirmer que l'accélération GPU fonctionne ?
Une ancienne carte AMD (ex. RX 580) peut-elle fonctionner ?
Comment utiliser le GPU dans un conteneur Docker ?
Comment activer le backend MLX sur Apple Silicon ?
Que faire en cas d'erreur « no compatible GPUs were discovered » ?
9 min de lecture · Publié le: 25 avr. 2026 · Mis à jour le: 30 juil. 2026
Guide Ollama LLM local
Si vous arrivez depuis la recherche, le plus rapide est de passer à l’article précédent ou suivant de cette série.
Précédent
Tableau de sélection matérielle Ollama : guide VRAM, quantification et GPU (2026)
Un tableau complet de sélection matérielle Ollama : besoins VRAM pour les modèles 7B/13B/70B, comparaison des quantifications Q4/Q8, et les trois accélérateurs NVIDIA CUDA, AMD ROCm et Apple Metal. Recommandations par niveau, du RTX 3060 au 5090, pour faire correspondre carte graphique et modèle.
Partie 6 sur 18
Suivant
Planification GPU Ollama et gestion des ressources : optimisation VRAM, équilibrage multi-GPU
Analyse approfondie de la planification GPU et de la gestion des ressources Ollama : paramètres d'optimisation VRAM, architecture d'équilibrage multi-GPU, principes llama.cpp. Trois cas réels pour stabiliser les grands modèles et exploiter plusieurs cartes.
Partie 8 sur 18



Commentaires
Connectez-vous avec GitHub pour laisser un commentaire