Changer le thème

Accélération GPU Ollama : guide pratique CUDA, ROCm et Metal sur toutes les plateformes

Easton editorial illustration: one local-model engine connected to three GPU acceleration lanes

Mise à jour du 2026-06-08 : revérifié avec la doc officielle de support matériel d’Ollama — AMD ROCm exige désormais officiellement ROCm v7/HIP7 sous Linux et Windows (ce n’est plus une preview réservée à Windows), et Apple Silicon est passé à un backend MLX dans Ollama 0.19 (preview, mars 2026), activable via OLLAMA_BACKEND=mlx. Les commandes et chiffres ci-dessous sont mis à jour en conséquence.

Les mots défilent ligne par ligne dans le terminal — je regarde l’horloge : 47 secondes. C’est le temps pour faire tourner Llama 3 8B sur un vieux portable, CPU à fond, ventilateur en hurlant, environ 5 tokens par seconde. Expérience assez dissuasive : je voulais m’en servir pour m’aider à coder, mais le temps d’attente suffisait à aller chercher la réponse sur Google.

Puis j’ai installé la même carte dans un PC fixe, avec les pilotes CUDA — même modèle, mêmes paramètres — 3 secondes.

Ce n’est pas exagéré : d’une minute à quelques secondes. Ce sentiment de « j’ai posé ma question, je veux la réponse maintenant » revient enfin.

Cet article vise à vous aider à configurer l’accélération GPU d’Ollama. Que vous soyez sur NVIDIA, AMD ou Apple Silicon, je détaille la configuration, la vérification et comment sortir des impasses. Gagnez ce temps d’attente pour faire des choses plus intéressantes.

L’accélération GPU en chiffres : de 30 secondes à 3 secondes

Conclusion d’abord : avec un GPU, l’inférence locale peut être 10 à 20 fois plus rapide. Ce n’est pas du marketing — ce sont mes mesures et le consensus de la communauté.

Vous vous demandez peut-être : le CPU ne suffit pas ? Pourquoi se compliquer avec le GPU ?

Ça tourne, oui, mais l’expérience n’a rien à voir. En CPU sur un modèle 7B, comptez 3-8 tokens/s ; une réponse de 500 mots prend 20-60 secondes. En GPU, 40-80 tokens/s — quelques secondes. Ce n’est pas « un peu plus rapide », c’est le passage de « utilisable » à « vraiment pratique ».

Votre carte est-elle compatible ?

Ollama prend en charge trois plateformes GPU, chacune avec ses exigences :

Cartes NVIDIA : les plus répandues et les plus simples. Compute Capability 5.0+ requis — en pratique, GTX 900 et au-delà. GTX 1060, RTX 3060, RTX 4090, tout ça fonctionne. J’ai une RTX 3060 12 Go : les modèles jusqu’à 14B passent sans souci.

Cartes AMD : un peu plus de travail, mais ça tourne. Linux et Windows exigent désormais tous deux la pile de pilotes ROCm v7 / HIP7 (Windows est pris en charge officiellement, ce n’est plus une preview). Les modèles RX 6000 et RX 7000 sont stables ; les toutes dernières cartes RDNA4 (RX 9000, gfx1200/1201) peuvent nécessiter des builds plus récents ou un remplacement manuel de bibliothèque, et les anciennes cartes des réglages supplémentaires.

Apple Silicon : M1/M2/M3/M4 entièrement supportés, activation automatique. Les utilisateurs Mac n’ont quasi rien à configurer — Metal s’active dès l’installation d’Ollama. Depuis 2026, le backend MLX offre un gain supplémentaire.

Assez de VRAM ?

Point souvent négligé : la VRAM est une contrainte dure pour l’inférence GPU.

Ordre de grandeur : un modèle 7B en quantification 4-bit ≈ 5-6 Go de VRAM ; 14B ≈ 10-12 Go ; 70B ≈ 40 Go+. La VRAM de votre carte fixe directement la taille du modèle. Ma RTX 3060 12 Go gère Llama 3 8B confortablement ; Mixtral 8x7B, c’est serré — une partie tombe en RAM CPU.

Avant de configurer le GPU, identifiez modèle de carte et taille de VRAM.

NVIDIA CUDA : la solution la plus simple (avec quelques pièges)

Si vous avez une carte NVIDIA, la configuration est probablement la plus facile des trois plateformes.

Vérifier que les pilotes sont installés

Ouvrez un terminal et tapez :

nvidia-smi

Si un tableau s’affiche avec modèle, VRAM et version du pilote, c’est bon. Ollama détecte et utilise CUDA automatiquement — pas besoin d’installer le CUDA Toolkit séparément : Ollama embarque les bibliothèques nécessaires.

Si la commande est introuvable, installez les pilotes. Sous Ubuntu :

sudo apt install nvidia-driver-535  # ou une version plus récente

Redémarrez, puis relancez nvidia-smi.

Plusieurs cartes ?

Si le modèle tient entièrement dans la VRAM disponible d’un seul GPU, Ollama le charge sur cette carte afin de limiter les transferts sur le bus PCI. Il ne le répartit automatiquement entre les GPU disponibles que lorsqu’aucune carte ne suffit. Vous pouvez néanmoins sélectionner des cartes précises pour en réserver une à d’autres tâches :

# Utiliser uniquement la carte 0
export CUDA_VISIBLE_DEVICES=0

# Utiliser les cartes 0 et 2
export CUDA_VISIBLE_DEVICES=0,2

Ajoutez la ligne à ~/.bashrc ou à la config systemd pour la persistance.

Ollama dans Docker ?

Docker n’expose pas le GPU par défaut — configuration supplémentaire requise.

Avec le nvidia-container-toolkit officiel :

# Installer le toolkit
sudo apt install nvidia-container-toolkit

# Configurer le runtime Docker
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Lancez le conteneur Ollama avec --gpus all :

docker run -d --gpus all -v ollama:/root/.ollama -p 11434:11434 ollama/ollama

Confirmer que le GPU est utilisé

Pendant l’exécution d’un modèle, dans un autre terminal :

ollama ps

La sortie indique le modèle en cours et l’utilisation GPU. Une ligne du type GPU: 100% confirme l’accélération.

nvidia-smi -l 1 permet aussi de surveiller la VRAM en temps réel — elle doit monter nettement pendant l’inférence.

AMD ROCm : un peu plus de configuration, même vitesse une fois lancé

Je connais la frustration AMD — la plupart des tutos parlent NVIDIA, la doc ROCm est fragmentée. Bonne nouvelle : le support ROCm d’Ollama est bien plus stable ; il faut juste quelques étapes de plus.

Sous Linux : ROCm v7

Sur Ubuntu 22.04 ou plus récent, l’installation reste raisonnable :

# Ajouter le dépôt AMD officiel
sudo apt update
sudo apt install amdgpu-install
sudo amdgpu-install --usecase=rocm

# Ajouter l'utilisateur au groupe render
sudo usermod -aG render,video $USER

# Redémarrer
sudo reboot

Après redémarrage, rocminfo doit lister votre GPU. Installez Ollama — la version AMD détecte ROCm sans config additionnelle.

Sous Windows : désormais pris en charge officiellement

Le support AMD sous Windows a beaucoup mûri cette année. Ollama exige maintenant la pile ROCm v7 / HIP7 sous Windows aussi (installez AMD Adrenalin), et non plus l’ancienne preview v6.1. Les RX 7000/6000 tournent le plus souvent directement ; les toutes dernières cartes RDNA4 (RX 9000, gfx1200/1201) peuvent buter sur des lacunes de kernels et demander un build plus récent ou un remplacement manuel de bibliothèque.

Si une carte très récente refuse de démarrer, repliez-vous sur WSL2 + Ubuntu pour Ollama — souvent plus stable.

Anciennes cartes : HSA_OVERRIDE

Les architectures AMD ont des noms complexes ; ROCm ne supporte officiellement que les plus récentes (gfx900, gfx1030…). Une RX 580 (gfx803) n’est pas reconnue par défaut.

Forcer la compatibilité :

export HSA_OVERRIDE_GFX_VERSION=10.3.0  # mode compatibilité gfx1030

Pas garanti partout, mais efficace sur pas mal de cartes anciennes. Sinon, retour CPU.

Configuration multi-GPU

Comme NVIDIA :

export ROCR_VISIBLE_DEVICES=0,1  # cartes 0 et 1

Numéros des cartes via rocm-smi.

Architectures AMD courantes

Modèle carteArchitectureSupport ROCm
RX 7900 XTXgfx1100Natif
RX 6800 XTgfx1030Natif
RX 5700 XTgfx1010Natif
RX 580gfx803HSA_OVERRIDE requis
Vega 56/64gfx900Natif

La config AMD demande plus d’essais que NVIDIA ; une fois en place, les perfs sont comparables.

Apple Metal : le bonus caché pour les Mac

Sur Apple Silicon (M1/M2/M3/M4) : rien à configurer.

Vraiment rien. Installez Ollama, lancez un modèle — Metal s’active automatiquement. Le framework Metal est intégré à Ollama ; le système charge le modèle sur le GPU.

Performances des puces M

Mesures communautaires :

  • M1/M2 8 Go : modèle 7B, ~15-20 tok/s
  • M2 Pro 16 Go : modèle 14B, ~25-30 tok/s
  • M3 Max 36 Go : modèles 30B+, 30+ tok/s

Loin d’un RTX 4090 « réponse instantanée », mais largement suffisant pour l’aide au code, la traduction ou la relecture.

Nouveauté 2026 : backend MLX

Depuis Ollama 0.19 (publié en preview en mars 2026), l’inférence sur Apple Silicon ne passe plus par llama.cpp mais par le framework MLX d’Apple — il exploite directement la mémoire unifiée et supprime l’étape de copie CPU↔GPU.

D’après les chiffres d’Ollama, MLX accélère le décodage d’environ 1,6 à 2x (int4 : ~85 → ~134 tok/s) et réduit le temps jusqu’au premier token. Sur M5/M5 Pro/M5 Max, il exploite aussi les nouveaux GPU Neural Accelerators.

La plupart du temps, rien à activer : à partir de 0.19+, Apple Silicon utilise MLX automatiquement. Pour le forcer explicitement (ou déboguer), démarrez le serveur avec la variable d’environnement :

OLLAMA_BACKEND=mlx ollama serve

Deux réserves : MLX est encore en preview et réclame 32 Go+ de mémoire unifiée pour être stable ; seules certaines architectures de modèles sont prises en charge — les autres repassent silencieusement sur Metal.

Vérifier que le GPU travaille

Moniteur d’activité → Historique GPU. Pendant l’inférence, l’utilisation GPU doit monter. Si seul le CPU bouge, Metal n’est probablement pas actif — rare ; une réinstallation d’Ollama règle souvent le problème.

Échec de détection GPU : dépannage courant

Configurer le matériel, c’est souvent tomber dans des pièges. Voici ce que j’ai rencontré.

Problème 1 : no compatible GPUs were discovered

Ollama ne trouve aucune carte utilisable.

Causes possibles :

  • Pilotes absents ou trop anciens
  • Modèle non supporté (ex. GTX 700)
  • Conteneur Docker sans accès GPU

Étapes :

# NVIDIA : pilotes
nvidia-smi

# AMD : ROCm
rocminfo

# Si erreur, installer les pilotes d'abord

Problème 2 : Not compiled with GPU offload support

Version Ollama sans support GPU.

Solution : retélécharger la bonne version sur le site. Sous AMD, la build ROCm a un lien distinct — ne pas confondre avec CUDA.

Problème 3 : Pilote NVIDIA trop ancien

Minimum pilote 450+. En dessous, CUDA ne fonctionne pas.

# Version actuelle
nvidia-smi | grep "Driver Version"

# Mise à jour si nécessaire
sudo apt install nvidia-driver-535

Problème 4 : Pilote amdgpu manquant (Linux)

ROCm requiert le pilote amdgpu. Certains systèmes chargent encore l’ancien radeon.

# Pilote chargé
lsmod | grep amdgpu

# Si vide
sudo apt install amdgpu-dkms

Problème 5 : SELinux bloque l’accès GPU du conteneur

Sur CentOS/RHEL, SELinux peut empêcher l’accès GPU.

Temporaire :

sudo setenforce 0

Permanent : ajuster la politique SELinux (doc Red Hat) — ou passer à Ubuntu, plus simple.

Commandes de vérification

# 1. Carte reconnue par le système
nvidia-smi       # NVIDIA
rocminfo         # AMD
system_profiler SPDisplaysDataType  # macOS

# 2. État du processus Ollama
ollama ps

# 3. Surveillance GPU (pendant l'inférence)
watch -n 1 nvidia-smi    # NVIDIA
rocm-smi -a              # AMD

# 4. Variables d'environnement
echo $CUDA_VISIBLE_DEVICES
echo $ROCR_VISIBLE_DEVICES

La plupart des problèmes se localisent avec ces commandes. Sinon, cherchez dans les Issues GitHub d’Ollama.

Pour aller plus loin

En résumé

Tableau rapide :

PlateformePrérequisDifficultéRecommandation
NVIDIAPilote 450+Simple (quasi zéro config)Premier choix
AMD (Linux)ROCm v7Moyenne (quelques commandes)Deuxième choix
AMD (Windows)Pilote ROCm v7 / HIP7Moyenne (RDNA4 récents : patchs possibles)Deuxième choix
Apple SiliconAucunLa plus simpleIdéal pour Mac

L’accélération GPU se configure une fois, profite longtemps. Du « ça tourne » en CPU au « c’est fluide » en GPU, l’écart est réel. Quelle plateforme utilisez-vous ? Des blocages en config ? Partagez en commentaire — je répondrai autant que possible.

Configuration de l'accélération GPU Ollama

Processus complet de configuration GPU sur les trois plateformes

⏱️ Estimated time: 30 min

  1. 1

    Step 1: Identifier la carte et les pilotes

    Selon votre type de carte, choisissez la méthode de vérification :

    - NVIDIA : exécutez nvidia-smi pour voir les infos carte
    - AMD : exécutez rocminfo pour confirmer la reconnaissance ROCm
    - macOS : aucune vérification nécessaire, Metal s'active automatiquement
  2. 2

    Step 2: Configuration NVIDIA CUDA

    La solution la plus simple — installez les pilotes et c'est tout :

    1. Pilotes : sudo apt install nvidia-driver-535
    2. Redémarrez le système
    3. Vérification : nvidia-smi doit afficher les infos carte
    4. Ollama détecte CUDA automatiquement, sans config supplémentaire
  3. 3

    Step 3: Configuration AMD ROCm (Linux)

    Installation de ROCm v7 :

    1. Installation : sudo apt install amdgpu-install
    2. Configuration : sudo amdgpu-install --usecase=rocm
    3. Permissions : sudo usermod -aG render,video $USER
    4. Après redémarrage, vérifiez avec rocminfo
    5. Anciennes cartes : export HSA_OVERRIDE_GFX_VERSION=10.3.0
  4. 4

    Step 4: Vérifier que l'accélération GPU est active

    Confirmez que le GPU travaille pendant l'exécution du modèle :

    - Exécutez ollama ps pour voir l'utilisation GPU
    - NVIDIA : nvidia-smi -l 1 en temps réel
    - AMD : rocm-smi -a en temps réel
    - macOS : Moniteur d'activité, onglet Historique GPU
  5. 5

    Step 5: Configuration multi-GPU

    Spécifier quelles cartes utiliser :

    - NVIDIA : export CUDA_VISIBLE_DEVICES=0,2
    - AMD : export ROCR_VISIBLE_DEVICES=0,1
    - Ajoutez la variable à ~/.bashrc pour la persistance

FAQ

Quelles plateformes GPU Ollama prend-il en charge ?
Ollama prend en charge trois plateformes : NVIDIA (CUDA, Compute Capability 5.0+), AMD (ROCm v7 / HIP7, désormais officiel sous Linux et Windows), Apple Silicon (Metal activé automatiquement ; backend MLX en preview depuis Ollama 0.19). NVIDIA est le plus simple à configurer ; les Mac ne nécessitent aucun réglage.
Que faire si ma VRAM est insuffisante ?
La VRAM détermine la taille du modèle : 7B = 5-6 Go, 14B = 10-12 Go, 70B = 40 Go+. Si la VRAM manque : 1. utiliser un modèle quantifié plus petit ; 2. laisser Ollama compléter avec la RAM CPU (vitesse réduite) ; 3. répartir sur plusieurs cartes.
Comment confirmer que l'accélération GPU fonctionne ?
Pendant l'exécution du modèle, lancez ollama ps et vérifiez l'utilisation GPU. Sous NVIDIA, nvidia-smi -l 1 permet de surveiller la VRAM en temps réel. Si l'utilisation GPU monte, l'accélération est active.
Une ancienne carte AMD (ex. RX 580) peut-elle fonctionner ?
Certaines anciennes cartes peuvent être forcées via une variable d'environnement. Définissez export HSA_OVERRIDE_GFX_VERSION=10.3.0 pour activer le mode compatibilité gfx1030. Ce n'est pas garanti dans tous les cas — testez vous-même.
Comment utiliser le GPU dans un conteneur Docker ?
Sous NVIDIA, installez nvidia-container-toolkit et configurez le runtime Docker. Lancez le conteneur avec --gpus all. Pour AMD, la config GPU en conteneur est plus complexe ; exécuter Ollama directement sur l'hôte est recommandé.
Comment activer le backend MLX sur Apple Silicon ?
Passez à Ollama 0.19+ (preview, mars 2026) ; sur Apple Silicon, MLX est généralement utilisé automatiquement, ou forcez-le avec la variable d'environnement OLLAMA_BACKEND=mlx ollama serve. Il faut 32 Go+ de mémoire unifiée, seuls certains modèles sont pris en charge (sinon repli sur Metal), et le décodage gagne environ 1,6-2x.
Que faire en cas d'erreur « no compatible GPUs were discovered » ?
Vérifiez dans l'ordre : 1. pilotes installés (nvidia-smi ou rocminfo) ; 2. version pilote suffisante (NVIDIA 450+) ; 3. accès GPU du conteneur Docker ; 4. pilote amdgpu manquant sous AMD.

9 min de lecture · Publié le: 25 avr. 2026 · Mis à jour le: 30 juil. 2026

Commentaires

Connectez-vous avec GitHub pour laisser un commentaire

Easton BlogEaston Blog