Changer le thème

Guide Ollama LLM local

18 articles dans cette série

Un parcours LLM local pour setup Ollama, gestion des modèles, API, Web UI, RAG local et choix matériel.

1

Ollama pour débutants : votre première étape pour exécuter un LLM en local

Vous voulez faire tourner un grand modèle de langage sur votre propre machine ? Ce guide pas à pas vous montre comment installer et configurer Ollama, découvrir la puissance des LLM locaux, avec installation multi-plateforme, gestion des modèles, accélération GPU et intégration API.

IA & intelligence
2

Gestion des modèles Ollama : guide complet du téléchargement, du basculement, de la suppression et du contrôle de version

Guide détaillé des commandes essentielles de gestion des modèles Ollama : téléchargement de versions spécifiques, basculement, scripts de suppression en lot et bonnes pratiques de contrôle de version pour gérer efficacement votre bibliothèque LLM locale, libérer de l'espace disque et éviter le chaos des versions. Idéal pour les développeurs IA et les déployeurs OpenClaw.

IA & intelligence
3

Retour de version Ollama en pratique : 3 étapes clés ignorées par 90 % des développeurs

Ollama instable après une mise à jour ? Trois méthodes complètes de retour de version (binaire, gestionnaire de paquets, Docker), scripts d'automatisation et guide de coexistence multi-versions pour résoudre rapidement la gestion des versions.

IA & intelligence
4

Paramètres Modelfile Ollama : guide complet pour créer des modèles personnalisés

Guide détaillé des 10 paramètres clés du Modelfile Ollama, avec conseils d'optimisation pour temperature, num_ctx, etc. Quatre modèles prêts à l'emploi pour créer votre modèle personnalisé.

IA & intelligence
5

Llama 70B en local : guide comparatif 5700XT, Mac M4 et CUDA

Vous voulez exécuter Llama 70B en local ? Cet article compare trois solutions — AMD 5700XT, Mac M4 et NVIDIA CUDA — avec des données de test pour choisir le matériel adapté : besoins en VRAM, performances et pièges à éviter.

IA & intelligence
6

Tableau de sélection matérielle Ollama : guide VRAM, quantification et GPU (2026)

Un tableau complet de sélection matérielle Ollama : besoins VRAM pour les modèles 7B/13B/70B, comparaison des quantifications Q4/Q8, et les trois accélérateurs NVIDIA CUDA, AMD ROCm et Apple Metal. Recommandations par niveau, du RTX 3060 au 5090, pour faire correspondre carte graphique et modèle.

IA & intelligence
7

Accélération GPU Ollama : guide pratique CUDA, ROCm et Metal sur toutes les plateformes

Guide complet de l'accélération GPU Ollama : configuration NVIDIA CUDA, AMD ROCm et Apple Metal, avec étapes de vérification, réglage multi-GPU et dépannage pour multiplier par 10 à 20 la vitesse d'inférence LLM locale.

IA & intelligence
9

Planification GPU Ollama et gestion des ressources : optimisation VRAM, équilibrage multi-GPU

Analyse approfondie de la planification GPU et de la gestion des ressources Ollama : paramètres d'optimisation VRAM, architecture d'équilibrage multi-GPU, principes llama.cpp. Trois cas réels pour stabiliser les grands modèles et exploiter plusieurs cartes.

IA & intelligence
10

Optimisation des performances Ollama : guide complet quantification, batch et mémoire

Stratégies de quantification Q4/Q5/Q8 pour Ollama, configuration num_batch pour augmenter le débit de 50 à 150 %, gestion mémoire GPU et solutions OOM. Benchmarks par configuration matérielle.

IA & intelligence
11

Ollama multi-modèles en parallèle : configuration Qwen, Llama et DeepSeek

Guide de configuration Ollama pour l'exécution parallèle de plusieurs modèles : comparaison de Qwen, Llama et DeepSeek, cas d'usage et astuces de gestion de la mémoire GPU pour un système de bascule intelligent.

IA & intelligence
12

Ollama + Open WebUI : créer une interface ChatGPT locale (guide complet)

Guide pas à pas pour déployer une interface de dialogue IA style ChatGPT en local avec Ollama et Open WebUI : installation, choix de modèles, base de connaissances RAG, intégration API et optimisation des performances — en 30 minutes.

IA & intelligence
13

Appels API Ollama : de curl à l'interface compatible OpenAI SDK

Apprenez les deux façons d'appeler l'API Ollama : l'API REST native (curl) et l'interface compatible OpenAI SDK. Exemples de code complets, gestion du streaming et bonnes pratiques.

IA & intelligence
14

Pratique Ollama API : guide de développement client Python et Node.js

Guide complet d'appel à l'API Ollama : SDK Python et Node.js, réponses en streaming, boucle Agent Loop pour l'appel d'outils, mode thinking et comparaison avec la compatibilité OpenAI

IA & intelligence
15

Intégration LangChain + Ollama : guide complet pour développer des applications LLM en local

Méthode complète d'intégration LangChain et Ollama avec exemples de code pour Chat, RAG et Agent, stratégies de bascule OpenAI/Ollama, pour construire des applications LLM de niveau entreprise avec des modèles locaux.

IA & intelligence
16

Ollama Embedding en pratique : recherche vectorielle locale et RAG

Construire un RAG local avec Ollama : comparaison mxbai-embed-large vs nomic-embed-text, choix ChromaDB/FAISS/Milvus, code Python complet de bout en bout

IA & intelligence
17

Quantification de modèles Ollama : format GGUF et perte de précision expliqués

Principes de la quantification GGUF dans Ollama, données Red Hat sur 500K+ évaluations pour mesurer la perte de précision, et recommandations par configuration matérielle pour exécuter de grands modèles sur GPU grand public.

IA & intelligence
18

Surveillance Ollama en production : logs et alertes Prometheus

Guide complet de surveillance Ollama en production : configuration des logs, collecte de métriques Prometheus, règles AlertManager et dashboard Grafana, avec surveillance multi-GPU et récupération automatique en cas de panne.

IA & intelligence
19

Mnemo avec Ollama : mémoire locale et déploiement

Mnemo donne à Ollama une mémoire intersession avec Rust, SQLite et un graphe. Testez son API puis évaluez suppression, migration et partage entre agents.

IA & intelligence
Easton BlogEaston Blog