Fini l'anxiété des factures API : réduire de 80 % les coûts OpenClaw grâce au routage de modèles

Le mois dernier, la facture Anthropic est arrivée : 340 $, trois fois plus que prévu. Mon assistant OpenClaw ne gérait que des tâches quotidiennes — répondre aux mails, organiser des notes, écrire parfois un bout de code. Comment ai-je brûlé autant ?
En fouillant les logs, j’ai trouvé la cause : par défaut, toutes les requêtes passent par le Claude Opus 4.6, le plus cher. Heartbeat, requêtes simples, opérations fichiers — tout au même tarif. Avec des sous-agents en parallèle, chacun « brûlait » de l’argent.
J’ai passé un week-end à étudier le routage de modèles d’OpenClaw et découvert qu’on peut stratifier intelligemment : les tâches simples aux modèles « bon marché », les vrais travaux de réflexion aux « gros calibres ». Un mois plus tard, la facture est tombée à 68 $.
Guide low-cost « élevage de homard » : ArkClaw démocratise l’agent IA
OpenClaw (le « homard ») est populaire mais la config rebute ? ArkClaw de ByteDance Volcano Engine abaisse la barrière au minimum. Pas de serveur ni de config Token à bricoler : un agent 24h/24 qui contrôle le navigateur, exécute des scripts et gère le calendrier, en un clic.
Et surtout, c’est vraiment bon marché : 9,9 ¥/mois, ou 8,9 ¥ avec mon code d’invitation ZLKUK54M (inscrivez-vous ici). Développeurs : le Coding Plan Pro peut même être gratuit.
Comprendre le trou noir des coûts OpenClaw
Pourquoi la config par défaut coûte si cher ?
Quelques chiffres qui font réfléchir :
| Modèle | Prix entrée ($/MTok) | Prix sortie ($/MTok) | Cas d’usage |
|---|---|---|---|
| Claude Opus 4.6 | $5.00 | $25.00 | Raisonnement complexe, analyse de longs documents |
| Claude Sonnet 4.5 | $0.80 | $4.00 | Tâches courantes, génération de code |
| Claude Haiku 3.5 | $0.25 | $1.25 | Requêtes simples, réponses rapides |
| Llama 3 (local) | $0 | $0 | Heartbeat, fichiers, Q&R basiques |
MTok = Million Tokens, 1 million de tokens
Un calcul rapide. Supposons 100 messages par jour, 500 tokens en moyenne :
Tout en Opus : 100 × 500 × $5 / 1 000 000 = $0,25/jour, soit $7,5/mois.
Ça semble acceptable ?
Le calcul est naïf. Le prompt système d’OpenClaw pèse déjà 2k-4k tokens, plus les appels d’outils, les retries… la consommation réelle est 3 à 5 fois le calcul brut.
Pièges de coûts cachés
Piège 1 : les requêtes heartbeat
Un heartbeat toutes les 30 secondes, soit 2 880 fois par jour. Chaque heartbeat embarque le prompt système complet, même sans contenu utile.
C’est une pure « taxe aux tokens ».
Piège 2 : les sous-agents (Sub-agents)
En tâches parallèles, chaque sous-agent utilise le modèle principal. « Vérifier le calendrier » en Opus — ça fait mal.
Piège 3 : les retries
En cas de fluctuation réseau, les retries automatiques consomment des tokens sans résultat. L’argent part, le travail non.
Stratégie de routage à trois niveaux
Principe : stratifier les tâches
Toutes les requêtes ne méritent pas le modèle le plus cher.
Voici trois niveaux :
┌─────────────────────────────────────────────┐
│ Niveau 1 : modèle local (Llama 3 / Qwen…) │
│ → heartbeat, fichiers, Q&R simples, statut │
│ → coût : $0 │
├─────────────────────────────────────────────┤
│ Niveau 2 : cloud léger (Claude Haiku / GPT-4o-mini)│
│ → dialogue quotidien, brouillons mail, code simple│
│ → coût : $0,25/MTok │
├─────────────────────────────────────────────┤
│ Niveau 3 : modèle lourd (Claude Opus / GPT-4o)│
│ → architecture complexe, analyse profonde, rédaction│
│ → coût : $5/MTok (usage très faible) │
└─────────────────────────────────────────────┘
En bref : la bonne personne pour le bon travail.
Mise en pratique : OpenClaw + Ollama en local
Étape 1 : installer et lancer Ollama
# macOS/Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows : après installation
ollama serve
# Télécharger les modèles adaptés
ollama pull llama3.2:latest # léger, tâches simples
ollama pull qwen2.5:14b # plus capable, supporte les outils
Étape 2 : configurer OpenClaw pour le modèle local
Éditez ~/.openclaw/openclaw.json :
{
"models": {
"defaults": {
"model": "ollama/qwen2.5:14b",
"fallbacks": [
"anthropic/claude-sonnet-4-5",
"anthropic/claude-opus-4-6"
]
},
"providers": {
"ollama": {
"type": "openai-compatible",
"baseUrl": "http://127.0.0.1:11434/v1",
"apiKey": "ollama"
}
}
}
}
Points clés :
baseUrl: Ollama écoute par défaut sur le port 11434context window: OpenClaw exige au moins 64k de contexte — choisissez le modèle en conséquencetool calling: tous les modèles locaux ne le supportent pas ; privilégiez qwen2.5 ou mistral-nemo
Routage avancé : allocation intelligente par type de tâche
Utiliser OpenRouter Auto Model :
{
"models": {
"defaults": {
"model": "openrouter/openrouter/auto",
"fallbacks": [
"anthropic/claude-sonnet-4-5"
]
}
}
}
Le mode Auto d’OpenRouter choisit automatiquement le modèle le moins cher adapté à la complexité du prompt. Pratique.
Règles de routage personnalisées (iblai-openclaw-router) :
Pour un contrôle plus fin, utilisez iblai-openclaw-router (open source) :
{
"routing": {
"enabled": true,
"tiers": {
"free": {
"models": ["ollama/llama3.2"],
"keywords": ["heartbeat", "status", "ping", "check"]
},
"cheap": {
"models": ["anthropic/claude-haiku-3-5"],
"maxCostPerRequest": 0.001
},
"standard": {
"models": ["anthropic/claude-sonnet-4-5"]
},
"premium": {
"models": ["anthropic/claude-opus-4-6"],
"keywords": ["architect", "design", "analyze deeply", "complex"]
}
}
}
}
Cas réel : comparaison sur un mois
Facture avant optimisation
Usage mensuel typique d’un développeur (données communautaires) :
| Usage | Requêtes | Tokens estimés | Modèle | Coût |
|---|---|---|---|---|
| Dialogue quotidien | 800 | 400k | Opus 4.6 | $10.00 |
| Aide au code | 200 | 600k | Opus 4.6 | $18.00 |
| Heartbeat | 86 400 | 172M | Opus 4.6 | $860.00 |
| Opérations fichiers | 150 | 75k | Opus 4.6 | $1.88 |
| Sous-agents | 300 | 450k | Opus 4.6 | $13.50 |
| Total | $903.38 |
Vous voyez le coût du heartbeat ? 860 $. C’est le principal coupable.
Facture après optimisation
Après le routage à trois niveaux :
| Usage | Requêtes | Tokens estimés | Modèle | Coût |
|---|---|---|---|---|
| Dialogue quotidien | 800 | 400k | Sonnet 4.5 | $1.60 |
| Aide au code | 200 | 600k | Opus 4.6 | $18.00 |
| Heartbeat | 86 400 | 172M | Llama 3 (local) | $0 |
| Opérations fichiers | 150 | 75k | Llama 3 (local) | $0 |
| Sous-agents | 300 | 450k | Sonnet 4.5 | $1.80 |
| Total | $21.40 |
C’est un cas extrême — le heartbeat pesait énormément. En pratique, l’économie se situe plutôt entre 70 et 80 % selon l’usage.
Économies attendues par profil
| Profil | Coût mensuel initial | Après optimisation | Économies |
|---|---|---|---|
| Léger (<100 messages/jour) | $50-80 | $15-25 | 70 % |
| Modéré (100-500 messages/jour) | $200-400 | $50-100 | 75 % |
| Intensif (>500 messages/jour + sous-agents) | $500-1 000 | $100-250 | 80 % |
Guide anti-pièges : problèmes courants et solutions
Le modèle local ne répond pas ou renvoie une erreur
Symptômes :
Error: Connection refused
ou réponse vide du modèle
Étapes de diagnostic :
- Vérifier qu’Ollama tourne :
ollama list - Contrôler le port :
curl http://127.0.0.1:11434/api/tags - Confirmer le téléchargement :
ollama pull qwen2.5:14b - Augmenter la fenêtre de contexte : certains modèles sont à 4k par défaut, OpenClaw exige 64k+
Combinaisons recommandées :
ollama pull qwen2.5:14b-instruct # tool calling, bon en chinois
ollama pull mistral-nemo:latest # équilibre performance
ollama pull glm-4.7-flash # léger, rapide
Échec des appels d’outils
Cause : tous les modèles locaux ne supportent pas le function calling.
Solutions :
- Modèles explicitement compatibles tool use (qwen2.5, mistral-nemo)
- Désactiver les outils pour certains modèles :
{
"models": {
"ollama/llama3.2": {
"supportsTools": false
}
}
}
Mauvaise configuration de la chaîne Fallback
Erreur fréquente :
// Incorrect : si Anthropic limite, Sonnet et Opus peuvent être indisponibles
"fallbacks": [
"anthropic/claude-sonnet-4-5",
"anthropic/claude-opus-4-6"
]
// Correct : fallback multi-fournisseurs
"fallbacks": [
"anthropic/claude-sonnet-4-5",
"openai/gpt-4o",
"google/gemini-pro"
]
Baisse de qualité perçue ?
Si le modèle local peine sur certaines tâches :
- Montée progressive : local → Haiku → Sonnet → Opus
- Mots-clés dans le prompt pour signaler la complexité
- Validation manuelle pour les tâches importantes
Synthèse et plan d’action
L’essentiel :
- Les coûts viennent surtout du heartbeat et des requêtes simples, pas des « grosses tâches »
- Le local suffit pour le quotidien — ne gaspillez pas le quota Opus
- Fallback multi-fournisseurs pour éviter le point de défaillance unique
- Commencez petit : heartbeat en local, et vous verrez la différence tout de suite
3 actions cette semaine
- Installer Ollama et tirer un modèle léger (llama3.2 ou qwen2.5:7b)
- Modifier
~/.openclaw/openclaw.jsonpour pointer le modèle par défaut vers le local - Observer la facture une semaine et ajuster le routage
Aller plus loin
- Tester iblai-openclaw-router pour un classement intelligent des tâches
- Combiner avec Prompt Caching pour réduire les appels répétitifs
- Monitorer taux de succès et latence par modèle pour affiner la config
Vous avez optimisé votre facture OpenClaw ? Quelle stratégie avez-vous utilisée ? Partagez en commentaire ou posez vos questions de config — j’essaierai de répondre.
FAQ
Le routage de modèles OpenClaw dégrade-t-il la qualité des réponses ?
Quelle configuration matérielle pour un modèle local ?
Comment ordonner la chaîne Fallback ?
Combien peut-on économiser en général ?
6 min de lecture · Publié le: 26 févr. 2026 · Mis à jour le: 27 juil. 2026
Déploiement et pratique OpenClaw
Si vous arrivez depuis la recherche, le plus rapide est de passer à l’article précédent ou suivant de cette série.
Précédent
Guide d'installation OpenClaw 2026 : déployez votre assistant IA personnel de zéro
Comparaison détaillée des méthodes Docker, npm et script one-click pour installer OpenClaw, couvrant Windows (natif et WSL2), macOS et déploiement serveur, avec dépannage des erreurs courantes
Partie 25 sur 36
Suivant
Guide complet du contrôle à distance OpenClaw : transformez votre téléphone en télécommande de votre OS IA personnel
Via le protocole Gateway OpenClaw, transformez iOS/Android en télécommande IA : capture d'écran, caméra, localisation et autres capacités matérielles à distance pour un véritable système d'exploitation IA personnel multi-appareils.
Partie 27 sur 36



Commentaires
Connectez-vous avec GitHub pour laisser un commentaire