Changer le thème

Fini l'anxiété des factures API : réduire de 80 % les coûts OpenClaw grâce au routage de modèles

Easton editorial illustration: multi-agent workbench

Le mois dernier, la facture Anthropic est arrivée : 340 $, trois fois plus que prévu. Mon assistant OpenClaw ne gérait que des tâches quotidiennes — répondre aux mails, organiser des notes, écrire parfois un bout de code. Comment ai-je brûlé autant ?

En fouillant les logs, j’ai trouvé la cause : par défaut, toutes les requêtes passent par le Claude Opus 4.6, le plus cher. Heartbeat, requêtes simples, opérations fichiers — tout au même tarif. Avec des sous-agents en parallèle, chacun « brûlait » de l’argent.

J’ai passé un week-end à étudier le routage de modèles d’OpenClaw et découvert qu’on peut stratifier intelligemment : les tâches simples aux modèles « bon marché », les vrais travaux de réflexion aux « gros calibres ». Un mois plus tard, la facture est tombée à 68 $.

Guide low-cost « élevage de homard » : ArkClaw démocratise l’agent IA

OpenClaw (le « homard ») est populaire mais la config rebute ? ArkClaw de ByteDance Volcano Engine abaisse la barrière au minimum. Pas de serveur ni de config Token à bricoler : un agent 24h/24 qui contrôle le navigateur, exécute des scripts et gère le calendrier, en un clic.

Et surtout, c’est vraiment bon marché : 9,9 ¥/mois, ou 8,9 ¥ avec mon code d’invitation ZLKUK54M (inscrivez-vous ici). Développeurs : le Coding Plan Pro peut même être gratuit.

Comprendre le trou noir des coûts OpenClaw

Pourquoi la config par défaut coûte si cher ?

Quelques chiffres qui font réfléchir :

ModèlePrix entrée ($/MTok)Prix sortie ($/MTok)Cas d’usage
Claude Opus 4.6$5.00$25.00Raisonnement complexe, analyse de longs documents
Claude Sonnet 4.5$0.80$4.00Tâches courantes, génération de code
Claude Haiku 3.5$0.25$1.25Requêtes simples, réponses rapides
Llama 3 (local)$0$0Heartbeat, fichiers, Q&R basiques

MTok = Million Tokens, 1 million de tokens

Un calcul rapide. Supposons 100 messages par jour, 500 tokens en moyenne :

Tout en Opus : 100 × 500 × $5 / 1 000 000 = $0,25/jour, soit $7,5/mois.

Ça semble acceptable ?

Le calcul est naïf. Le prompt système d’OpenClaw pèse déjà 2k-4k tokens, plus les appels d’outils, les retries… la consommation réelle est 3 à 5 fois le calcul brut.

Pièges de coûts cachés

Piège 1 : les requêtes heartbeat

Un heartbeat toutes les 30 secondes, soit 2 880 fois par jour. Chaque heartbeat embarque le prompt système complet, même sans contenu utile.

C’est une pure « taxe aux tokens ».

Piège 2 : les sous-agents (Sub-agents)

En tâches parallèles, chaque sous-agent utilise le modèle principal. « Vérifier le calendrier » en Opus — ça fait mal.

Piège 3 : les retries

En cas de fluctuation réseau, les retries automatiques consomment des tokens sans résultat. L’argent part, le travail non.

Stratégie de routage à trois niveaux

Principe : stratifier les tâches

Toutes les requêtes ne méritent pas le modèle le plus cher.

Voici trois niveaux :

┌─────────────────────────────────────────────┐
│  Niveau 1 : modèle local (Llama 3 / Qwen…)   │
│  → heartbeat, fichiers, Q&R simples, statut  │
│  → coût : $0                                 │
├─────────────────────────────────────────────┤
│  Niveau 2 : cloud léger (Claude Haiku / GPT-4o-mini)│
│  → dialogue quotidien, brouillons mail, code simple│
│  → coût : $0,25/MTok                         │
├─────────────────────────────────────────────┤
│  Niveau 3 : modèle lourd (Claude Opus / GPT-4o)│
│  → architecture complexe, analyse profonde, rédaction│
│  → coût : $5/MTok (usage très faible)        │
└─────────────────────────────────────────────┘

En bref : la bonne personne pour le bon travail.

Mise en pratique : OpenClaw + Ollama en local

Étape 1 : installer et lancer Ollama

# macOS/Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows : après installation
ollama serve

# Télécharger les modèles adaptés
ollama pull llama3.2:latest      # léger, tâches simples
ollama pull qwen2.5:14b          # plus capable, supporte les outils

Étape 2 : configurer OpenClaw pour le modèle local

Éditez ~/.openclaw/openclaw.json :

{
  "models": {
    "defaults": {
      "model": "ollama/qwen2.5:14b",
      "fallbacks": [
        "anthropic/claude-sonnet-4-5",
        "anthropic/claude-opus-4-6"
      ]
    },
    "providers": {
      "ollama": {
        "type": "openai-compatible",
        "baseUrl": "http://127.0.0.1:11434/v1",
        "apiKey": "ollama"
      }
    }
  }
}

Points clés :

  • baseUrl : Ollama écoute par défaut sur le port 11434
  • context window : OpenClaw exige au moins 64k de contexte — choisissez le modèle en conséquence
  • tool calling : tous les modèles locaux ne le supportent pas ; privilégiez qwen2.5 ou mistral-nemo

Routage avancé : allocation intelligente par type de tâche

Utiliser OpenRouter Auto Model :

{
  "models": {
    "defaults": {
      "model": "openrouter/openrouter/auto",
      "fallbacks": [
        "anthropic/claude-sonnet-4-5"
      ]
    }
  }
}

Le mode Auto d’OpenRouter choisit automatiquement le modèle le moins cher adapté à la complexité du prompt. Pratique.

Règles de routage personnalisées (iblai-openclaw-router) :

Pour un contrôle plus fin, utilisez iblai-openclaw-router (open source) :

{
  "routing": {
    "enabled": true,
    "tiers": {
      "free": {
        "models": ["ollama/llama3.2"],
        "keywords": ["heartbeat", "status", "ping", "check"]
      },
      "cheap": {
        "models": ["anthropic/claude-haiku-3-5"],
        "maxCostPerRequest": 0.001
      },
      "standard": {
        "models": ["anthropic/claude-sonnet-4-5"]
      },
      "premium": {
        "models": ["anthropic/claude-opus-4-6"],
        "keywords": ["architect", "design", "analyze deeply", "complex"]
      }
    }
  }
}

Cas réel : comparaison sur un mois

Facture avant optimisation

Usage mensuel typique d’un développeur (données communautaires) :

UsageRequêtesTokens estimésModèleCoût
Dialogue quotidien800400kOpus 4.6$10.00
Aide au code200600kOpus 4.6$18.00
Heartbeat86 400172MOpus 4.6$860.00
Opérations fichiers15075kOpus 4.6$1.88
Sous-agents300450kOpus 4.6$13.50
Total$903.38

Vous voyez le coût du heartbeat ? 860 $. C’est le principal coupable.

Facture après optimisation

Après le routage à trois niveaux :

UsageRequêtesTokens estimésModèleCoût
Dialogue quotidien800400kSonnet 4.5$1.60
Aide au code200600kOpus 4.6$18.00
Heartbeat86 400172MLlama 3 (local)$0
Opérations fichiers15075kLlama 3 (local)$0
Sous-agents300450kSonnet 4.5$1.80
Total$21.40
97,6 %
Taux d’économies

C’est un cas extrême — le heartbeat pesait énormément. En pratique, l’économie se situe plutôt entre 70 et 80 % selon l’usage.

Économies attendues par profil

ProfilCoût mensuel initialAprès optimisationÉconomies
Léger (<100 messages/jour)$50-80$15-2570 %
Modéré (100-500 messages/jour)$200-400$50-10075 %
Intensif (>500 messages/jour + sous-agents)$500-1 000$100-25080 %

Guide anti-pièges : problèmes courants et solutions

Le modèle local ne répond pas ou renvoie une erreur

Symptômes :

Error: Connection refused
ou réponse vide du modèle

Étapes de diagnostic :

  1. Vérifier qu’Ollama tourne : ollama list
  2. Contrôler le port : curl http://127.0.0.1:11434/api/tags
  3. Confirmer le téléchargement : ollama pull qwen2.5:14b
  4. Augmenter la fenêtre de contexte : certains modèles sont à 4k par défaut, OpenClaw exige 64k+

Combinaisons recommandées :

ollama pull qwen2.5:14b-instruct    # tool calling, bon en chinois
ollama pull mistral-nemo:latest     # équilibre performance
ollama pull glm-4.7-flash           # léger, rapide

Échec des appels d’outils

Cause : tous les modèles locaux ne supportent pas le function calling.

Solutions :

  • Modèles explicitement compatibles tool use (qwen2.5, mistral-nemo)
  • Désactiver les outils pour certains modèles :
{
  "models": {
    "ollama/llama3.2": {
      "supportsTools": false
    }
  }
}

Mauvaise configuration de la chaîne Fallback

Erreur fréquente :

// Incorrect : si Anthropic limite, Sonnet et Opus peuvent être indisponibles
"fallbacks": [
  "anthropic/claude-sonnet-4-5",
  "anthropic/claude-opus-4-6"
]

// Correct : fallback multi-fournisseurs
"fallbacks": [
  "anthropic/claude-sonnet-4-5",
  "openai/gpt-4o",
  "google/gemini-pro"
]

Baisse de qualité perçue ?

Si le modèle local peine sur certaines tâches :

  1. Montée progressive : local → Haiku → Sonnet → Opus
  2. Mots-clés dans le prompt pour signaler la complexité
  3. Validation manuelle pour les tâches importantes

Synthèse et plan d’action

L’essentiel :

  1. Les coûts viennent surtout du heartbeat et des requêtes simples, pas des « grosses tâches »
  2. Le local suffit pour le quotidien — ne gaspillez pas le quota Opus
  3. Fallback multi-fournisseurs pour éviter le point de défaillance unique
  4. Commencez petit : heartbeat en local, et vous verrez la différence tout de suite

3 actions cette semaine

  • Installer Ollama et tirer un modèle léger (llama3.2 ou qwen2.5:7b)
  • Modifier ~/.openclaw/openclaw.json pour pointer le modèle par défaut vers le local
  • Observer la facture une semaine et ajuster le routage

Aller plus loin

  • Tester iblai-openclaw-router pour un classement intelligent des tâches
  • Combiner avec Prompt Caching pour réduire les appels répétitifs
  • Monitorer taux de succès et latence par modèle pour affiner la config

Vous avez optimisé votre facture OpenClaw ? Quelle stratégie avez-vous utilisée ? Partagez en commentaire ou posez vos questions de config — j’essaierai de répondre.

FAQ

Le routage de modèles OpenClaw dégrade-t-il la qualité des réponses ?
Une configuration raisonnable n'affecte pas la qualité. L'essentiel est de stratifier selon la complexité : heartbeat, opérations fichiers et tâches simples suffisent avec un modèle local ; seuls le raisonnement complexe et la rédaction créative nécessitent Claude Opus. Commencez par migrer les tâches simples pour gagner en confiance.
Quelle configuration matérielle pour un modèle local ?
Tâches légères (llama3.2, qwen2.5:7b) : 8 Go de RAM suffisent ; modèles 14b : 16 Go recommandés ; pour 32b et plus, une carte graphique dédiée est conseillée. Pour un simple heartbeat, un modèle ultra-léger de 3b peut suffire.
Comment ordonner la chaîne Fallback ?
Triez par équilibre coût/performance : modèle local → cloud léger (Haiku) → cloud standard (Sonnet/GPT-4o) → modèle lourd (Opus). Configurez aussi des fallbacks multi-fournisseurs pour éviter que toute la chaîne tombe en panne si Anthropic limite le débit.
Combien peut-on économiser en général ?
Selon l'usage, 70-80 % d'économies. Utilisateur léger (&lt;100 messages/jour) : de 50-80 $ à 15-25 $/mois ; utilisateur intensif (&gt;500 messages/jour) : de 500-1 000 $ à 100-250 $. Plus le heartbeat pèse dans l'usage, plus l'économie est visible.

6 min de lecture · Publié le: 26 févr. 2026 · Mis à jour le: 27 juil. 2026

Commentaires

Connectez-vous avec GitHub pour laisser un commentaire

Easton BlogEaston Blog