Chega de ansiedade com a conta da API: como economizar 80% nos custos do OpenClaw com roteamento de modelos

No mês passado, recebi uma conta de US$ 340 da Anthropic — três vezes mais do que eu esperava. Meu assistente OpenClaw só cuidava de algumas tarefas rotineiras: responder e-mails, organizar anotações e, de vez em quando, escrever pequenos trechos de código. Como isso conseguiu consumir tanto dinheiro?
Ao examinar os logs, encontrei a causa: com a configuração padrão, todas as requisições usavam o modelo mais caro, Claude Opus 4.6. Verificações de heartbeat, consultas simples e operações com arquivos recebiam o mesmo tratamento. Quando subagentes trabalhavam em paralelo, cada um deles também estava “queimando dinheiro”.
Depois, passei um fim de semana estudando o recurso de roteamento de modelos do OpenClaw. Descobri que era possível separar as tarefas de forma inteligente, deixando os modelos “baratos” cuidarem do trabalho simples e enviando apenas o que realmente exigia raciocínio profundo para os “caros”. Um mês depois, a conta caiu para US$ 68.
Guia para manter seu “OpenClaw” gastando pouco: o ArkClaw torna os agentes de IA realmente acessíveis
O OpenClaw, que ficou popular recentemente, é útil, mas sua configuração afasta muita gente. O ArkClaw, da Volcano Engine da ByteDance, derruba essa barreira: sem precisar configurar servidor nem tokens, um clique basta para ter um agente de IA disponível 24 horas por dia, capaz de controlar o navegador, executar scripts e gerenciar o calendário.
E o principal é que ele realmente custa pouco: a mensalidade é de apenas 9,9 yuans e, com meu código de convite ZLKUK54M (cadastre-se aqui), cai para 8,9 yuans. Se você programa, também pode aderir diretamente ao Coding Plan Pro sem custo adicional.
Entendendo o buraco negro de custos do OpenClaw
Por que a configuração padrão custa tanto?
Primeiro, veja alguns números assustadores:
| Modelo | Preço de entrada (US$/MTok) | Preço de saída (US$/MTok) | Cenários indicados |
|---|---|---|---|
| Claude Opus 4.6 | US$ 5,00 | US$ 25,00 | Raciocínio complexo e análise de documentos longos |
| Claude Sonnet 4.5 | US$ 0,80 | US$ 4,00 | Tarefas gerais e geração de código |
| Claude Haiku 3.5 | US$ 0,25 | US$ 1,25 | Consultas simples e respostas rápidas |
| Llama 3 (local) | US$ 0 | US$ 0 | Heartbeats, operações com arquivos e perguntas básicas |
MTok = Million Tokens, ou 1 milhão de tokens
Vamos fazer uma conta simples. Suponha que você envie 100 mensagens por dia, com média de 500 tokens cada:
Usando apenas o Opus, seriam 100 × 500 × US$ 5 / 1.000.000 = US$ 0,25 por dia, ou US$ 7,50 por mês.
Parece aceitável?
O problema é que esse cálculo é ingênuo demais. Só o prompt de sistema do OpenClaw ocupa de 2 mil a 4 mil tokens. Some a isso chamadas de ferramentas, tentativas automáticas e outros custos: o consumo real fica entre três e cinco vezes acima do cálculo básico.
Armadilhas de custo escondidas
Armadilha 1: requisições de heartbeat
Uma verificação de heartbeat a cada 30 segundos totaliza 2.880 requisições por dia. Mesmo sem conteúdo relevante, cada uma envia o prompt de sistema completo.
É um verdadeiro “imposto de tokens”.
Armadilha 2: subagentes
Em tarefas paralelas, cada subagente usa o modelo principal. Até uma operação simples como “consultar o calendário” passa pelo Opus — e a conta dói.
Armadilha 3: mecanismo de repetição
Quando há instabilidade na rede, as tentativas automáticas consomem os tokens das requisições que falharam, embora nenhum resultado seja retornado. Você paga, mas a tarefa não é concluída.
Estratégia de roteamento em três camadas
Princípio central: separar as tarefas por nível
Nem toda requisição merece usar o modelo mais caro.
Vamos criar uma estrutura de três camadas:
┌─────────────────────────────────────────────────────────┐
│ Camada 1: modelos locais (Llama 3, Qwen etc.) │
│ → Heartbeats, arquivos, perguntas simples, status │
│ → Custo: US$ 0 │
├─────────────────────────────────────────────────────────┤
│ Camada 2: nuvem leve (Claude Haiku, GPT-4o-mini) │
│ → Conversas diárias, rascunhos de e-mail, código simples│
│ → Custo: US$ 0,25/MTok │
├─────────────────────────────────────────────────────────┤
│ Camada 3: modelos pesados (Claude Opus, GPT-4o) │
│ → Arquitetura complexa, análise profunda, escrita criativa│
│ → Custo: US$ 5/MTok, mas com uso mínimo │
└─────────────────────────────────────────────────────────┘
Em resumo, é colocar o modelo certo no trabalho certo.
Configuração prática: OpenClaw + modelo local no Ollama
Etapa 1: instale e inicie o Ollama
# macOS/Linux
curl -fsSL https://ollama.com/install.sh | sh
# No Windows, depois de baixar o instalador
ollama serve
# Baixe modelos adequados
ollama pull llama3.2:latest # Leve, indicado para tarefas simples
ollama pull qwen2.5:14b # Mais potente e compatível com chamadas de ferramentas
Etapa 2: configure o OpenClaw para usar o modelo local
Edite ~/.openclaw/openclaw.json:
{
"models": {
"defaults": {
"model": "ollama/qwen2.5:14b",
"fallbacks": [
"anthropic/claude-sonnet-4-5",
"anthropic/claude-opus-4-6"
]
},
"providers": {
"ollama": {
"type": "openai-compatible",
"baseUrl": "http://127.0.0.1:11434/v1",
"apiKey": "ollama"
}
}
}
}
Alguns pontos importantes:
baseUrl: por padrão, o Ollama é executado na porta 11434context window: o OpenClaw precisa de pelo menos 64k de contexto; leve isso em conta ao escolher o modelotool calling: nem todos os modelos locais oferecem suporte; qwen2.5 e mistral-nemo são boas opções
Roteamento avançado: distribuição inteligente por tipo de tarefa
Usando o OpenRouter Auto Model:
{
"models": {
"defaults": {
"model": "openrouter/openrouter/auto",
"fallbacks": [
"anthropic/claude-sonnet-4-5"
]
}
}
}
O modo Auto do OpenRouter escolhe automaticamente o modelo adequado mais barato de acordo com a complexidade do prompt. É a opção mais prática.
Regras de roteamento personalizadas com iblai-openclaw-router:
Para ter um controle mais preciso, você pode usar o projeto de código aberto iblai-openclaw-router:
{
"routing": {
"enabled": true,
"tiers": {
"free": {
"models": ["ollama/llama3.2"],
"keywords": ["heartbeat", "status", "ping", "check"]
},
"cheap": {
"models": ["anthropic/claude-haiku-3-5"],
"maxCostPerRequest": 0.001
},
"standard": {
"models": ["anthropic/claude-sonnet-4-5"]
},
"premium": {
"models": ["anthropic/claude-opus-4-6"],
"keywords": ["architect", "design", "analyze deeply", "complex"]
}
}
}
}
Caso real: comparação de custos ao longo de um mês
Composição da conta antes da otimização
Uso mensal típico de um desenvolvedor, com base em dados reais da comunidade:
| Uso | Número de requisições | Tokens estimados | Modelo | Custo |
|---|---|---|---|---|
| Conversas diárias | 800 | 400k | Opus 4.6 | US$ 10,00 |
| Assistência com código | 200 | 600k | Opus 4.6 | US$ 18,00 |
| Verificações de heartbeat | 86.400 | 172M | Opus 4.6 | US$ 860,00 |
| Operações com arquivos | 150 | 75k | Opus 4.6 | US$ 1,88 |
| Tarefas de subagentes | 300 | 450k | Opus 4.6 | US$ 13,50 |
| Total | US$ 903,38 |
Viu o custo das verificações de heartbeat? US$ 860. Esse é o maior culpado.
Conta depois da otimização
Após implementar o roteamento em três camadas:
| Uso | Número de requisições | Tokens estimados | Modelo | Custo |
|---|---|---|---|---|
| Conversas diárias | 800 | 400k | Sonnet 4.5 | US$ 1,60 |
| Assistência com código | 200 | 600k | Opus 4.6 | US$ 18,00 |
| Verificações de heartbeat | 86.400 | 172M | Llama 3 (local) | US$ 0 |
| Operações com arquivos | 150 | 75k | Llama 3 (local) | US$ 0 |
| Tarefas de subagentes | 300 | 450k | Sonnet 4.5 | US$ 1,80 |
| Total | US$ 21,40 |
É claro que esse é um exemplo bastante extremo: a proporção de heartbeats desse desenvolvedor era alta demais. Na prática, a economia costuma ficar entre 70% e 80%, dependendo do cenário de uso.
Economia esperada em diferentes cenários
| Cenário de uso | Custo mensal original | Depois da otimização | Economia |
|---|---|---|---|
| Usuário leve (<100 mensagens/dia) | US$ 50–80 | US$ 15–25 | 70% |
| Usuário moderado (100–500 mensagens/dia) | US$ 200–400 | US$ 50–100 | 75% |
| Usuário intensivo (>500 mensagens/dia + subagentes) | US$ 500–1.000 | US$ 100–250 | 80% |
Como evitar problemas: dúvidas comuns e soluções
O modelo local não responde ou retorna erro
Sintomas:
Error: Connection refused
ou o modelo retorna conteúdo vazio
Etapas de diagnóstico:
- Confirme que o Ollama está em execução:
ollama list - Verifique se a porta está correta:
curl http://127.0.0.1:11434/api/tags - Confirme que o modelo foi baixado:
ollama pull qwen2.5:14b - Aumente a janela de contexto: alguns modelos usam 4k por padrão, enquanto o OpenClaw precisa de 64k ou mais
Combinações recomendadas com bom custo-benefício:
ollama pull qwen2.5:14b-instruct # Compatível com ferramentas e funciona bem em chinês
ollama pull mistral-nemo:latest # Desempenho equilibrado
ollama pull glm-4.7-flash # Leve e rápido
Falhas nas chamadas de ferramentas
Motivo: nem todos os modelos locais oferecem suporte a function calling.
Soluções:
- Use modelos que indiquem explicitamente suporte a tool use, como qwen2.5 e mistral-nemo
- Desative as chamadas de ferramentas para um modelo específico na configuração:
{
"models": {
"ollama/llama3.2": {
"supportsTools": false
}
}
}
Erros na configuração da cadeia de fallback
Erro comum:
// Errado: se a Anthropic limitar as requisições, Sonnet e Opus podem ficar indisponíveis ao mesmo tempo
"fallbacks": [
"anthropic/claude-sonnet-4-5",
"anthropic/claude-opus-4-6"
]
// Correto: fallbacks entre provedores
"fallbacks": [
"anthropic/claude-sonnet-4-5",
"openai/gpt-4o",
"google/gemini-pro"
]
O que fazer se a qualidade cair?
Se você perceber que o modelo local não consegue lidar com determinadas tarefas:
- Aumente o nível aos poucos: local → Haiku → Sonnet → Opus
- Use palavras-chave como gatilho: indique claramente a complexidade da tarefa no prompt
- Faça revisão humana: para tarefas importantes, você pode exigir confirmação antes da execução
Resumo e lista de ações
Depois de tudo isso, os pontos principais são:
- A maior parte do custo vem de heartbeats e consultas simples, e não das “grandes tarefas” que você imagina
- Modelos locais dão conta das tarefas rotineiras, portanto não desperdice a cota do Opus
- Configure a cadeia de fallback entre provedores para evitar um ponto único de falha
- Comece pelo básico: só de direcionar os heartbeats para um modelo local, você já verá uma economia evidente
Três coisas que você pode fazer ainda esta semana
- Instalar o Ollama e baixar um modelo leve, como llama3.2 ou qwen2.5:7b
- Editar
~/.openclaw/openclaw.jsone apontar o modelo padrão para uma opção local - Observar a conta por uma semana e ajustar a estratégia de roteamento
Próximos passos
- Experimente o iblai-openclaw-router para classificar tarefas de forma inteligente
- Combine a estratégia com Prompt Caching para reduzir ainda mais o custo de chamadas repetidas
- Monitore a taxa de sucesso e o tempo de resposta de cada modelo para melhorar continuamente a configuração
Você já otimizou sua conta do OpenClaw? Qual estratégia usou? Compartilhe sua experiência nos comentários ou envie suas dúvidas sobre a configuração — tentarei responder.
FAQ
A configuração de roteamento de modelos do OpenClaw afeta a qualidade das respostas?
Que hardware é necessário para executar modelos locais?
Qual é a melhor ordem para uma cadeia de fallback?
Quanto costuma ser possível economizar depois da otimização?
8 min de leitura · Publicado em: 26 fev 2026 · Atualizado em: 4 set 2026
Deploy e prática OpenClaw
Se você chegou pela busca, o caminho mais rápido é ir para o post anterior ou próximo desta série.
Anterior
Como instalar o OpenClaw em 2026: npm, Docker e script
Compare a instalação do OpenClaw por Docker, npm e script, com passos para Windows nativo ou WSL2, macOS e servidores, além de soluções para erros comuns.
Parte 19 de 30
Próximo
Controle remoto com OpenClaw: use o celular como nó de IA
Configure o protocolo de gateway do OpenClaw para controlar câmera, localização e capturas de tela pelo celular em um sistema pessoal de IA entre dispositivos.
Parte 21 de 30



Comentários
Entre com GitHub para comentar