Alternar tema

Chega de ansiedade com a conta da API: como economizar 80% nos custos do OpenClaw com roteamento de modelos

Easton editorial illustration: multi-agent workbench

No mês passado, recebi uma conta de US$ 340 da Anthropic — três vezes mais do que eu esperava. Meu assistente OpenClaw só cuidava de algumas tarefas rotineiras: responder e-mails, organizar anotações e, de vez em quando, escrever pequenos trechos de código. Como isso conseguiu consumir tanto dinheiro?

Ao examinar os logs, encontrei a causa: com a configuração padrão, todas as requisições usavam o modelo mais caro, Claude Opus 4.6. Verificações de heartbeat, consultas simples e operações com arquivos recebiam o mesmo tratamento. Quando subagentes trabalhavam em paralelo, cada um deles também estava “queimando dinheiro”.

Depois, passei um fim de semana estudando o recurso de roteamento de modelos do OpenClaw. Descobri que era possível separar as tarefas de forma inteligente, deixando os modelos “baratos” cuidarem do trabalho simples e enviando apenas o que realmente exigia raciocínio profundo para os “caros”. Um mês depois, a conta caiu para US$ 68.

Guia para manter seu “OpenClaw” gastando pouco: o ArkClaw torna os agentes de IA realmente acessíveis

O OpenClaw, que ficou popular recentemente, é útil, mas sua configuração afasta muita gente. O ArkClaw, da Volcano Engine da ByteDance, derruba essa barreira: sem precisar configurar servidor nem tokens, um clique basta para ter um agente de IA disponível 24 horas por dia, capaz de controlar o navegador, executar scripts e gerenciar o calendário.

E o principal é que ele realmente custa pouco: a mensalidade é de apenas 9,9 yuans e, com meu código de convite ZLKUK54M (cadastre-se aqui), cai para 8,9 yuans. Se você programa, também pode aderir diretamente ao Coding Plan Pro sem custo adicional.

Entendendo o buraco negro de custos do OpenClaw

Por que a configuração padrão custa tanto?

Primeiro, veja alguns números assustadores:

ModeloPreço de entrada (US$/MTok)Preço de saída (US$/MTok)Cenários indicados
Claude Opus 4.6US$ 5,00US$ 25,00Raciocínio complexo e análise de documentos longos
Claude Sonnet 4.5US$ 0,80US$ 4,00Tarefas gerais e geração de código
Claude Haiku 3.5US$ 0,25US$ 1,25Consultas simples e respostas rápidas
Llama 3 (local)US$ 0US$ 0Heartbeats, operações com arquivos e perguntas básicas

MTok = Million Tokens, ou 1 milhão de tokens

Vamos fazer uma conta simples. Suponha que você envie 100 mensagens por dia, com média de 500 tokens cada:

Usando apenas o Opus, seriam 100 × 500 × US$ 5 / 1.000.000 = US$ 0,25 por dia, ou US$ 7,50 por mês.

Parece aceitável?

O problema é que esse cálculo é ingênuo demais. Só o prompt de sistema do OpenClaw ocupa de 2 mil a 4 mil tokens. Some a isso chamadas de ferramentas, tentativas automáticas e outros custos: o consumo real fica entre três e cinco vezes acima do cálculo básico.

Armadilhas de custo escondidas

Armadilha 1: requisições de heartbeat

Uma verificação de heartbeat a cada 30 segundos totaliza 2.880 requisições por dia. Mesmo sem conteúdo relevante, cada uma envia o prompt de sistema completo.

É um verdadeiro “imposto de tokens”.

Armadilha 2: subagentes

Em tarefas paralelas, cada subagente usa o modelo principal. Até uma operação simples como “consultar o calendário” passa pelo Opus — e a conta dói.

Armadilha 3: mecanismo de repetição

Quando há instabilidade na rede, as tentativas automáticas consomem os tokens das requisições que falharam, embora nenhum resultado seja retornado. Você paga, mas a tarefa não é concluída.

Estratégia de roteamento em três camadas

Princípio central: separar as tarefas por nível

Nem toda requisição merece usar o modelo mais caro.

Vamos criar uma estrutura de três camadas:

┌─────────────────────────────────────────────────────────┐
│  Camada 1: modelos locais (Llama 3, Qwen etc.)           │
│  → Heartbeats, arquivos, perguntas simples, status       │
│  → Custo: US$ 0                                          │
├─────────────────────────────────────────────────────────┤
│  Camada 2: nuvem leve (Claude Haiku, GPT-4o-mini)        │
│  → Conversas diárias, rascunhos de e-mail, código simples│
│  → Custo: US$ 0,25/MTok                                  │
├─────────────────────────────────────────────────────────┤
│  Camada 3: modelos pesados (Claude Opus, GPT-4o)         │
│  → Arquitetura complexa, análise profunda, escrita criativa│
│  → Custo: US$ 5/MTok, mas com uso mínimo                 │
└─────────────────────────────────────────────────────────┘

Em resumo, é colocar o modelo certo no trabalho certo.

Configuração prática: OpenClaw + modelo local no Ollama

Etapa 1: instale e inicie o Ollama

# macOS/Linux
curl -fsSL https://ollama.com/install.sh | sh

# No Windows, depois de baixar o instalador
ollama serve

# Baixe modelos adequados
ollama pull llama3.2:latest      # Leve, indicado para tarefas simples
ollama pull qwen2.5:14b          # Mais potente e compatível com chamadas de ferramentas

Etapa 2: configure o OpenClaw para usar o modelo local

Edite ~/.openclaw/openclaw.json:

{
  "models": {
    "defaults": {
      "model": "ollama/qwen2.5:14b",
      "fallbacks": [
        "anthropic/claude-sonnet-4-5",
        "anthropic/claude-opus-4-6"
      ]
    },
    "providers": {
      "ollama": {
        "type": "openai-compatible",
        "baseUrl": "http://127.0.0.1:11434/v1",
        "apiKey": "ollama"
      }
    }
  }
}

Alguns pontos importantes:

  • baseUrl: por padrão, o Ollama é executado na porta 11434
  • context window: o OpenClaw precisa de pelo menos 64k de contexto; leve isso em conta ao escolher o modelo
  • tool calling: nem todos os modelos locais oferecem suporte; qwen2.5 e mistral-nemo são boas opções

Roteamento avançado: distribuição inteligente por tipo de tarefa

Usando o OpenRouter Auto Model:

{
  "models": {
    "defaults": {
      "model": "openrouter/openrouter/auto",
      "fallbacks": [
        "anthropic/claude-sonnet-4-5"
      ]
    }
  }
}

O modo Auto do OpenRouter escolhe automaticamente o modelo adequado mais barato de acordo com a complexidade do prompt. É a opção mais prática.

Regras de roteamento personalizadas com iblai-openclaw-router:

Para ter um controle mais preciso, você pode usar o projeto de código aberto iblai-openclaw-router:

{
  "routing": {
    "enabled": true,
    "tiers": {
      "free": {
        "models": ["ollama/llama3.2"],
        "keywords": ["heartbeat", "status", "ping", "check"]
      },
      "cheap": {
        "models": ["anthropic/claude-haiku-3-5"],
        "maxCostPerRequest": 0.001
      },
      "standard": {
        "models": ["anthropic/claude-sonnet-4-5"]
      },
      "premium": {
        "models": ["anthropic/claude-opus-4-6"],
        "keywords": ["architect", "design", "analyze deeply", "complex"]
      }
    }
  }
}

Caso real: comparação de custos ao longo de um mês

Composição da conta antes da otimização

Uso mensal típico de um desenvolvedor, com base em dados reais da comunidade:

UsoNúmero de requisiçõesTokens estimadosModeloCusto
Conversas diárias800400kOpus 4.6US$ 10,00
Assistência com código200600kOpus 4.6US$ 18,00
Verificações de heartbeat86.400172MOpus 4.6US$ 860,00
Operações com arquivos15075kOpus 4.6US$ 1,88
Tarefas de subagentes300450kOpus 4.6US$ 13,50
TotalUS$ 903,38

Viu o custo das verificações de heartbeat? US$ 860. Esse é o maior culpado.

Conta depois da otimização

Após implementar o roteamento em três camadas:

UsoNúmero de requisiçõesTokens estimadosModeloCusto
Conversas diárias800400kSonnet 4.5US$ 1,60
Assistência com código200600kOpus 4.6US$ 18,00
Verificações de heartbeat86.400172MLlama 3 (local)US$ 0
Operações com arquivos15075kLlama 3 (local)US$ 0
Tarefas de subagentes300450kSonnet 4.5US$ 1,80
TotalUS$ 21,40
97,6%
Percentual economizado

É claro que esse é um exemplo bastante extremo: a proporção de heartbeats desse desenvolvedor era alta demais. Na prática, a economia costuma ficar entre 70% e 80%, dependendo do cenário de uso.

Economia esperada em diferentes cenários

Cenário de usoCusto mensal originalDepois da otimizaçãoEconomia
Usuário leve (<100 mensagens/dia)US$ 50–80US$ 15–2570%
Usuário moderado (100–500 mensagens/dia)US$ 200–400US$ 50–10075%
Usuário intensivo (>500 mensagens/dia + subagentes)US$ 500–1.000US$ 100–25080%

Como evitar problemas: dúvidas comuns e soluções

O modelo local não responde ou retorna erro

Sintomas:

Error: Connection refused
ou o modelo retorna conteúdo vazio

Etapas de diagnóstico:

  1. Confirme que o Ollama está em execução: ollama list
  2. Verifique se a porta está correta: curl http://127.0.0.1:11434/api/tags
  3. Confirme que o modelo foi baixado: ollama pull qwen2.5:14b
  4. Aumente a janela de contexto: alguns modelos usam 4k por padrão, enquanto o OpenClaw precisa de 64k ou mais

Combinações recomendadas com bom custo-benefício:

ollama pull qwen2.5:14b-instruct    # Compatível com ferramentas e funciona bem em chinês
ollama pull mistral-nemo:latest     # Desempenho equilibrado
ollama pull glm-4.7-flash           # Leve e rápido

Falhas nas chamadas de ferramentas

Motivo: nem todos os modelos locais oferecem suporte a function calling.

Soluções:

  • Use modelos que indiquem explicitamente suporte a tool use, como qwen2.5 e mistral-nemo
  • Desative as chamadas de ferramentas para um modelo específico na configuração:
{
  "models": {
    "ollama/llama3.2": {
      "supportsTools": false
    }
  }
}

Erros na configuração da cadeia de fallback

Erro comum:

// Errado: se a Anthropic limitar as requisições, Sonnet e Opus podem ficar indisponíveis ao mesmo tempo
"fallbacks": [
  "anthropic/claude-sonnet-4-5",
  "anthropic/claude-opus-4-6"
]

// Correto: fallbacks entre provedores
"fallbacks": [
  "anthropic/claude-sonnet-4-5",
  "openai/gpt-4o",
  "google/gemini-pro"
]

O que fazer se a qualidade cair?

Se você perceber que o modelo local não consegue lidar com determinadas tarefas:

  1. Aumente o nível aos poucos: local → Haiku → Sonnet → Opus
  2. Use palavras-chave como gatilho: indique claramente a complexidade da tarefa no prompt
  3. Faça revisão humana: para tarefas importantes, você pode exigir confirmação antes da execução

Resumo e lista de ações

Depois de tudo isso, os pontos principais são:

  1. A maior parte do custo vem de heartbeats e consultas simples, e não das “grandes tarefas” que você imagina
  2. Modelos locais dão conta das tarefas rotineiras, portanto não desperdice a cota do Opus
  3. Configure a cadeia de fallback entre provedores para evitar um ponto único de falha
  4. Comece pelo básico: só de direcionar os heartbeats para um modelo local, você já verá uma economia evidente

Três coisas que você pode fazer ainda esta semana

  • Instalar o Ollama e baixar um modelo leve, como llama3.2 ou qwen2.5:7b
  • Editar ~/.openclaw/openclaw.json e apontar o modelo padrão para uma opção local
  • Observar a conta por uma semana e ajustar a estratégia de roteamento

Próximos passos

  • Experimente o iblai-openclaw-router para classificar tarefas de forma inteligente
  • Combine a estratégia com Prompt Caching para reduzir ainda mais o custo de chamadas repetidas
  • Monitore a taxa de sucesso e o tempo de resposta de cada modelo para melhorar continuamente a configuração

Você já otimizou sua conta do OpenClaw? Qual estratégia usou? Compartilhe sua experiência nos comentários ou envie suas dúvidas sobre a configuração — tentarei responder.

FAQ

A configuração de roteamento de modelos do OpenClaw afeta a qualidade das respostas?
Uma configuração bem planejada não prejudica a qualidade. O essencial é separar as tarefas por complexidade: modelos locais dão conta de heartbeats, operações com arquivos e outras tarefas simples; apenas raciocínio complexo e escrita criativa exigem Claude Opus. Comece migrando as tarefas mais simples e avance aos poucos.
Que hardware é necessário para executar modelos locais?
Para tarefas leves, modelos como llama3.2 e qwen2.5:7b funcionam bem com 8 GB de memória; modelos de 14 bilhões de parâmetros são recomendados para máquinas com 16 GB; para modelos com 32 bilhões de parâmetros ou mais, o ideal é ter uma placa de vídeo dedicada. Para uma simples verificação de heartbeat, até um modelo ultraleve de 3 bilhões de parâmetros pode bastar.
Qual é a melhor ordem para uma cadeia de fallback?
Ordene pelo equilíbrio entre custo e desempenho: modelo local → nuvem leve, como Haiku → nuvem padrão, como Sonnet ou GPT-4o → modelo pesado, como Opus. Também distribua os fallbacks entre provedores para evitar que um limite de taxa da Anthropic derrube toda a cadeia.
Quanto costuma ser possível economizar depois da otimização?
Dependendo do cenário, a economia fica entre 70% e 80%. Usuários leves, com menos de 100 mensagens por dia, podem reduzir o gasto mensal de US$ 50–80 para US$ 15–25; usuários intensivos, com mais de 500 mensagens por dia, podem sair de US$ 500–1.000 para US$ 100–250. Quanto maior a proporção de heartbeats, maior tende a ser a economia.

8 min de leitura · Publicado em: 26 fev 2026 · Atualizado em: 4 set 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog