Alternar tema

Gerenciamento de modelos no Ollama: guia completo para baixar, alternar, excluir e controlar versões

Easton editorial illustration: local model vault

Quando comecei a usar o Ollama, não percebi um problema: os arquivos dos modelos são realmente grandes.

Até que, certo dia, o SSD avisou que estava sem espaço. Abri o diretório ~/.ollama e encontrei mais de quarenta gigabytes. Na hora pensei: eu nem uso todos esses modelos. Como excluí-los? Como alternar entre versões? E como evitar cair novamente nessa armadilha?

Este artigo reúne o que aprendi depois dessa experiência. Vamos ver os principais comandos para gerenciar modelos no Ollama, do download e da troca de modelos à exclusão e às boas práticas de controle de versões. Ao final, você poderá organizar sua biblioteca local de LLMs com tranquilidade, sem tomar um susto com o espaço em disco.


Tabela de referência rápida dos principais comandos

Primeiro, aqui está uma tabela para consultar quando precisar. Depois, veremos cada comando em detalhes.

ComandoFunçãoExemplo
ollama pullBaixar um modelo, inclusive uma versão específicaollama pull llama3.2:latest
ollama runExecutar um modeloollama run llama3.2
ollama listVer todos os modelos locaisollama list
ollama psVer os modelos em execuçãoollama ps
ollama stopParar um modelo em execuçãoollama stop llama3.2
ollama rmExcluir um modeloollama rm llama3.2
ollama showVer informações detalhadas de um modeloollama show llama3.2
ollama createCriar um modelo personalizadoollama create mymodel -f Modelfile
ollama serveIniciar o serviço de APIollama serve

Essa tabela cobre praticamente 90% das tarefas rotineiras de gerenciamento. Depois de memorizar esses comandos, basta combiná-los conforme a necessidade.


Download de modelos: escolher a versão faz diferença

Baixar uma versão específica

O comando ollama pull baixa um modelo, e você provavelmente já o conhece. Mas existe um detalhe fácil de ignorar: a tag da versão.

# Baixar a versão mais recente
ollama pull llama3.2:latest

# Baixar uma versão com uma quantidade específica de parâmetros
ollama pull llama3.1:70b

# Baixar uma versão com quantização específica
ollama pull mistral:7b-q4_K_M

Talvez você esteja se perguntando qual é a diferença entre essas tags.

É bem simples:

  • latest: tag padrão da versão estável mais recente
  • 7b, 70b: quantidade de parâmetros; quanto maior o número, mais poderoso e mais exigente é o modelo
  • q4_K_M, q3_K_L: nível de quantização; quanto menor o número, menor o arquivo, com uma pequena perda de precisão

Em resumo: escolha a versão de acordo com o seu hardware.

Tabela de requisitos de hardware

Não baixe modelos às cegas. Primeiro, compare a configuração da sua máquina com esta tabela:

Porte do modeloParâmetrosTamanho do arquivoRAM mínimaRAM recomendadaVRAM necessária
Pequeno1-3B1-2 GB4 GB8 GB2-4 GB
Médio7-8B4-5 GB8 GB16 GB6-8 GB
Grande13-14B7-8 GB16 GB32 GB10-12 GB
Muito grande70B40 GB ou mais32 GB64 GB ou mais24 GB ou mais

Pela minha experiência, uma máquina com 8 GB de RAM consegue executar um modelo 7B no limite, mas fica bem lenta. Com 16 GB, o uso é muito mais confortável. Quanto aos modelos 70B, para ser sincero, uma máquina doméstica dificilmente dá conta, a menos que você tenha duas RTX 4090.

Script para download em lote

Se você precisa baixar vários modelos, digitar os comandos um por um é cansativo. Nesse caso, crie um script:

#!/bin/bash
# download_models.sh

MODELS=(
  "llama3.2:latest"
  "mistral:7b"
  "qwen2:7b"
  "deepseek-r1:7b"
)

for model in "${MODELS[@]}"; do
  echo "Baixando: $model"
  ollama pull "$model"
  echo "---"
done

echo "Download de todos os modelos concluído!"

Salve o arquivo como download_models.sh e execute:

chmod +x download_models.sh
./download_models.sh

Assim, todos os modelos necessários são baixados de uma só vez.


Troca de modelos: não deixe a GPU ocupada sem necessidade

Ver a lista de modelos locais

Depois de baixar os modelos, veja quais estão disponíveis:

ollama list

A saída será parecida com esta:

NAME                ID              SIZE    MODIFIED
llama3.2:latest     a80c4f17acd5    2.0GB   2 days ago
mistral:7b          f974a74358d6    4.1GB   5 days ago
qwen2:7b            d53d04290064    2.3GB   10 days ago

O significado de cada campo:

  • NAME: nome e tag do modelo
  • ID: identificador único, que pode ser usado ao excluir o modelo
  • SIZE: tamanho do arquivo, para identificar rapidamente o que ocupa mais espaço
  • MODIFIED: data da última modificação, útil para saber se o modelo é antigo

Com essas informações, fica fácil perceber quais modelos você usa e quais já pode excluir.

Executar um modelo específico

Alternar entre modelos é simples: basta usar ollama run.

# Execução básica
ollama run llama3.2

# Com aceleração por GPU
ollama run llama3.2 --gpu

# Modo detalhado para ver o tempo de carregamento
ollama run llama3.2 --verbose

Há um detalhe: se o modelo ainda não tiver sido baixado, ollama run executará o pull automaticamente. Portanto, você também pode usar run diretamente, sem fazer o pull antes.

Mas fique atento a uma armadilha: depois de iniciado, o modelo continuará ocupando GPU ou CPU até que você o interrompa manualmente. Antes de trocar de modelo, pare o anterior.

Parar um modelo em execução

Primeiro, veja quais modelos estão em execução:

ollama ps

A saída será parecida com esta:

NAME        ID              SIZE    PROCESSOR   UNTIL
llama3.2    a80c4f17acd5    2.0GB   100% GPU    4 minutes from now

Se houver um modelo em execução, pare-o:

ollama stop llama3.2

Isso libera o espaço da GPU para que você possa alternar para o próximo modelo.

Para ser sincero, eu costumava esquecer o stop, e a máquina ficava cada vez mais lenta. Vale criar o hábito: antes de trocar, execute ps e depois stop.


Exclusão de modelos: a chave para liberar espaço em disco

Excluir um único modelo

Chegamos à parte principal: excluir um modelo.

ollama rm llama3.2

Saída:

deleted 'llama3.2'

É simples assim. Mas há um cuidado importante: confirme o nome do modelo antes de excluí-lo, para não apagar o modelo errado. Recomendo executar ollama list primeiro.

Além disso, os arquivos podem não desaparecer imediatamente após a exclusão, pois existe um processo de limpeza. Se o espaço não for liberado na hora, espere alguns minutos e verifique novamente.

Script para exclusão em lote com lista de permissões

Se sua biblioteca de modelos está desorganizada e você quer limpá-la sem excluir os poucos modelos que usa com frequência, crie este script:

#!/bin/bash
# cleanup_models.sh

# Lista de permissões: estes modelos não serão excluídos
KEEP=(
  "llama3.2:latest"
  "mistral:7b"
)

# Obter todos os modelos
ALL_MODELS=$(ollama list | tail -n +2 | awk '{print $1}')

for model in $ALL_MODELS; do
  # Verificar se está na lista de permissões
  keep=false
  for keeper in "${KEEP[@]}"; do
    if [ "$model" == "$keeper" ]; then
      keep=true
      break
    fi
  done

  # Excluir se não estiver na lista de permissões
  if [ "$keep" = false ]; then
    echo "Excluindo: $model"
    ollama rm "$model"
  else
    echo "Mantendo: $model"
  fi
done

echo "Limpeza concluída!"

A lógica do script é simples: primeiro, ele lista todos os modelos e verifica cada um. Os que estiverem na lista de permissões são mantidos; os demais são excluídos.

Você pode editar o array KEEP conforme necessário e incluir os modelos que usa com frequência.

Gerenciar o caminho de armazenamento dos modelos

Excluiu modelos, mas o espaço ainda não é suficiente? Talvez seja necessário ajustar o caminho de armazenamento.

Por padrão, os modelos ficam em:

  • Windows: C:\Users\<nome-de-usuário>\.ollama\models
  • Linux/macOS: ~/.ollama/models

Se a unidade do sistema estiver sem espaço, você pode migrar os modelos para outro disco. Defina a variável de ambiente OLLAMA_MODELS:

# Linux/macOS
export OLLAMA_MODELS=/path/to/your/models

# Windows (PowerShell)
$env:OLLAMA_MODELS="D:\ollama\models"

Depois dessa configuração, os novos modelos serão armazenados no novo caminho. Os modelos antigos continuarão no local original e precisarão ser movidos manualmente.

Minha recomendação é: configure o caminho certo desde o início, em vez de esperar o disco lotar. A migração dá trabalho e pode causar erros.


Controle de versões: estratégias para evitar confusão

Um cenário típico de versões desorganizadas

Talvez você já tenha encontrado algo assim:

llama3.1:latest
llama3.1:8b
llama3.2:latest
llama3.2:1b
llama3.2:3b

Com tantas versões juntas, fica difícil saber qual é usada no dia a dia, qual serve para testes e qual deve ser excluída.

Três recomendações para manter a organização

  1. Use tags para diferenciar a finalidade

    • latest: versão principal para uso diário
    • test, dev: versões de teste
    • Não baixe muitas versões com quantidades diferentes de parâmetros; escolha uma que seja adequada
  2. Faça limpezas periódicas

    • Execute ollama list uma vez por semana para ver se há modelos desnecessários
    • Use o script de limpeza apresentado anteriormente para manter a biblioteca enxuta
  3. Escolha nomes significativos

    • Dê nomes claros aos modelos personalizados
    • Por exemplo, use myproject-llama3.2 em vez de mymodel1 ou mymodel2

Atualizar um modelo com download incremental

O modelo foi atualizado e você quer obter a nova versão?

Basta executar pull novamente:

ollama pull llama3.2:latest

Há uma boa notícia: o Ollama baixa apenas as partes que mudaram, em vez de baixar o arquivo inteiro outra vez. Por isso, a atualização é rápida e não consome tanta largura de banda.

Variantes personalizadas de modelos

Se você quiser ajustar os parâmetros do modelo, como alterar a temperature ou adicionar uma mensagem de sistema, pode usar um Modelfile:

# Criar o Modelfile
FROM llama3.2
PARAMETER temperature 0.7
SYSTEM """Você é um assistente técnico profissional. Responda às perguntas de forma concisa."""

# Criar o modelo personalizado
ollama create my-tech-assistant -f Modelfile

# Executar
ollama run my-tech-assistant

Assim, você terá uma versão personalizada. Se não quiser mais usá-la, basta excluí-la com ollama rm.


Problemas comuns e soluções

O download trava em 99%

Também já passei por isso. O download chega ao último 1% e, de repente, para de avançar.

Isso geralmente acontece por causa de uma interrupção na rede. Para resolver:

# Pressione Ctrl+C para cancelar o download
# Em seguida, execute pull novamente
ollama pull llama3.2

A boa notícia é que o progresso fica salvo, então você não precisa recomeçar do zero. Em geral, a segunda tentativa funciona.

O espaço não foi liberado após a exclusão

Você exclui o modelo, executa df -h e o disco continua cheio.

As possíveis causas são:

  1. O processo de limpeza ainda não terminou; espere alguns minutos
  2. Há arquivos residuais; verifique o caminho manualmente

Verificação manual:

# Ver o tamanho do diretório de modelos
du -sh ~/.ollama/models

# Se ainda estiver muito grande, verifique o conteúdo
ls -lh ~/.ollama/models/blobs/

Localize os arquivos residuais e exclua-os manualmente.

Falha ao trocar de modelo

Se ollama run retornar um erro, as possíveis causas são:

  1. Recursos insuficientes: falta de RAM ou VRAM
  2. Erro de configuração: há um problema no Modelfile

Para resolver:

  • Execute ollama ps e confirme que nenhum outro modelo está ocupando recursos
  • Use --verbose para ver os detalhes do erro
  • Se for um modelo personalizado, verifique a sintaxe do Modelfile

Para concluir

Depois de tudo isso, os três pontos essenciais continuam sendo: baixar, alternar e excluir. Quando você domina esses comandos e mantém um pouco de organização, sem baixar versões aleatoriamente, sua biblioteca local de LLMs fica muito mais enxuta.

Se você usa o OpenClaw, esse gerenciamento é ainda mais importante: o OpenClaw depende do Ollama, e a versão do modelo afeta diretamente a experiência do aplicativo. Recomendo verificar sua biblioteca periodicamente, remover o que não usa e mantê-la organizada.

Quando surgir alguma dúvida, consulte a tabela de referência rápida ou volte à seção correspondente. Espero que este artigo ajude você a evitar algumas dessas armadilhas.


FAQ

Como ver todos os modelos baixados no momento?
Use o comando ollama list. Ele mostra o nome, o ID, o tamanho e a data de modificação de todos os modelos locais. Para consultar os detalhes de um modelo específico, use ollama show seguido do nome do modelo.
O que fazer se o espaço em disco não aumentar imediatamente após excluir um modelo?
Há um processo de limpeza após a exclusão, então espere alguns minutos e verifique novamente. Se o espaço ainda não tiver sido liberado:

• use du -sh ~/.ollama/models para consultar o tamanho do diretório
• entre no diretório blobs e procure arquivos residuais
• exclua manualmente os arquivos de modelo restantes
Como evitar confusão causada pelo download de muitas versões?
Use apenas a tag latest como versão principal do dia a dia e diferencie versões de teste com as tags test ou dev. Não baixe muitas versões com quantidades diferentes de parâmetros; escolha uma adequada ao seu hardware. Consulte ollama list regularmente e remova as versões antigas que não usa.
Como resolver quando o download do modelo trava em 99%?
Isso geralmente acontece por causa de uma interrupção na rede. Pressione Ctrl+C para cancelar o download e execute ollama pull novamente. O progresso é mantido, portanto não é necessário recomeçar do zero; em geral, a segunda tentativa funciona.
É possível executar um modelo 70B em um computador doméstico?
Na prática, é muito difícil. Um modelo 70B precisa de 32 GB ou mais de RAM e pelo menos 24 GB de VRAM. Computadores domésticos comuns, inclusive máquinas com uma única RTX 4090, não dão conta. Prefira modelos 7B ou 14B, ou alugue um servidor em nuvem para executar modelos grandes.
Como atualizar todos os modelos locais em lote?
Crie um script simples:

ollama list | tail -n +2 | awk '{print $1}' | while read model; do
ollama pull "$model"
done

O Ollama baixa apenas as partes que mudaram, então a atualização é rápida. Execute esse script periodicamente para manter a biblioteca de modelos atualizada.

10 min de leitura · Publicado em: 2 abr 2026 · Atualizado em: 4 set 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog