Gerenciamento de modelos no Ollama: guia completo para baixar, alternar, excluir e controlar versões

Quando comecei a usar o Ollama, não percebi um problema: os arquivos dos modelos são realmente grandes.
Até que, certo dia, o SSD avisou que estava sem espaço. Abri o diretório ~/.ollama e encontrei mais de quarenta gigabytes. Na hora pensei: eu nem uso todos esses modelos. Como excluí-los? Como alternar entre versões? E como evitar cair novamente nessa armadilha?
Este artigo reúne o que aprendi depois dessa experiência. Vamos ver os principais comandos para gerenciar modelos no Ollama, do download e da troca de modelos à exclusão e às boas práticas de controle de versões. Ao final, você poderá organizar sua biblioteca local de LLMs com tranquilidade, sem tomar um susto com o espaço em disco.
Tabela de referência rápida dos principais comandos
Primeiro, aqui está uma tabela para consultar quando precisar. Depois, veremos cada comando em detalhes.
| Comando | Função | Exemplo |
|---|---|---|
ollama pull | Baixar um modelo, inclusive uma versão específica | ollama pull llama3.2:latest |
ollama run | Executar um modelo | ollama run llama3.2 |
ollama list | Ver todos os modelos locais | ollama list |
ollama ps | Ver os modelos em execução | ollama ps |
ollama stop | Parar um modelo em execução | ollama stop llama3.2 |
ollama rm | Excluir um modelo | ollama rm llama3.2 |
ollama show | Ver informações detalhadas de um modelo | ollama show llama3.2 |
ollama create | Criar um modelo personalizado | ollama create mymodel -f Modelfile |
ollama serve | Iniciar o serviço de API | ollama serve |
Essa tabela cobre praticamente 90% das tarefas rotineiras de gerenciamento. Depois de memorizar esses comandos, basta combiná-los conforme a necessidade.
Download de modelos: escolher a versão faz diferença
Baixar uma versão específica
O comando ollama pull baixa um modelo, e você provavelmente já o conhece. Mas existe um detalhe fácil de ignorar: a tag da versão.
# Baixar a versão mais recente
ollama pull llama3.2:latest
# Baixar uma versão com uma quantidade específica de parâmetros
ollama pull llama3.1:70b
# Baixar uma versão com quantização específica
ollama pull mistral:7b-q4_K_M
Talvez você esteja se perguntando qual é a diferença entre essas tags.
É bem simples:
latest: tag padrão da versão estável mais recente7b,70b: quantidade de parâmetros; quanto maior o número, mais poderoso e mais exigente é o modeloq4_K_M,q3_K_L: nível de quantização; quanto menor o número, menor o arquivo, com uma pequena perda de precisão
Em resumo: escolha a versão de acordo com o seu hardware.
Tabela de requisitos de hardware
Não baixe modelos às cegas. Primeiro, compare a configuração da sua máquina com esta tabela:
| Porte do modelo | Parâmetros | Tamanho do arquivo | RAM mínima | RAM recomendada | VRAM necessária |
|---|---|---|---|---|---|
| Pequeno | 1-3B | 1-2 GB | 4 GB | 8 GB | 2-4 GB |
| Médio | 7-8B | 4-5 GB | 8 GB | 16 GB | 6-8 GB |
| Grande | 13-14B | 7-8 GB | 16 GB | 32 GB | 10-12 GB |
| Muito grande | 70B | 40 GB ou mais | 32 GB | 64 GB ou mais | 24 GB ou mais |
Pela minha experiência, uma máquina com 8 GB de RAM consegue executar um modelo 7B no limite, mas fica bem lenta. Com 16 GB, o uso é muito mais confortável. Quanto aos modelos 70B, para ser sincero, uma máquina doméstica dificilmente dá conta, a menos que você tenha duas RTX 4090.
Script para download em lote
Se você precisa baixar vários modelos, digitar os comandos um por um é cansativo. Nesse caso, crie um script:
#!/bin/bash
# download_models.sh
MODELS=(
"llama3.2:latest"
"mistral:7b"
"qwen2:7b"
"deepseek-r1:7b"
)
for model in "${MODELS[@]}"; do
echo "Baixando: $model"
ollama pull "$model"
echo "---"
done
echo "Download de todos os modelos concluído!"
Salve o arquivo como download_models.sh e execute:
chmod +x download_models.sh
./download_models.sh
Assim, todos os modelos necessários são baixados de uma só vez.
Troca de modelos: não deixe a GPU ocupada sem necessidade
Ver a lista de modelos locais
Depois de baixar os modelos, veja quais estão disponíveis:
ollama list
A saída será parecida com esta:
NAME ID SIZE MODIFIED
llama3.2:latest a80c4f17acd5 2.0GB 2 days ago
mistral:7b f974a74358d6 4.1GB 5 days ago
qwen2:7b d53d04290064 2.3GB 10 days ago
O significado de cada campo:
- NAME: nome e tag do modelo
- ID: identificador único, que pode ser usado ao excluir o modelo
- SIZE: tamanho do arquivo, para identificar rapidamente o que ocupa mais espaço
- MODIFIED: data da última modificação, útil para saber se o modelo é antigo
Com essas informações, fica fácil perceber quais modelos você usa e quais já pode excluir.
Executar um modelo específico
Alternar entre modelos é simples: basta usar ollama run.
# Execução básica
ollama run llama3.2
# Com aceleração por GPU
ollama run llama3.2 --gpu
# Modo detalhado para ver o tempo de carregamento
ollama run llama3.2 --verbose
Há um detalhe: se o modelo ainda não tiver sido baixado, ollama run executará o pull automaticamente. Portanto, você também pode usar run diretamente, sem fazer o pull antes.
Mas fique atento a uma armadilha: depois de iniciado, o modelo continuará ocupando GPU ou CPU até que você o interrompa manualmente. Antes de trocar de modelo, pare o anterior.
Parar um modelo em execução
Primeiro, veja quais modelos estão em execução:
ollama ps
A saída será parecida com esta:
NAME ID SIZE PROCESSOR UNTIL
llama3.2 a80c4f17acd5 2.0GB 100% GPU 4 minutes from now
Se houver um modelo em execução, pare-o:
ollama stop llama3.2
Isso libera o espaço da GPU para que você possa alternar para o próximo modelo.
Para ser sincero, eu costumava esquecer o stop, e a máquina ficava cada vez mais lenta. Vale criar o hábito: antes de trocar, execute ps e depois stop.
Exclusão de modelos: a chave para liberar espaço em disco
Excluir um único modelo
Chegamos à parte principal: excluir um modelo.
ollama rm llama3.2
Saída:
deleted 'llama3.2'
É simples assim. Mas há um cuidado importante: confirme o nome do modelo antes de excluí-lo, para não apagar o modelo errado. Recomendo executar ollama list primeiro.
Além disso, os arquivos podem não desaparecer imediatamente após a exclusão, pois existe um processo de limpeza. Se o espaço não for liberado na hora, espere alguns minutos e verifique novamente.
Script para exclusão em lote com lista de permissões
Se sua biblioteca de modelos está desorganizada e você quer limpá-la sem excluir os poucos modelos que usa com frequência, crie este script:
#!/bin/bash
# cleanup_models.sh
# Lista de permissões: estes modelos não serão excluídos
KEEP=(
"llama3.2:latest"
"mistral:7b"
)
# Obter todos os modelos
ALL_MODELS=$(ollama list | tail -n +2 | awk '{print $1}')
for model in $ALL_MODELS; do
# Verificar se está na lista de permissões
keep=false
for keeper in "${KEEP[@]}"; do
if [ "$model" == "$keeper" ]; then
keep=true
break
fi
done
# Excluir se não estiver na lista de permissões
if [ "$keep" = false ]; then
echo "Excluindo: $model"
ollama rm "$model"
else
echo "Mantendo: $model"
fi
done
echo "Limpeza concluída!"
A lógica do script é simples: primeiro, ele lista todos os modelos e verifica cada um. Os que estiverem na lista de permissões são mantidos; os demais são excluídos.
Você pode editar o array KEEP conforme necessário e incluir os modelos que usa com frequência.
Gerenciar o caminho de armazenamento dos modelos
Excluiu modelos, mas o espaço ainda não é suficiente? Talvez seja necessário ajustar o caminho de armazenamento.
Por padrão, os modelos ficam em:
- Windows:
C:\Users\<nome-de-usuário>\.ollama\models - Linux/macOS:
~/.ollama/models
Se a unidade do sistema estiver sem espaço, você pode migrar os modelos para outro disco. Defina a variável de ambiente OLLAMA_MODELS:
# Linux/macOS
export OLLAMA_MODELS=/path/to/your/models
# Windows (PowerShell)
$env:OLLAMA_MODELS="D:\ollama\models"
Depois dessa configuração, os novos modelos serão armazenados no novo caminho. Os modelos antigos continuarão no local original e precisarão ser movidos manualmente.
Minha recomendação é: configure o caminho certo desde o início, em vez de esperar o disco lotar. A migração dá trabalho e pode causar erros.
Controle de versões: estratégias para evitar confusão
Um cenário típico de versões desorganizadas
Talvez você já tenha encontrado algo assim:
llama3.1:latest
llama3.1:8b
llama3.2:latest
llama3.2:1b
llama3.2:3b
Com tantas versões juntas, fica difícil saber qual é usada no dia a dia, qual serve para testes e qual deve ser excluída.
Três recomendações para manter a organização
-
Use tags para diferenciar a finalidade
latest: versão principal para uso diáriotest,dev: versões de teste- Não baixe muitas versões com quantidades diferentes de parâmetros; escolha uma que seja adequada
-
Faça limpezas periódicas
- Execute
ollama listuma vez por semana para ver se há modelos desnecessários - Use o script de limpeza apresentado anteriormente para manter a biblioteca enxuta
- Execute
-
Escolha nomes significativos
- Dê nomes claros aos modelos personalizados
- Por exemplo, use
myproject-llama3.2em vez demymodel1oumymodel2
Atualizar um modelo com download incremental
O modelo foi atualizado e você quer obter a nova versão?
Basta executar pull novamente:
ollama pull llama3.2:latest
Há uma boa notícia: o Ollama baixa apenas as partes que mudaram, em vez de baixar o arquivo inteiro outra vez. Por isso, a atualização é rápida e não consome tanta largura de banda.
Variantes personalizadas de modelos
Se você quiser ajustar os parâmetros do modelo, como alterar a temperature ou adicionar uma mensagem de sistema, pode usar um Modelfile:
# Criar o Modelfile
FROM llama3.2
PARAMETER temperature 0.7
SYSTEM """Você é um assistente técnico profissional. Responda às perguntas de forma concisa."""
# Criar o modelo personalizado
ollama create my-tech-assistant -f Modelfile
# Executar
ollama run my-tech-assistant
Assim, você terá uma versão personalizada. Se não quiser mais usá-la, basta excluí-la com ollama rm.
Problemas comuns e soluções
O download trava em 99%
Também já passei por isso. O download chega ao último 1% e, de repente, para de avançar.
Isso geralmente acontece por causa de uma interrupção na rede. Para resolver:
# Pressione Ctrl+C para cancelar o download
# Em seguida, execute pull novamente
ollama pull llama3.2
A boa notícia é que o progresso fica salvo, então você não precisa recomeçar do zero. Em geral, a segunda tentativa funciona.
O espaço não foi liberado após a exclusão
Você exclui o modelo, executa df -h e o disco continua cheio.
As possíveis causas são:
- O processo de limpeza ainda não terminou; espere alguns minutos
- Há arquivos residuais; verifique o caminho manualmente
Verificação manual:
# Ver o tamanho do diretório de modelos
du -sh ~/.ollama/models
# Se ainda estiver muito grande, verifique o conteúdo
ls -lh ~/.ollama/models/blobs/
Localize os arquivos residuais e exclua-os manualmente.
Falha ao trocar de modelo
Se ollama run retornar um erro, as possíveis causas são:
- Recursos insuficientes: falta de RAM ou VRAM
- Erro de configuração: há um problema no Modelfile
Para resolver:
- Execute
ollama pse confirme que nenhum outro modelo está ocupando recursos - Use
--verbosepara ver os detalhes do erro - Se for um modelo personalizado, verifique a sintaxe do Modelfile
Para concluir
Depois de tudo isso, os três pontos essenciais continuam sendo: baixar, alternar e excluir. Quando você domina esses comandos e mantém um pouco de organização, sem baixar versões aleatoriamente, sua biblioteca local de LLMs fica muito mais enxuta.
Se você usa o OpenClaw, esse gerenciamento é ainda mais importante: o OpenClaw depende do Ollama, e a versão do modelo afeta diretamente a experiência do aplicativo. Recomendo verificar sua biblioteca periodicamente, remover o que não usa e mantê-la organizada.
Quando surgir alguma dúvida, consulte a tabela de referência rápida ou volte à seção correspondente. Espero que este artigo ajude você a evitar algumas dessas armadilhas.
FAQ
Como ver todos os modelos baixados no momento?
O que fazer se o espaço em disco não aumentar imediatamente após excluir um modelo?
• use du -sh ~/.ollama/models para consultar o tamanho do diretório
• entre no diretório blobs e procure arquivos residuais
• exclua manualmente os arquivos de modelo restantes
Como evitar confusão causada pelo download de muitas versões?
Como resolver quando o download do modelo trava em 99%?
É possível executar um modelo 70B em um computador doméstico?
Como atualizar todos os modelos locais em lote?
ollama list | tail -n +2 | awk '{print $1}' | while read model; do
ollama pull "$model"
done
O Ollama baixa apenas as partes que mudaram, então a atualização é rápida. Execute esse script periodicamente para manter a biblioteca de modelos atualizada.
10 min de leitura · Publicado em: 2 abr 2026 · Atualizado em: 4 set 2026
Guia Ollama LLM local
Se você chegou pela busca, o caminho mais rápido é ir para o post anterior ou próximo desta série.
Anterior
Ollama: como instalar e executar LLMs localmente
Aprenda a instalar e configurar o Ollama, gerenciar modelos, ativar a aceleração por GPU e integrar LLMs locais às suas aplicações por API.
Parte 1 de 13
Próximo
Ollama Modelfile: parâmetros e modelos personalizados
Entenda os 10 principais parâmetros do Ollama Modelfile, ajuste temperature e num_ctx e use quatro modelos prontos para criar versões personalizadas.
Parte 3 de 13



Comentários
Entre com GitHub para comentar