Tabela de hardware para Ollama: VRAM, quantização e guia de GPU (2026)

Você quer rodar localmente um modelo 7B. Quanta VRAM a GPU precisa ter? E para 13B? Na internet, alguns dizem que 8GB bastam; outros falam em pelo menos 16GB. Em quem confiar?
Essa dúvida me incomodou por vários meses. No ano passado, quando comecei a usar Ollama, comprei uma RTX 3060 12GB pensando: “12GB de VRAM devem ser suficientes”. Na prática, ao rodar um modelo 13B, a VRAM estourou direto, a velocidade caiu para 3 tokens/s e tudo ficou lento demais.
Depois entendi: limite de VRAM é um limite duro. Passou dele, a experiência desaba. Ficou dentro, tudo flui.
Este artigo organiza as GPUs mais comuns, os tamanhos de modelo e os níveis de quantização em tabelas de comparação. Ao final, você consegue julgar rapidamente quais modelos a sua GPU roda e qual placa faz mais sentido para o seu orçamento.
1. Tabela principal: entendendo a VRAM de relance
Primeiro, a fórmula. A necessidade de VRAM fica aproximadamente assim:
VRAM necessária ≈ quantidade de parâmetros (B) x bits de quantização / 8 + KV Cache (1-2GB)
A fórmula parece simples, mas é ela que decide o tamanho de modelo que você consegue rodar. Por exemplo, um modelo 7B em quantização Q4 (4-bit) precisa de cerca de 7 x 4 / 8 = 3,5GB. Somando KV Cache e overhead de execução, o uso real fica em 4-6GB.
Esta é a tabela completa. Vale salvar:
| Tamanho do modelo | Q4_K_M | Q5_K_M | Q8_0 | FP16 | GPU recomendada |
|---|---|---|---|---|---|
| 7B | 4-6 GB | 5-6 GB | 7-8 GB | 14 GB | RTX 3060 12GB |
| 13B | 8-10 GB | 10-12 GB | 13-14 GB | 26 GB | RTX 4060 Ti 16GB |
| 32B | 20-24 GB | 24-28 GB | 32-36 GB | 64 GB | RTX 4090 24GB |
| 70B | 40-48 GB | 48-56 GB | 70-80 GB | 140 GB | Duas RTX 3090 / Mac M4 Max 128GB |
Há um ponto crucial nessa tabela: quando falta VRAM, o desempenho cai 5 a 20 vezes.
Eu testei uma RTX 3060 12GB rodando 13B Q4_K_M. Ela fica exatamente na linha de limite: às vezes roda, às vezes estoura a VRAM. Quando estoura, o Ollama move parte dos dados para a memória do sistema, e a velocidade cai de 45 tokens/s para 2-3 tokens/s. A sensação é sair de um carro esportivo e cair em algo muito mais lento.
Por isso, ao comprar uma GPU, prefira sobrar 2GB de VRAM em vez de ficar cravado no limite.
2. Escolha de quantização: Q4 vs Q5 vs Q8 na prática
Quantização é o principal recurso para reduzir a necessidade de VRAM.
FP16 é a precisão original do modelo, com cada parâmetro armazenado em 16-bit. Q4 comprime isso para 4-bit, cortando a necessidade de VRAM praticamente pela metade. A pergunta é: essa compressão prejudica a qualidade do modelo?
A resposta: prejudica, mas bem menos do que você imagina.
Veja os dados práticos:
| Nível de quantização | VRAM em modelo 7B | Perda de qualidade | Cenário indicado |
|---|---|---|---|
| Q4_K_M | 4.5 GB | 1-3% | Uso diário (recomendado) |
| Q5_K_M | 5.7 GB | <1% | Busca por precisão |
| Q8_0 | 7.7 GB | <0.5% | Qualidade máxima |
| FP16 | 14 GB | 0% | Pesquisa/comparação de referência |
Q4_K_M é a escolha padrão. A perda de qualidade fica em apenas 1-3%, imperceptível na maioria dos cenários. Eu já usei Llama 3.1 8B em Q4_K_M para escrever alguns artigos técnicos e, comparando com a versão FP16, a diferença era difícil de perceber a olho nu.
Q5_K_M faz sentido para quem tem 16GB+ de VRAM. Se você tem uma RTX 4060 Ti 16GB, Q5 entrega uma qualidade de inferência melhor, especialmente em raciocínio matemático e geração de textos longos.
Q8_0 chega perto da qualidade original. Sendo sincero, a menos que você esteja fazendo avaliação de modelo ou pesquisa, não há muita necessidade de usar Q8. A necessidade de VRAM dobra, enquanto o ganho prático é limitado.
Outro ponto: evite Q3 e Q2. Esses níveis de quantização trazem perda visível de qualidade, e o modelo começa a responder coisas sem sentido. A menos que sua VRAM seja realmente insuficiente, como 4GB, não vale a pena.
Minha recomendação: comece com Q4_K_M. Se a qualidade não agradar, suba para Q5. Na maior parte dos casos, Q4 já resolve.
3. Comparativo das três principais tecnologias de aceleração: CUDA vs Metal vs ROCm
Escolher GPU não é apenas olhar VRAM. Também é preciso olhar a tecnologia de aceleração.
Ollama oferece suporte a quatro backends de GPU: NVIDIA CUDA, Apple Metal, AMD ROCm e Vulkan. Cada um tem vantagens e limites. Se você escolhe a plataforma errada, o desempenho pode cair pela metade.
Veja a comparação:
| Tecnologia de aceleração | Hardware indicado | Desempenho em 7B | Suporte de sistema | Maturidade |
|---|---|---|---|---|
| CUDA | NVIDIA GPU | 30-80 tok/s | Win/Linux | ★★★★★ |
| Metal | Apple M1-M4 | 20-50 tok/s | macOS | ★★★★★ |
| ROCm | AMD RX 7000 | 25-60 tok/s | Principalmente Linux | ★★★☆☆ |
| Vulkan | AMD/Intel | 15-40 tok/s | Multiplataforma | ★★★☆☆ |
CUDA: a escolha mais estável
NVIDIA CUDA é hoje a solução mais madura. Os drivers são estáveis, a comunidade é forte e a documentação é completa. Depois de instalar o Ollama, o CUDA costuma ser detectado automaticamente, sem muita configuração.
Na minha RTX 3060, rodando Llama 3.1 8B Q4 com CUDA, a média ficou em 45 tokens/s. A inferência foi fluida, a resposta foi rápida e a experiência foi boa.
O problema do CUDA é um só: preço. GPUs NVIDIA carregam um prêmio alto, e uma RTX 4090 hoje fica por volta de US$ 1800.
Metal: primeira escolha para usuários de Mac
Apple Metal funciona muito bem no Mac. M1/M2/M3/M4 são compatíveis, e a arquitetura de memória unificada do Mac traz uma vantagem: VRAM e memória do sistema são compartilhadas, então você consegue rodar modelos maiores.
A aceleração Apple Metal é a principal vantagem no Mac. No Apple Silicon, o Ollama usa Metal automaticamente; com memória unificada suficiente, a configuração fica simples.
Não use OLLAMA_ORIGINS como chave de desempenho. Ela configura origens permitidas/CORS para acesso pelo navegador e não ativa MLX:
# O Ollama usa Metal automaticamente no Apple Silicon
# OLLAMA_ORIGINS só permite origens de navegador adicionais para acessar a API do Ollama
ollama serve
Mas existe um requisito: seu Mac deve ter pelo menos 32GB de memória unificada. Abaixo de 16GB, modelos grandes ficam bem pesados.
ROCm: o caminho mais trabalhoso da AMD
AMD ROCm é aceitável no Linux, mas no Windows ainda dá trabalho. O suporte oficial é mais forte no Linux; a versão para Windows ainda está em fase experimental, com mais bugs e pior compatibilidade.
Se você usa GPU AMD + Windows, recomendo trocar para Vulkan:
OLLAMA_VULKAN=1 ollama serve
Vulkan é multiplataforma. Embora seja um pouco mais lento que CUDA, pelo menos roda com estabilidade.
Minha sugestão: se você não quer se preocupar com configuração, escolha NVIDIA CUDA. Se usa Mac, conte com Metal automático. Para AMD, prefira Linux + ROCm ou Windows + Vulkan.
4. Recomendações de GPU: da entrada ao topo
Esta é a tabela de recomendação por faixa, dividida por orçamento.
Entrada (orçamento de US$ 200-400)
| Modelo | VRAM | Modelos indicados | Desempenho | Preço |
|---|---|---|---|---|
| RTX 3060 12GB | 12GB | 7B Q4, 13B Q4 | 40-60 tok/s | US$ 250 |
| RX 6600 8GB | 8GB | 7B Q4 | 30-45 tok/s | US$ 200 |
RTX 3060 12GB é a melhor entrada. Com 12GB de VRAM, ela roda 7B Q4 e 13B Q4, com custo-benefício muito alto. Muita gente me pergunta: RTX 4060 8GB ou RTX 3060 12GB, qual é melhor para LLM?
A resposta é direta: 3060 12GB. A 4060 tem mais poder de cálculo, mas 8GB de VRAM é um gargalo sério. Rodar modelos 13B estoura a VRAM e a experiência fica ruim.
RX 6600 serve para quem tem orçamento limitado e só quer rodar 7B. Mas no Windows, AMD exige se virar com Vulkan, e a estabilidade não chega perto da NVIDIA.
Intermediário (orçamento de US$ 400-800)
| Modelo | VRAM | Modelos indicados | Desempenho | Preço |
|---|---|---|---|---|
| RTX 4060 Ti 16GB | 16GB | 13B Q4/Q8, 14B Q4 | 50-80 tok/s | US$ 400 |
| RTX 4070 Super 12GB | 12GB | 7B Q8, 13B Q4 | 60-90 tok/s | US$ 600 |
RTX 4060 Ti 16GB é o modelo que eu mais recomendo. Os 16GB de VRAM ficam em um ponto ideal: suficientes para 13B Q8 e também para 14B Q4. Por US$ 400, o custo-benefício é forte.
RTX 4070 Super tem mais poder de cálculo, mas os 12GB de VRAM limitam a placa a 13B Q4. Se você busca velocidade, a 4070 Super é uma boa escolha. Se busca modelos maiores, ainda prefiro a 4060 Ti 16GB.
Alta performance (orçamento de US$ 1.200-2.000)
| Modelo | VRAM | Modelos indicados | Desempenho | Preço |
|---|---|---|---|---|
| RTX 4090 24GB | 24GB | 32B Q4, 70B com offload* | 80-150 tok/s | US$ 1.800 |
| RTX 5090 32GB | 32GB | 32B Q8, 70B Q4 com offload* | Depende do modelo | US$ 2.000 |
| RX 7900 XTX 24GB | 24GB | 32B Q4 | 60-100 tok/s | US$ 900 |
*Nota: placas únicas de 24/32GB precisam de offload e/ou quantização mais agressiva para 70B. Para um 70B Q4 mais estável, duas RTX 3090 ou 48GB+ de memória são mais realistas.
RTX 4090 é a atual escolha topo de linha. Com 24GB de VRAM, roda 32B Q4 sem problema; para 70B, precisa de offload, quantização mais agressiva ou duas GPUs.
RTX 5090 32GB é a nova flagship de 2026, com 32GB de GDDR7. Ela é uma candidata melhor que a 4090 para tentar 70B Q4 em uma única placa, mas contextos longos e overhead de execução ainda podem exigir offload; não trate como solução completa para 70B Q5/Q8.
RX 7900 XTX tem bom custo-benefício: 24GB de VRAM por US$ 900. Mas ROCm no Windows não é estável, então eu só consideraria para usuários de Linux.
Recomendações para usuários de Mac
| Chip | Memória unificada | Modelos indicados | Desempenho |
|---|---|---|---|
| M4 Pro | 24GB | 14B Q4 | 35-55 tok/s |
| M4 Max | 128GB | 70B Q4 | 28-30 tok/s |
| M3 Ultra | 192GB | 70B+, múltiplos modelos em paralelo | 25-35 tok/s |
A memória unificada do Mac permite rodar modelos maiores. Um M4 Max 128GB consegue executar um 70B Q4 completo, sem concessões agressivas de quantização.
Mas o ponto fraco do Mac é a velocidade. O M4 Max roda 70B a apenas 28-30 tok/s, bem mais lento que uma RTX 4090. Se você quer velocidade, NVIDIA ainda é melhor. Se você quer integridade do modelo e facilidade de uso, Mac é uma boa escolha.
Campeã de custo-benefício: RTX 3090 24GB usada
Aqui existe uma opção escondida: RTX 3090 24GB usada.
Hoje, no mercado de usados, uma RTX 3090 fica por volta de US$ 600. Uma placa única de 24GB é ótima para 32B Q4; se o alvo for 70B Q4, duas 3090 são mais realistas, ou você terá de aceitar offload pesado e quantização mais agressiva. O poder de cálculo é menor que o da 4090, mas o preço cai pela metade.
Tenho um amigo que comprou uma 3090 usada e rodou por mais de um ano sem problema. O requisito é encontrar um vendedor confiável e evitar placas usadas para mineração.
5. Fluxo de decisão para compra
Depois das quatro seções acima, talvez ainda pareça muita coisa: muitas tabelas, muitos modelos, várias escolhas. Como decidir?
Use este fluxo simples para chegar a uma decisão passo a passo.
Passo 1: defina o modelo-alvo
Qual modelo você quer rodar? Esta é a pergunta central.
- Conversa diária e apoio a escrita: 7B já basta (Llama 3.1 8B, Qwen 2.5 7B)
- Apoio a código e perguntas técnicas: 13B-14B é melhor (Qwen 2.5 14B, DeepSeek Coder)
- Raciocínio complexo e geração de textos longos: 32B-70B (DeepSeek V3, Qwen 2.5 72B)
A maioria das pessoas deve escolher 7B ou 13B. Modelos 70B só fazem sentido se você tiver uma necessidade específica.
Passo 2: defina sua preferência de quantização
Como escolher a quantização?
- VRAM apertada: Q4_K_M (escolha padrão)
- VRAM folgada: Q5_K_M (busca por precisão)
- Pesquisa e comparação: Q8_0 ou FP16
Minha sugestão é começar por Q4_K_M. Na maior parte dos cenários, a qualidade é suficiente e a exigência de VRAM é baixa.
Passo 3: consulte a tabela para combinar VRAM
Volte para a tabela da primeira seção e encontre a necessidade de VRAM para a combinação modelo + quantização.
Por exemplo, se você quer rodar Llama 3.1 8B Q4_K_M, a tabela aponta 4-6GB. Então você precisa de uma GPU com pelo menos 8GB de VRAM, deixando 2GB de margem de segurança.
Passo 4: escolha a GPU pelo orçamento
Combine a necessidade de VRAM com seu orçamento e confira a tabela de recomendações da quarta seção.
- Orçamento de US$ 200-400: RTX 3060 12GB
- Orçamento de US$ 400-800: RTX 4060 Ti 16GB
- Orçamento de US$ 1.200+: RTX 4090 24GB ou RTX 5090 32GB
- Usuários de Mac: M4 Max 128GB
Passo 5: confirme o suporte da plataforma
Por fim, confira o sistema operacional:
- Windows: NVIDIA CUDA é o caminho mais estável; AMD precisa de Vulkan
- Linux: NVIDIA CUDA e AMD ROCm são estáveis
- macOS: Apple Metal acelera automaticamente; priorize a capacidade de memória unificada
Exemplo de decisão
Imagine que você quer rodar Llama 3.3 70B:
- Modelo-alvo: 70B
- Preferência de quantização: Q4_K_M (custo-benefício)
- Necessidade de VRAM: a tabela mostra 40-48GB
- Orçamento: por volta de US$ 1.500
- Plataforma: Windows
Análise do resultado:
- RTX 4090 24GB: uma única placa não basta; exige duas GPUs ou quantização agressiva
- RTX 5090 32GB: melhor candidata de placa única para tentar 70B Q4, mas contextos longos ainda podem exigir offload
- Duas RTX 3090 24GB usadas: US$ 1.200, 48GB de VRAM, alto custo-benefício
- Mac M4 Max 128GB: roda completo, mas com menor velocidade
Recomendação final: se o orçamento for limitado, escolha duas RTX 3090 usadas. Se você prioriza conveniência CUDA em uma única placa, escolha RTX 5090 32GB. Se você usa Mac, o M4 Max 128GB é a melhor opção de máquina única para rodar 70B completo.
Resumo
A lógica central da escolha de hardware cabe em uma frase: VRAM define o teto; quantização define o piso.
Uma tabela de comparação, uma lista de recomendações e três tecnologias de aceleração: este guia ajuda a tirar a dúvida do caminho.
Se você ainda está indeciso, guarde esta regra de ouro:
- Orçamento limitado: RTX 3060 12GB, melhor entrada, roda 7B e 13B
- Busca por desempenho: RTX 4090 24GB ou 4060 Ti 16GB, de intermediário forte a flagship
- Usuários de Mac: M4 Max 128GB, única solução de máquina única capaz de rodar 70B completo
- Campeã de custo-benefício: RTX 3090 24GB usada, ótima para 32B em uma placa; para 70B, use duas placas
Para mais dicas práticas de Ollama, veja outros artigos desta série: guia de aceleração por GPU do Ollama e comparativo de escolha de modelos LLM locais.
FAQ
Quanta VRAM um modelo 7B realmente precisa?
RTX 3060 12GB ou RTX 4060 8GB: qual é melhor para rodar LLM?
A quantização Q4 afeta muito a qualidade do modelo?
GPUs AMD conseguem rodar Ollama?
Como usuários de Mac conseguem o melhor desempenho?
Tenho orçamento limitado, mas quero rodar modelos 70B. O que fazer?
12 min de leitura · Publicado em: 28 mai 2026 · Atualizado em: 14 jul 2026
Guia Ollama LLM local
Se você chegou pela busca, o caminho mais rápido é ir para o post anterior ou próximo desta série.
Anterior
Llama 70B local: guia para comparar 5700XT, Mac M4 e CUDA
Quer rodar o Llama 70B localmente? Este guia compara AMD 5700XT, Mac M4 e NVIDIA CUDA com dados práticos para escolher o hardware certo, incluindo VRAM, desempenho e armadilhas.
Parte 5 de 18
Próximo
Aceleração por GPU no Ollama: guia prático com CUDA, ROCm e Metal
Guia completo de aceleração por GPU no Ollama: cobre NVIDIA CUDA, AMD ROCm e Apple Metal, com configuração, verificação, múltiplas GPUs e troubleshooting para acelerar a inferência de LLM local em 10 a 20 vezes.
Parte 7 de 18



Comentários
Entre com GitHub para comentar