Alternar tema

Tabela de hardware para Ollama: VRAM, quantização e guia de GPU (2026)

Easton editorial illustration: central VRAM capacity gauge matching 7B, 13B, and 70B model blocks to CUDA, ROCm, and Metal docks
4-6 GB
VRAM necessária para 7B Q4
Uma GPU de entrada já consegue rodar
40-48 GB
VRAM necessária para 70B Q4
Exige 48GB+ de memória ou duas GPUs
Automático
Aceleração Metal no Mac
Sem chave extra no Apple Silicon
数据来源: Dados de testes práticos e documentação oficial

Você quer rodar localmente um modelo 7B. Quanta VRAM a GPU precisa ter? E para 13B? Na internet, alguns dizem que 8GB bastam; outros falam em pelo menos 16GB. Em quem confiar?

Essa dúvida me incomodou por vários meses. No ano passado, quando comecei a usar Ollama, comprei uma RTX 3060 12GB pensando: “12GB de VRAM devem ser suficientes”. Na prática, ao rodar um modelo 13B, a VRAM estourou direto, a velocidade caiu para 3 tokens/s e tudo ficou lento demais.

Depois entendi: limite de VRAM é um limite duro. Passou dele, a experiência desaba. Ficou dentro, tudo flui.

Este artigo organiza as GPUs mais comuns, os tamanhos de modelo e os níveis de quantização em tabelas de comparação. Ao final, você consegue julgar rapidamente quais modelos a sua GPU roda e qual placa faz mais sentido para o seu orçamento.

1. Tabela principal: entendendo a VRAM de relance

Primeiro, a fórmula. A necessidade de VRAM fica aproximadamente assim:

VRAM necessária ≈ quantidade de parâmetros (B) x bits de quantização / 8 + KV Cache (1-2GB)

A fórmula parece simples, mas é ela que decide o tamanho de modelo que você consegue rodar. Por exemplo, um modelo 7B em quantização Q4 (4-bit) precisa de cerca de 7 x 4 / 8 = 3,5GB. Somando KV Cache e overhead de execução, o uso real fica em 4-6GB.

Esta é a tabela completa. Vale salvar:

Tamanho do modeloQ4_K_MQ5_K_MQ8_0FP16GPU recomendada
7B4-6 GB5-6 GB7-8 GB14 GBRTX 3060 12GB
13B8-10 GB10-12 GB13-14 GB26 GBRTX 4060 Ti 16GB
32B20-24 GB24-28 GB32-36 GB64 GBRTX 4090 24GB
70B40-48 GB48-56 GB70-80 GB140 GBDuas RTX 3090 / Mac M4 Max 128GB

Há um ponto crucial nessa tabela: quando falta VRAM, o desempenho cai 5 a 20 vezes.

Eu testei uma RTX 3060 12GB rodando 13B Q4_K_M. Ela fica exatamente na linha de limite: às vezes roda, às vezes estoura a VRAM. Quando estoura, o Ollama move parte dos dados para a memória do sistema, e a velocidade cai de 45 tokens/s para 2-3 tokens/s. A sensação é sair de um carro esportivo e cair em algo muito mais lento.

Por isso, ao comprar uma GPU, prefira sobrar 2GB de VRAM em vez de ficar cravado no limite.

2. Escolha de quantização: Q4 vs Q5 vs Q8 na prática

Quantização é o principal recurso para reduzir a necessidade de VRAM.

FP16 é a precisão original do modelo, com cada parâmetro armazenado em 16-bit. Q4 comprime isso para 4-bit, cortando a necessidade de VRAM praticamente pela metade. A pergunta é: essa compressão prejudica a qualidade do modelo?

A resposta: prejudica, mas bem menos do que você imagina.

Veja os dados práticos:

Nível de quantizaçãoVRAM em modelo 7BPerda de qualidadeCenário indicado
Q4_K_M4.5 GB1-3%Uso diário (recomendado)
Q5_K_M5.7 GB<1%Busca por precisão
Q8_07.7 GB<0.5%Qualidade máxima
FP1614 GB0%Pesquisa/comparação de referência

Q4_K_M é a escolha padrão. A perda de qualidade fica em apenas 1-3%, imperceptível na maioria dos cenários. Eu já usei Llama 3.1 8B em Q4_K_M para escrever alguns artigos técnicos e, comparando com a versão FP16, a diferença era difícil de perceber a olho nu.

Q5_K_M faz sentido para quem tem 16GB+ de VRAM. Se você tem uma RTX 4060 Ti 16GB, Q5 entrega uma qualidade de inferência melhor, especialmente em raciocínio matemático e geração de textos longos.

Q8_0 chega perto da qualidade original. Sendo sincero, a menos que você esteja fazendo avaliação de modelo ou pesquisa, não há muita necessidade de usar Q8. A necessidade de VRAM dobra, enquanto o ganho prático é limitado.

Outro ponto: evite Q3 e Q2. Esses níveis de quantização trazem perda visível de qualidade, e o modelo começa a responder coisas sem sentido. A menos que sua VRAM seja realmente insuficiente, como 4GB, não vale a pena.

Minha recomendação: comece com Q4_K_M. Se a qualidade não agradar, suba para Q5. Na maior parte dos casos, Q4 já resolve.

3. Comparativo das três principais tecnologias de aceleração: CUDA vs Metal vs ROCm

Escolher GPU não é apenas olhar VRAM. Também é preciso olhar a tecnologia de aceleração.

Ollama oferece suporte a quatro backends de GPU: NVIDIA CUDA, Apple Metal, AMD ROCm e Vulkan. Cada um tem vantagens e limites. Se você escolhe a plataforma errada, o desempenho pode cair pela metade.

Veja a comparação:

Tecnologia de aceleraçãoHardware indicadoDesempenho em 7BSuporte de sistemaMaturidade
CUDANVIDIA GPU30-80 tok/sWin/Linux★★★★★
MetalApple M1-M420-50 tok/smacOS★★★★★
ROCmAMD RX 700025-60 tok/sPrincipalmente Linux★★★☆☆
VulkanAMD/Intel15-40 tok/sMultiplataforma★★★☆☆

CUDA: a escolha mais estável

NVIDIA CUDA é hoje a solução mais madura. Os drivers são estáveis, a comunidade é forte e a documentação é completa. Depois de instalar o Ollama, o CUDA costuma ser detectado automaticamente, sem muita configuração.

Na minha RTX 3060, rodando Llama 3.1 8B Q4 com CUDA, a média ficou em 45 tokens/s. A inferência foi fluida, a resposta foi rápida e a experiência foi boa.

O problema do CUDA é um só: preço. GPUs NVIDIA carregam um prêmio alto, e uma RTX 4090 hoje fica por volta de US$ 1800.

Metal: primeira escolha para usuários de Mac

Apple Metal funciona muito bem no Mac. M1/M2/M3/M4 são compatíveis, e a arquitetura de memória unificada do Mac traz uma vantagem: VRAM e memória do sistema são compartilhadas, então você consegue rodar modelos maiores.

A aceleração Apple Metal é a principal vantagem no Mac. No Apple Silicon, o Ollama usa Metal automaticamente; com memória unificada suficiente, a configuração fica simples.

Não use OLLAMA_ORIGINS como chave de desempenho. Ela configura origens permitidas/CORS para acesso pelo navegador e não ativa MLX:

# O Ollama usa Metal automaticamente no Apple Silicon
# OLLAMA_ORIGINS só permite origens de navegador adicionais para acessar a API do Ollama
ollama serve

Mas existe um requisito: seu Mac deve ter pelo menos 32GB de memória unificada. Abaixo de 16GB, modelos grandes ficam bem pesados.

ROCm: o caminho mais trabalhoso da AMD

AMD ROCm é aceitável no Linux, mas no Windows ainda dá trabalho. O suporte oficial é mais forte no Linux; a versão para Windows ainda está em fase experimental, com mais bugs e pior compatibilidade.

Se você usa GPU AMD + Windows, recomendo trocar para Vulkan:

OLLAMA_VULKAN=1 ollama serve

Vulkan é multiplataforma. Embora seja um pouco mais lento que CUDA, pelo menos roda com estabilidade.

Minha sugestão: se você não quer se preocupar com configuração, escolha NVIDIA CUDA. Se usa Mac, conte com Metal automático. Para AMD, prefira Linux + ROCm ou Windows + Vulkan.

4. Recomendações de GPU: da entrada ao topo

Esta é a tabela de recomendação por faixa, dividida por orçamento.

Entrada (orçamento de US$ 200-400)

ModeloVRAMModelos indicadosDesempenhoPreço
RTX 3060 12GB12GB7B Q4, 13B Q440-60 tok/sUS$ 250
RX 6600 8GB8GB7B Q430-45 tok/sUS$ 200

RTX 3060 12GB é a melhor entrada. Com 12GB de VRAM, ela roda 7B Q4 e 13B Q4, com custo-benefício muito alto. Muita gente me pergunta: RTX 4060 8GB ou RTX 3060 12GB, qual é melhor para LLM?

A resposta é direta: 3060 12GB. A 4060 tem mais poder de cálculo, mas 8GB de VRAM é um gargalo sério. Rodar modelos 13B estoura a VRAM e a experiência fica ruim.

RX 6600 serve para quem tem orçamento limitado e só quer rodar 7B. Mas no Windows, AMD exige se virar com Vulkan, e a estabilidade não chega perto da NVIDIA.

Intermediário (orçamento de US$ 400-800)

ModeloVRAMModelos indicadosDesempenhoPreço
RTX 4060 Ti 16GB16GB13B Q4/Q8, 14B Q450-80 tok/sUS$ 400
RTX 4070 Super 12GB12GB7B Q8, 13B Q460-90 tok/sUS$ 600

RTX 4060 Ti 16GB é o modelo que eu mais recomendo. Os 16GB de VRAM ficam em um ponto ideal: suficientes para 13B Q8 e também para 14B Q4. Por US$ 400, o custo-benefício é forte.

RTX 4070 Super tem mais poder de cálculo, mas os 12GB de VRAM limitam a placa a 13B Q4. Se você busca velocidade, a 4070 Super é uma boa escolha. Se busca modelos maiores, ainda prefiro a 4060 Ti 16GB.

Alta performance (orçamento de US$ 1.200-2.000)

ModeloVRAMModelos indicadosDesempenhoPreço
RTX 4090 24GB24GB32B Q4, 70B com offload*80-150 tok/sUS$ 1.800
RTX 5090 32GB32GB32B Q8, 70B Q4 com offload*Depende do modeloUS$ 2.000
RX 7900 XTX 24GB24GB32B Q460-100 tok/sUS$ 900

*Nota: placas únicas de 24/32GB precisam de offload e/ou quantização mais agressiva para 70B. Para um 70B Q4 mais estável, duas RTX 3090 ou 48GB+ de memória são mais realistas.

RTX 4090 é a atual escolha topo de linha. Com 24GB de VRAM, roda 32B Q4 sem problema; para 70B, precisa de offload, quantização mais agressiva ou duas GPUs.

RTX 5090 32GB é a nova flagship de 2026, com 32GB de GDDR7. Ela é uma candidata melhor que a 4090 para tentar 70B Q4 em uma única placa, mas contextos longos e overhead de execução ainda podem exigir offload; não trate como solução completa para 70B Q5/Q8.

RX 7900 XTX tem bom custo-benefício: 24GB de VRAM por US$ 900. Mas ROCm no Windows não é estável, então eu só consideraria para usuários de Linux.

Recomendações para usuários de Mac

ChipMemória unificadaModelos indicadosDesempenho
M4 Pro24GB14B Q435-55 tok/s
M4 Max128GB70B Q428-30 tok/s
M3 Ultra192GB70B+, múltiplos modelos em paralelo25-35 tok/s

A memória unificada do Mac permite rodar modelos maiores. Um M4 Max 128GB consegue executar um 70B Q4 completo, sem concessões agressivas de quantização.

Mas o ponto fraco do Mac é a velocidade. O M4 Max roda 70B a apenas 28-30 tok/s, bem mais lento que uma RTX 4090. Se você quer velocidade, NVIDIA ainda é melhor. Se você quer integridade do modelo e facilidade de uso, Mac é uma boa escolha.

Campeã de custo-benefício: RTX 3090 24GB usada

Aqui existe uma opção escondida: RTX 3090 24GB usada.

Hoje, no mercado de usados, uma RTX 3090 fica por volta de US$ 600. Uma placa única de 24GB é ótima para 32B Q4; se o alvo for 70B Q4, duas 3090 são mais realistas, ou você terá de aceitar offload pesado e quantização mais agressiva. O poder de cálculo é menor que o da 4090, mas o preço cai pela metade.

Tenho um amigo que comprou uma 3090 usada e rodou por mais de um ano sem problema. O requisito é encontrar um vendedor confiável e evitar placas usadas para mineração.

5. Fluxo de decisão para compra

Depois das quatro seções acima, talvez ainda pareça muita coisa: muitas tabelas, muitos modelos, várias escolhas. Como decidir?

Use este fluxo simples para chegar a uma decisão passo a passo.

Passo 1: defina o modelo-alvo

Qual modelo você quer rodar? Esta é a pergunta central.

  • Conversa diária e apoio a escrita: 7B já basta (Llama 3.1 8B, Qwen 2.5 7B)
  • Apoio a código e perguntas técnicas: 13B-14B é melhor (Qwen 2.5 14B, DeepSeek Coder)
  • Raciocínio complexo e geração de textos longos: 32B-70B (DeepSeek V3, Qwen 2.5 72B)

A maioria das pessoas deve escolher 7B ou 13B. Modelos 70B só fazem sentido se você tiver uma necessidade específica.

Passo 2: defina sua preferência de quantização

Como escolher a quantização?

  • VRAM apertada: Q4_K_M (escolha padrão)
  • VRAM folgada: Q5_K_M (busca por precisão)
  • Pesquisa e comparação: Q8_0 ou FP16

Minha sugestão é começar por Q4_K_M. Na maior parte dos cenários, a qualidade é suficiente e a exigência de VRAM é baixa.

Passo 3: consulte a tabela para combinar VRAM

Volte para a tabela da primeira seção e encontre a necessidade de VRAM para a combinação modelo + quantização.

Por exemplo, se você quer rodar Llama 3.1 8B Q4_K_M, a tabela aponta 4-6GB. Então você precisa de uma GPU com pelo menos 8GB de VRAM, deixando 2GB de margem de segurança.

Passo 4: escolha a GPU pelo orçamento

Combine a necessidade de VRAM com seu orçamento e confira a tabela de recomendações da quarta seção.

  • Orçamento de US$ 200-400: RTX 3060 12GB
  • Orçamento de US$ 400-800: RTX 4060 Ti 16GB
  • Orçamento de US$ 1.200+: RTX 4090 24GB ou RTX 5090 32GB
  • Usuários de Mac: M4 Max 128GB

Passo 5: confirme o suporte da plataforma

Por fim, confira o sistema operacional:

  • Windows: NVIDIA CUDA é o caminho mais estável; AMD precisa de Vulkan
  • Linux: NVIDIA CUDA e AMD ROCm são estáveis
  • macOS: Apple Metal acelera automaticamente; priorize a capacidade de memória unificada

Exemplo de decisão

Imagine que você quer rodar Llama 3.3 70B:

  1. Modelo-alvo: 70B
  2. Preferência de quantização: Q4_K_M (custo-benefício)
  3. Necessidade de VRAM: a tabela mostra 40-48GB
  4. Orçamento: por volta de US$ 1.500
  5. Plataforma: Windows

Análise do resultado:

  • RTX 4090 24GB: uma única placa não basta; exige duas GPUs ou quantização agressiva
  • RTX 5090 32GB: melhor candidata de placa única para tentar 70B Q4, mas contextos longos ainda podem exigir offload
  • Duas RTX 3090 24GB usadas: US$ 1.200, 48GB de VRAM, alto custo-benefício
  • Mac M4 Max 128GB: roda completo, mas com menor velocidade

Recomendação final: se o orçamento for limitado, escolha duas RTX 3090 usadas. Se você prioriza conveniência CUDA em uma única placa, escolha RTX 5090 32GB. Se você usa Mac, o M4 Max 128GB é a melhor opção de máquina única para rodar 70B completo.

Resumo

A lógica central da escolha de hardware cabe em uma frase: VRAM define o teto; quantização define o piso.

Uma tabela de comparação, uma lista de recomendações e três tecnologias de aceleração: este guia ajuda a tirar a dúvida do caminho.

Se você ainda está indeciso, guarde esta regra de ouro:

  • Orçamento limitado: RTX 3060 12GB, melhor entrada, roda 7B e 13B
  • Busca por desempenho: RTX 4090 24GB ou 4060 Ti 16GB, de intermediário forte a flagship
  • Usuários de Mac: M4 Max 128GB, única solução de máquina única capaz de rodar 70B completo
  • Campeã de custo-benefício: RTX 3090 24GB usada, ótima para 32B em uma placa; para 70B, use duas placas

Para mais dicas práticas de Ollama, veja outros artigos desta série: guia de aceleração por GPU do Ollama e comparativo de escolha de modelos LLM locais.

FAQ

Quanta VRAM um modelo 7B realmente precisa?
Com quantização Q4_K_M, ele precisa de 4-6GB. Somando KV Cache e overhead de execução, recomendo uma GPU com pelo menos 8GB de VRAM.
RTX 3060 12GB ou RTX 4060 8GB: qual é melhor para rodar LLM?
A 3060 12GB. A 4060 tem mais poder de cálculo, mas 8GB de VRAM viram um gargalo sério; modelos 13B estouram a VRAM. Para LLM, VRAM pesa mais que computação bruta.
A quantização Q4 afeta muito a qualidade do modelo?
Não. No Q4_K_M, a perda fica em apenas 1-3%, imperceptível na maioria dos cenários. A menos que você esteja avaliando modelos, Q4 já basta.
GPUs AMD conseguem rodar Ollama?
Sim. No Linux, ROCm é relativamente estável. No Windows, recomendo usar Vulkan, definindo OLLAMA_VULKAN=1.
Como usuários de Mac conseguem o melhor desempenho?
No Apple Silicon, o Ollama usa Metal automaticamente. Não use OLLAMA_ORIGINS como chave de MLX: ela só configura origens permitidas/CORS para acesso pelo navegador. Para aceleração específica com MLX, use um runtime separado baseado em MLX.
Tenho orçamento limitado, mas quero rodar modelos 70B. O que fazer?
Duas RTX 3090 24GB usadas somam 48GB de VRAM por cerca de US$ 1200, o melhor custo-benefício. Outra opção é um Mac M4 Max 128GB em uma única máquina.

12 min de leitura · Publicado em: 28 mai 2026 · Atualizado em: 14 jul 2026

Comentários

Entre com GitHub para comentar

Easton BlogEaston Blog