Com 16 GB de RAM e GPU de 8 GB de VRAM já é possível rodar modelos abertos como Llama e Qwen no próprio computador, com Ollama ou LM Studio, sem assinatura de ChatGPT ou Claude.
Rodar inteligência artificial no próprio computador, sem assinar ChatGPT ou Claude, já é viável até em PCs sem placa de vídeo dedicada: o ponto de entrada para uso diário é 16 GB de RAM e uma GPU com 8 GB de VRAM, suficiente para modelos abertos de 7B a 8B parâmetros, como Llama e Qwen, instalados de graça via Ollama ou LM Studio.
- O mínimo recomendado para IA local é 16 GB de RAM e GPU com 8 GB de VRAM, que roda modelos de 7B a 8B em quantização Q4.
- Para compra ou upgrade, 32 GB de RAM e 12 GB a 16 GB de VRAM dão folga para modelos de 12B a 14B.
- Ollama e LM Studio instalam e rodam os modelos gratuitamente, sem chave de API.
- Entre duas GPUs, a de mais VRAM costuma render mais para IA local, mesmo sendo de geração anterior.
- A TIC Domicílios 2025 estimou que 32% dos usuários de internet no Brasil já usam IA, cerca de 50 milhões de pessoas.
O que significa rodar IA local?
Rodar IA local é baixar um modelo de linguagem aberto e executá-lo no próprio computador, com processamento feito pela CPU, pela RAM e, quando disponível, pela placa de vídeo. Depois do download, a conversa funciona até sem internet, e os dados não saem da máquina.
O resultado não se equipara ao ChatGPT, da OpenAI, nem ao Claude, da Anthropic, que rodam em data centers. Modelos locais menores dão conta de rascunhar e revisar textos, resumir documentos, traduzir e explicar trechos de código, tarefas que cobrem boa parte do uso doméstico.
O apelo de privacidade existe, mas tem limite: processar no PC reduz a exposição de dados a servidores externos, sem garantir 100% de segurança. Para documentos sensíveis, a recomendação é usar versões oficiais dos programas e baixar modelos de catálogos reconhecidos, como os do Ollama e do LM Studio. Quem já se preocupa com o destino das próprias informações em serviços de nuvem pode conferir o guia sobre como baixar e apagar os dados que Google, Meta e Apple guardam sobre você.
O interesse tem lastro no Brasil. A TIC Domicílios 2025, do Cetic.br, estimou que 32% dos usuários de internet no país, cerca de 50 milhões de pessoas com 10 anos ou mais, já usam algum tipo de inteligência artificial. A versão local atrai quem quer cortar a mensalidade ou manter arquivos sensíveis fora de servidores de terceiros.
# publicidade
Mas por que a memória da placa de vídeo pesa tanto nessa conta? Porque, para IA local, o limite está na memória, não na velocidade do chip gráfico.
Por que a vram importa mais que a potência da placa?
VRAM é a memória própria da GPU: quanto maior, mais camadas do modelo ficam na placa e mais rápida sai a resposta. Quatro conceitos explicam a matemática por trás da escolha do hardware.
A RAM é a memória principal do computador e carrega o sistema, os programas e a parte do modelo que não cabe na placa de vídeo. A quantização é a compressão que representa os pesos do modelo com menos bits: versões em 4 bits, chamadas de Q4, ocupam cerca de um quarto do tamanho original, com perda pequena de qualidade em tarefas gerais. Já a janela de contexto é o volume de texto que o modelo mantém ativo durante a conversa, e documentos longos consomem memória além do tamanho do arquivo baixado.
Quando o modelo não cabe inteiro na VRAM, programas baseados no llama.cpp, como o Ollama, dividem as camadas entre a GPU e a RAM. O modelo abre, mas a geração de texto desacelera à medida que mais camadas ficam no processador.
- RAM: carrega o sistema, os programas e a parte do modelo que não cabe na VRAM
- VRAM: memória da GPU; define quantas camadas do modelo rodam com velocidade máxima
- Quantização (Q4): reduz o modelo a cerca de do tamanho original com perda pequena de qualidade
- Janela de contexto: volume de texto mantido na conversa; documentos longos exigem memória extra
Qual é o mínimo de hardware para rodar IA local?
As faixas de hardware valem para PCs com Windows ou Linux e vão de um teste sem placa dedicada até rigs para modelos grandes. A tabela abaixo resume as configurações descritas no guia.
E no mac com Apple silicon?
Em Macs com Apple Silicon, CPU e GPU compartilham a mesma memória unificada, e a conta passa a ser o total do aparelho. 16 GB é o mínimo confortável; 24 GB ou 32 GB abrem espaço para modelos maiores.
Na prática, isso torna os Macs uma exceção: GPUs integradas em PCs dividem a memória com o sistema e não substituem uma placa dedicada, ao contrário dos chips da Apple.
Precisa de placa Nvidia?
Não é obrigatório, mas simplifica a instalação. A maior parte dos programas de IA local é otimizada para CUDA, a plataforma da NVIDIA. O Ollama também suporta placas AMD Radeon no Windows e no Linux, onde exige o driver ROCm v7, com configuração que pede mais conferência de driver.
Qual placa de vídeo comprar para IA local?
Entre duas placas, a de mais VRAM costuma render mais para IA local, mesmo sendo de geração anterior. Uma GPU nova de 8 GB pode ir melhor em jogos e, ao mesmo tempo, carregar menos modelo que uma de 12 GB.
A GeForce RTX 3060 de 12 GB virou referência de entrada por combinar essa memória com suporte a CUDA, inclusive no mercado de usados. Placas de 16 GB, como a RTX 5060 Ti nessa versão, ampliam a folga para modelos de 14B.
Antes de comprar, qual deve ser a ordem de prioridade? O guia aponta quatro pontos: VRAM de 12 GB como alvo mínimo para o upgrade fazer diferença e 16 GB para durar mais; RAM do sistema em dia, porque manter 8 GB anula parte do ganho da placa nova; em usadas, conferir garantia e procedência; e checar potência da fonte, conectores de energia e espaço físico no gabinete.
- VRAM: 12 GB como alvo mínimo; 16 GB para durar mais
- RAM do sistema: 8 GB de RAM anula parte do ganho da placa nova
- Estado e procedência: em placas usadas, conferir garantia e histórico de uso
- Fonte e gabinete: checar potência da fonte, conectores de energia e espaço físico
Qual modelo baixar primeiro?
Modelos pequenos permitem avaliar o PC antes de downloads maiores. No catálogo do Ollama, três opções compactas servem de ponto de partida: o Llama 3.2 3B, da Meta, com cerca de 2 GB; o Qwen3 4B, da Alibaba, com cerca de 2,5 GB; e o Gemma 3 4B, do Google, com cerca de 3,3 GB, que aceita texto e imagem.
Com 8 GB de VRAM, dá para subir para modelos de 7B a 8B, como o Llama 3.1 8B e o Qwen3 8B. A fluência em português varia entre modelos, e testar com tarefas reais, como revisar um e-mail, mostra o resultado antes de qualquer upgrade.
Quantização Q4 é a compressão que representa os pesos de um modelo de IA com 4 bits por peso, reduzindo o tamanho a cerca de um quarto do original, com perda pequena de qualidade em tarefas gerais.
Como rodar IA local com o ollama
O Ollama funciona no Windows, no macOS e no Linux e roda modelos pelo terminal, sem chave de API. O passo a passo completo:
- 1. Baixe o instalador no site oficial do Ollama; no Windows, não exige permissão de administrador
- 2. Reserve ao menos 20 GB livres no SSD para os modelos
- 3. Abra o terminal: no Windows, PowerShell ou Prompt de Comando
- 4. Rode o primeiro modelo com
ollama run llama3.2:3b; em PCs modestos, useollama run llama3.2:1b - 5. Encerre a sessão digitando
/bye
Como usar o lm studio SEM terminal
O LM Studio oferece interface gráfica e roda em Macs com Apple Silicon, Windows e Linux; em processadores x64, exige suporte à instrução AVX2. Basta baixar a versão do sistema no site oficial do LM Studio, pesquisar o modelo na área de descoberta e conferir o indicador de compatibilidade, que mostra se o arquivo cabe na memória do computador antes do download.
Para o primeiro teste, a recomendação é escolher versões quantizadas em Q4. Depois do download, é só selecionar o modelo e iniciar o chat. Para quem trabalha com textos longos, vale combinar a experiência com as técnicas de resumir documentos longos com IA que o portal já detalhou.
Info: modelos locais menores lidam bem com rascunho e revisão de textos, resumo, tradução e explicação de código, mas não se equiparam aos modelos pagos da OpenAI e da Anthropic.
Dica: teste a fluência em português com uma tarefa real do seu dia a dia, como revisar um e-mail, antes de investir em upgrade de hardware.
Atenção: processar dados no próprio PC reduz a exposição a servidores externos, mas não garante 100% de segurança. Use apenas versões oficiais dos programas e catálogos reconhecidos de modelos.
| Perfil de uso | RAM | VRAM | Modelos suportados |
|---|---|---|---|
| Teste sem GPU dedicada | 16 GB (com 8 GB, só os menores) | Nenhuma | 1B a 4B, com respostas lentas |
| Mínimo recomendado | 16 GB | 8 GB | 7B a 8B em Q4, inteiros na placa |
| Melhor equilíbrio para upgrade | 32 GB + SSD de 1 TB | 12 GB a 16 GB | 12B a 14B em Q4, contextos maiores |
| Modelos grandes | 64 GB | 24 GB | 27B a 32B em quantização agressiva |
| Mac com Apple Silicon | 16 GB no mínimo; 24–32 GB ideal | Memória unificada | Modelos maiores conforme o total |
Arraste para o lado para ver toda a tabela.
Na avaliação do Mercado de TI, o movimento indica uma democratização gradual do acesso a modelos de linguagem: com hardware de entrada cada vez mais acessível no mercado de usados, a assinatura deixa de ser a única porta de entrada para quem trabalha com texto e código. O próximo passo natural para quem começa é acompanhar os lançamentos de modelos abertos, como o Muse Glimmer, da Meta, pensado para agentes pessoais em hardware comum.
Fonte: Exame Tecnologia
Quem escreveu
Dagmar Cirino · Editor-chefe
Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, transparentes e acessí...