Ollama: Executando Modelos de IA 100% Offline e Privados no seu PC — aula do módulo Provedores Gratuitos de Alta Performance, na trilha Provedores e Modelos…
Leitura de aproximadamente 5 minutos.
Módulo: Provedores Gratuitos de Alta Performance · Curso: Provedores e Modelos Gratuitos com OpenRouter & OpenCode · Formação: Formação Nível Zero: Ferramentas Essenciais e Gratuitas de IA e Código
Até aqui, aprendemos a conectar nossos editores e scripts a provedores na nuvem (como OpenRouter, Groq e Google AI Studio). Essa abordagem é excelente pela conveniência e poder computacional.
No entanto, existem situações profissionais em que o envio de dados para a internet é terminantemente proibido ou inviável: 1. Sigilo Profissional Rígido: Advogados lidando com minutas contratuais confidenciais, médicos analisando prontuários de pacientes ou contadores processando folhas de pagamento protegidas pela Lei Geral de Proteção de Dados (LGPD). 2. Ambientes sem Internet: Trabalho em viagens de avião, áreas remotas ou servidores corporativos isolados da rede pública (Air-Gapped). 3. Custo e Dependência Zero: A garantia de que sua ferramenta continuará funcionando para sempre, mesmo que um serviço online saia do ar ou altere suas políticas de uso.
A ferramenta que tornou a IA local acessível a qualquer pessoa sem exigir conhecimentos avançados de compilação é o Ollama (ollama.com).
+-------------------------------------------------------------------------------+
| ARQUITETURA DA IA 100% LOCAL COM OLLAMA |
+-------------------------------------------------------------------------------+
| |
| SUA MÁQUINA FÍSICA (100% Privada e Offline) |
| ┌───────────────────────────────────────────────────────────────────────┐ |
| │ [Seu Editor / Terminal] │ |
| │ │ │ |
| │ │ (Chama http://localhost:11434 via padrão OpenAI) │ |
| │ ▼ │ |
| │ [Servidor Ollama em segundo plano] │ |
| │ │ │ |
| │ ▼ │ |
| │ [Modelo Local (Gemma 4 / Qwen 3.8)] ──> [Memória RAM / Processador] │ |
| │ │ |
| │ [Resultado gerado na máquina sem que 1 único byte saia do computador] │ |
| └───────────────────────────────────────────────────────────────────────┘ |
| |
+-------------------------------------------------------------------------------+
Ao contrário do que muitos imaginam, você não precisa de um supercomputador com placa de vídeo caríssima para rodar IAs modernas. Graças a técnicas de otimização matemática chamadas quantização (onde os números do modelo são comprimidos sem perda sensível de inteligência), modelos compactos rodam com agilidade em processadores comuns de notebooks.
A regra fundamental para saber qual modelo sua máquina suporta baseia-se na Memória RAM:
| Memória RAM do seu PC | Modelos Recomendados (tamanho do download) | Cenários Ideais de Uso | |---|---|---| | 8 GB de RAM | gemma4:e2b-it-qat (4,3 GB) | Resumos rápidos de textos, classificação e comandos simples. | | 16 GB de RAM | gemma4:12b (7,6 GB) ou gemma4:e4b (9,6 GB) | Excelente equilíbrio entre raciocínio profundo, código e velocidade. | | 32 GB+ de RAM | qwen3.8:27b (18 GB), gemma4:26b (19 GB) ou gemma4:31b (20 GB) | Lógica avançada de programação e resolução de problemas complexos. |
Os tamanhos acima foram consultados em ollama.com/library em setembro de 2026 e mudam a cada versão publicada. A regra prática não muda: o download precisa caber na RAM livre, com folga para o sistema operacional.
Após baixar o instalador oficial no site https://ollama.com e realizar a instalação padrão no Windows, macOS ou Linux, o Ollama adiciona o comando ollama ao seu terminal:
1. Baixar e Conversar com um Modelo: O comando run baixa o arquivo do modelo na primeira execução e abre uma sessão interativa de chat no terminal imediatamente:
ollama run gemma4:e2b-it-qat
2. Listar Modelos Instalados no Computador: Para verificar quais modelos já estão salvos no seu disco rígido e quanto espaço estão ocupando:
ollama list
3. Remover um Modelo para Liberar Espaço: Quando não quiser mais manter um modelo antigo no seu disco:
ollama rm nome-do-modelo
O Ollama roda automaticamente um servidor web local no endereço http://localhost:11434/v1. Como ele adota o formato compatível com a OpenAI, você pode abrir o painel da extensão Cline ou OpenCode no seu editor, selecionar "OpenAI Compatible", apontar para esse endereço local e usar seu assistente de programação sem internet e com custo zero.
[!WARNING]
Tentar rodar modelos maiores que a memória RAM disponível: Se o seu computador possui 8 GB de memória RAM e você tentar executar um modelo com download de 67 GB (ollama run llama4:scout), o sistema operacional tentará transferir dados para o disco rígido, fazendo com que o computador fique extremamente lento ou trave. Sempre compare o tamanho do download com a RAM livre antes de baixar: em 8 GB, fique emgemma4:e2b-it-qat(4,3 GB).
Vamos inspecionar a capacidade do seu computador e conhecer a biblioteca do Ollama:
1. Verifique a memória RAM da sua máquina:
Ctrl + Shift + Esc para abrir o Gerenciador de Tarefas, clique na aba Desempenho e observe a quantidade de Memória instalada (ex: 8 GB, 16 GB ou 32 GB).2. Explore a biblioteca de modelos:
https://ollama.com/library.3. Simule a linha de comando de execução:
ollama run gemma4:e2b-it-qat
(Ao executar esse comando em uma máquina com o Ollama instalado, o download é concluído em poucos minutos e o prompt de conversa fica pronto para uso 100% offline).