Ollama: Executando Modelos de IA 100% Offline e Privados no seu PC

Ollama: Executando Modelos de IA 100% Offline e Privados no seu PC — aula do módulo Provedores Gratuitos de Alta Performance, na trilha Provedores e Modelos…

Leitura de aproximadamente 5 minutos.

Módulo: Provedores Gratuitos de Alta Performance · Curso: Provedores e Modelos Gratuitos com OpenRouter & OpenCode · Formação: Formação Nível Zero: Ferramentas Essenciais e Gratuitas de IA e Código

Ollama: Executando Modelos de IA 100% Offline e Privados no seu PC

O que você vai aprender

1. Soberania Total e Privacidade Absoluta

Até aqui, aprendemos a conectar nossos editores e scripts a provedores na nuvem (como OpenRouter, Groq e Google AI Studio). Essa abordagem é excelente pela conveniência e poder computacional.

No entanto, existem situações profissionais em que o envio de dados para a internet é terminantemente proibido ou inviável: 1. Sigilo Profissional Rígido: Advogados lidando com minutas contratuais confidenciais, médicos analisando prontuários de pacientes ou contadores processando folhas de pagamento protegidas pela Lei Geral de Proteção de Dados (LGPD). 2. Ambientes sem Internet: Trabalho em viagens de avião, áreas remotas ou servidores corporativos isolados da rede pública (Air-Gapped). 3. Custo e Dependência Zero: A garantia de que sua ferramenta continuará funcionando para sempre, mesmo que um serviço online saia do ar ou altere suas políticas de uso.

A ferramenta que tornou a IA local acessível a qualquer pessoa sem exigir conhecimentos avançados de compilação é o Ollama (ollama.com).


+-------------------------------------------------------------------------------+
|                       ARQUITETURA DA IA 100% LOCAL COM OLLAMA                 |
+-------------------------------------------------------------------------------+
|                                                                               |
|   SUA MÁQUINA FÍSICA (100% Privada e Offline)                                 |
|   ┌───────────────────────────────────────────────────────────────────────┐   |
|   │ [Seu Editor / Terminal]                                               │   |
|   │         │                                                             │   |
|   │         │ (Chama http://localhost:11434 via padrão OpenAI)            │   |
|   │         ▼                                                             │   |
|   │ [Servidor Ollama em segundo plano]                                    │   |
|   │         │                                                             │   |
|   │         ▼                                                             │   |
|   │ [Modelo Local (Gemma 4 / Qwen 3.8)] ──> [Memória RAM / Processador]   │   |
|   │                                                                       │   |
|   │ [Resultado gerado na máquina sem que 1 único byte saia do computador] │   |
|   └───────────────────────────────────────────────────────────────────────┘   |
|                                                                               |
+-------------------------------------------------------------------------------+

2. Requisitos de Hardware: O que seu Computador Suporta?

Ao contrário do que muitos imaginam, você não precisa de um supercomputador com placa de vídeo caríssima para rodar IAs modernas. Graças a técnicas de otimização matemática chamadas quantização (onde os números do modelo são comprimidos sem perda sensível de inteligência), modelos compactos rodam com agilidade em processadores comuns de notebooks.

A regra fundamental para saber qual modelo sua máquina suporta baseia-se na Memória RAM:

| Memória RAM do seu PC | Modelos Recomendados (tamanho do download) | Cenários Ideais de Uso | |---|---|---| | 8 GB de RAM | gemma4:e2b-it-qat (4,3 GB) | Resumos rápidos de textos, classificação e comandos simples. | | 16 GB de RAM | gemma4:12b (7,6 GB) ou gemma4:e4b (9,6 GB) | Excelente equilíbrio entre raciocínio profundo, código e velocidade. | | 32 GB+ de RAM | qwen3.8:27b (18 GB), gemma4:26b (19 GB) ou gemma4:31b (20 GB) | Lógica avançada de programação e resolução de problemas complexos. |

Os tamanhos acima foram consultados em ollama.com/library em setembro de 2026 e mudam a cada versão publicada. A regra prática não muda: o download precisa caber na RAM livre, com folga para o sistema operacional.

3. Comandos Essenciais do Ollama no Terminal

Após baixar o instalador oficial no site https://ollama.com e realizar a instalação padrão no Windows, macOS ou Linux, o Ollama adiciona o comando ollama ao seu terminal:

1. Baixar e Conversar com um Modelo: O comando run baixa o arquivo do modelo na primeira execução e abre uma sessão interativa de chat no terminal imediatamente:


   ollama run gemma4:e2b-it-qat

2. Listar Modelos Instalados no Computador: Para verificar quais modelos já estão salvos no seu disco rígido e quanto espaço estão ocupando:


   ollama list

3. Remover um Modelo para Liberar Espaço: Quando não quiser mais manter um modelo antigo no seu disco:


   ollama rm nome-do-modelo

Conectando o Ollama ao seu Editor

O Ollama roda automaticamente um servidor web local no endereço http://localhost:11434/v1. Como ele adota o formato compatível com a OpenAI, você pode abrir o painel da extensão Cline ou OpenCode no seu editor, selecionar "OpenAI Compatible", apontar para esse endereço local e usar seu assistente de programação sem internet e com custo zero.

4. Armadilhas Comuns e Como Evitar

[!WARNING]
Tentar rodar modelos maiores que a memória RAM disponível: Se o seu computador possui 8 GB de memória RAM e você tentar executar um modelo com download de 67 GB (ollama run llama4:scout), o sistema operacional tentará transferir dados para o disco rígido, fazendo com que o computador fique extremamente lento ou trave. Sempre compare o tamanho do download com a RAM livre antes de baixar: em 8 GB, fique em gemma4:e2b-it-qat (4,3 GB).

Exercício Prático

Vamos inspecionar a capacidade do seu computador e conhecer a biblioteca do Ollama:

1. Verifique a memória RAM da sua máquina:

2. Explore a biblioteca de modelos:

3. Simule a linha de comando de execução:


   ollama run gemma4:e2b-it-qat

(Ao executar esse comando em uma máquina com o Ollama instalado, o download é concluído em poucos minutos e o prompt de conversa fica pronto para uso 100% offline).

Outras aulas do módulo