Como rodar uma IA no seu computador com Ollama: guia para modelos locais
Um passo a passo para rodar modelos de linguagem no próprio computador com o Ollama: o que você precisa, como instalar, os comandos básicos, a API local, os cuidados de segurança e quando vale a pena.
Por Equipe Global World Connect
8 min de leitura

Nem toda IA precisa rodar em servidores de uma empresa. Existem modelos abertos que você pode baixar e executar no próprio computador, sem enviar suas conversas para a internet. O Ollama é uma das ferramentas mais usadas para isso.
Este guia explica o que é preciso para rodar um modelo local, como instalar e usar o Ollama, como chamá-lo por programação e quais são os limites dessa abordagem. Como a ferramenta e os modelos evoluem rápido, os comandos seguem a documentação oficial consultada em setembro de 2026, e você deve conferi-la antes de instalar.
O que significa rodar uma IA localmente
Ao usar um assistente online, o seu texto viaja até um servidor, é processado lá e a resposta volta. Em uma IA local, o modelo fica salvo no seu computador, e o processamento acontece nele.
As consequências práticas:
- Privacidade: os dados do modelo em execução não precisam sair da sua máquina.
- Funciona sem internet depois que o modelo foi baixado.
- Sem custo por uso, embora haja custo de hardware e energia.
- Menos capacidade: os modelos que cabem em um computador comum costumam ser menores e menos capazes do que os maiores modelos online.
Para entender por que o tamanho do modelo importa, veja como funcionam os modelos de linguagem.
O que é o Ollama
O Ollama é um programa de código aberto, sob licença MIT, que facilita baixar, gerenciar e executar modelos de linguagem localmente. Ele funciona no Windows, no macOS e no Linux, e também tem uma imagem oficial para Docker.
Além de conversar pelo terminal, ele oferece uma API local, que permite que outros programas usem o modelo. A biblioteca de modelos disponíveis fica no site oficial do projeto e inclui várias famílias de modelos abertos.
O que você precisa
Hardware
O requisito principal é memória. Os modelos precisam ser carregados na memória de vídeo (VRAM) da placa gráfica ou na memória do sistema (RAM). Em computadores com memória unificada, como os Macs com chips da Apple, a mesma memória serve para tudo.
A documentação do Ollama usa como exemplo um modelo pequeno que exige um download de cerca de 7 GB e recomenda 8 GB de VRAM, ou de memória unificada em um Mac. Segundo a documentação, com menos VRAM o Ollama pode usar a RAM do sistema, mas as respostas ficam mais lentas.
Como regra geral:
- Modelos menores rodam em computadores modestos, com respostas mais simples.
- Modelos maiores exigem mais memória e, sem placa de vídeo compatível, ficam lentos.
- Contextos longos também consomem mais memória.
Confira sempre o tamanho do modelo na sua página da biblioteca antes de baixar.
Espaço em disco
Cada modelo ocupa de alguns gigabytes a dezenas de gigabytes. Reserve espaço para vários.
Conhecimento mínimo
Para o uso básico, basta saber abrir o terminal e digitar comandos. Se o terminal for novidade, o roteiro de como aprender a programar do zero tem uma introdução às ferramentas.
Passo a passo
1. Instale o Ollama
O caminho mais seguro é baixar o instalador na página oficial do projeto (ollama.com), escolhendo o seu sistema. A documentação também mostra comandos de instalação por linha de comando para cada sistema.
Cuidado com comandos que baixam e executam scripts diretamente da internet: só use se a origem for a página oficial e, de preferência, leia o script antes.
2. Abra o Ollama e escolha um modelo
Depois de instalado, você pode abrir o aplicativo ou rodar ollama no terminal. Na configuração inicial, pode aparecer a opção de entrar em uma conta ou de escolher um modelo local. Para rodar localmente, escolha um modelo local. Como podem existir funções que usam serviços em nuvem, confira nas configurações qual modelo você está usando.
3. Baixe e rode um modelo
Escolha um modelo pequeno na biblioteca oficial e use o comando de execução com o nome dele:
ollama run nome-do-modelo
Na primeira vez, o Ollama baixa o modelo, o que pode demorar. Depois, abre uma conversa no terminal. Para sair, digite /bye.
Se preferir baixar sem abrir a conversa, use:
ollama pull nome-do-modelo
4. Gerencie os modelos
Comandos úteis, que você pode conferir com ollama --help:
ollama list: mostra os modelos baixados;ollama ps: mostra os modelos carregados na memória;ollama rm nome-do-modelo: remove um modelo para liberar espaço.
5. Use pela API local
Com o Ollama em execução, ele atende em http://localhost:11434. Um exemplo em Python, com a biblioteca requests:
import requests
resposta = requests.post(
"http://localhost:11434/api/chat",
json={
"model": "nome-do-modelo",
"messages": [
{"role": "user", "content": "Explique o que é DNS em duas frases."}
],
"stream": False,
},
)
print(resposta.json()["message"]["content"])
Esse código envia uma pergunta ao modelo local e imprime a resposta. Se você entende o que é uma API, ele fica fácil de acompanhar, e o guia o que é API explica os conceitos.
O que é quantização
Modelos completos ocupam muita memória. A quantização reduz a precisão numérica dos parâmetros do modelo para que ele ocupe menos espaço e rode mais rápido, com alguma perda de qualidade. Muitos modelos da biblioteca vêm em versões quantizadas.
Em resumo: quanto mais agressiva a quantização, menor o modelo e maior a chance de perder qualidade. É uma troca entre tamanho, velocidade e precisão.
Local ou na nuvem: quando vale a pena
| Situação | Local | Nuvem |
|---|---|---|
| Dados sensíveis que não devem sair da máquina | Melhor opção | Exige análise da política do fornecedor |
| Tarefas simples e repetitivas | Costuma bastar | Também serve |
| Tarefas difíceis e raciocínio complexo | Modelos menores podem ficar aquém | Modelos maiores costumam ir melhor |
| Custo por uso | Sem custo por uso | Depende do plano |
| Computador modesto | Limitado | Não depende do seu hardware |
| Uso offline | Sim | Não |
Nada impede de usar as duas formas: local para dados sensíveis e nuvem para tarefas exigentes. Para escolher entre assistentes online, veja ChatGPT, Claude e Gemini: como comparar.
Cuidados de segurança
- Não exponha a API à internet. O serviço local, por padrão, atende apenas no próprio computador. Alterar as configurações para aceitar conexões de fora, sem autenticação e sem uma camada de proteção, permite que qualquer pessoa alcance o seu modelo e o seu computador.
- Verifique a licença de cada modelo. Modelos "abertos" têm licenças diferentes, e algumas limitam o uso comercial.
- Baixe modelos de fontes confiáveis, como a biblioteca oficial.
- Mantenha o Ollama atualizado, porque correções de segurança são publicadas ao longo do tempo.
- Lembre-se de que o modelo local também erra, com as mesmas limitações de alucinação. Veja o resumo em IA generativa: como funciona e onde ela erra.
Problemas comuns e como resolver
A resposta está muito lenta. Provavelmente o modelo não cabe na VRAM e está usando a CPU. Teste um modelo menor ou uma versão mais quantizada.
Erro de memória insuficiente. Feche outros programas, escolha um modelo menor ou reduza o tamanho do contexto.
O modelo não usa a placa de vídeo.
Verifique se os drivers da placa estão atualizados e se ela é compatível, conforme a documentação do Ollama. Confira com ollama ps onde o modelo está rodando.
A porta 11434 está ocupada. Outro programa ou uma segunda instância do Ollama pode estar usando a porta. Feche a outra instância.
O download falha ou trava.
Verifique a conexão e o espaço em disco, e tente novamente. O ollama pull costuma retomar o que já foi baixado.
As respostas são fracas. Modelos pequenos têm limites. Melhore o prompt, como em como escrever bons prompts, ou teste outro modelo.
Perguntas frequentes
Preciso de uma placa de vídeo?
Não é obrigatório, mas ajuda muito. Sem GPU compatível, o modelo roda na CPU, mais devagar. Para modelos pequenos, pode ser aceitável.
O Ollama é gratuito?
O programa é de código aberto, sob licença MIT. Os modelos têm licenças próprias, que você deve consultar.
Meus dados ficam realmente no computador?
Ao usar um modelo local, o processamento ocorre na sua máquina. Mesmo assim, confirme na configuração que você está usando um modelo local e não um serviço em nuvem, e leia a política do software que estiver usando.
Posso usar o modelo local em outros programas?
Sim, pela API local. Vários aplicativos e ferramentas de desenvolvimento se conectam ao Ollama. Verifique a compatibilidade na documentação de cada um.
Conclusão
Rodar uma IA localmente é viável em muitos computadores, principalmente com modelos pequenos, e oferece privacidade e independência da nuvem. Em troca, você lida com limites de hardware, com modelos menos capazes do que os maiores serviços online e com a responsabilidade de manter tudo atualizado e seguro.
Comece com um modelo pequeno, use a documentação oficial como referência e não exponha a API na internet. Este guia foi revisado em setembro de 2026, e a ferramenta e a biblioteca de modelos mudam com frequência.
Fontes
- Ollama. Repositório oficial no GitHub.
- Ollama. Documentação: Quickstart.
- Ollama. Biblioteca de modelos.
- Hugging Face. Conceitos de quantização.
- Open Source Initiative. Licença MIT.


