Todos os guias
Ollama · Iniciante
Rodar LLMs localmente no macOS com Ollama
Instale, baixe um modelo e faça a primeira chamada em menos de 10 minutos — sem enviar dados pra ninguém.
8 min de leituramacOS Apple Silicon (M1/M2/M3/M4)Atualizado jun. de 2026
Por que Ollama
Ollama expõe uma API compatível com OpenAI localmente. Você aponta qualquer cliente (Cursor, Continue, seu app) pra http://localhost:11434 e usa o modelo de graça, offline e privado.
1. Instalar
Baixe o instalador oficial em ollama.com/download ou via Homebrew:
brew install ollama
ollama serve &2. Escolher o modelo pela sua RAM
- •8 GB → llama3.2:3b ou qwen2.5:3b (rápido, básico)
- •16 GB → llama3.1:8b, qwen2.5:7b, mistral:7b (padrão recomendado)
- •32 GB → qwen2.5:14b, gemma2:27b-q4
- •64 GB+ → llama3.3:70b-q4_K_M, qwen2.5:32b
3. Baixar e rodar
ollama pull llama3.1:8b
ollama run llama3.1:8b4. Consumir via API compatível OpenAI
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "http://localhost:11434/v1",
apiKey: "ollama",
});
const res = await client.chat.completions.create({
model: "llama3.1:8b",
messages: [{ role: "user", content: "Olá!" }],
});5. Ligar no Cursor / Continue / Zed
Em Cursor: Settings → Models → Add custom OpenAI model, URL http://localhost:11434/v1, model llama3.1:8b. No Continue (VS Code), adicione em ~/.continue/config.json um provedor `openai` com a mesma baseURL.
Troubleshooting
- •Modelo lento → tente uma quantização menor (:q4_K_M)
- •"connection refused" → confirme que `ollama serve` está rodando
- •RAM estourada → use um modelo menor ou feche apps pesados