Todos os guias
Ollama · Iniciante

Rodar LLMs localmente no macOS com Ollama

Instale, baixe um modelo e faça a primeira chamada em menos de 10 minutos — sem enviar dados pra ninguém.

8 min de leituramacOS Apple Silicon (M1/M2/M3/M4)Atualizado jun. de 2026

Por que Ollama

Ollama expõe uma API compatível com OpenAI localmente. Você aponta qualquer cliente (Cursor, Continue, seu app) pra http://localhost:11434 e usa o modelo de graça, offline e privado.

1. Instalar

Baixe o instalador oficial em ollama.com/download ou via Homebrew:

brew install ollama
ollama serve &

2. Escolher o modelo pela sua RAM

  • 8 GB → llama3.2:3b ou qwen2.5:3b (rápido, básico)
  • 16 GB → llama3.1:8b, qwen2.5:7b, mistral:7b (padrão recomendado)
  • 32 GB → qwen2.5:14b, gemma2:27b-q4
  • 64 GB+ → llama3.3:70b-q4_K_M, qwen2.5:32b

3. Baixar e rodar

ollama pull llama3.1:8b
ollama run llama3.1:8b

4. Consumir via API compatível OpenAI

import OpenAI from "openai";
const client = new OpenAI({
  baseURL: "http://localhost:11434/v1",
  apiKey: "ollama",
});
const res = await client.chat.completions.create({
  model: "llama3.1:8b",
  messages: [{ role: "user", content: "Olá!" }],
});

5. Ligar no Cursor / Continue / Zed

Em Cursor: Settings → Models → Add custom OpenAI model, URL http://localhost:11434/v1, model llama3.1:8b. No Continue (VS Code), adicione em ~/.continue/config.json um provedor `openai` com a mesma baseURL.

Troubleshooting

  • Modelo lento → tente uma quantização menor (:q4_K_M)
  • "connection refused" → confirme que `ollama serve` está rodando
  • RAM estourada → use um modelo menor ou feche apps pesados