Todas las guías
Ollama · Principiante
Ejecutar LLMs localmente en macOS con Ollama
Instala Ollama, descarga un modelo y haz la primera llamada local en menos de 10 minutos sin enviar datos a nadie.
8 min de lecturamacOS Apple Silicon (M1/M2/M3/M4)Actualizado jun 2026
Por qué Ollama
Ollama expone localmente una API compatible con OpenAI. Apunta cualquier cliente (Cursor, Continue, tu app) a http://localhost:11434 y usa el modelo gratis, offline y con privacidad.
1. Instalar
Descarga el instalador oficial en ollama.com/download o usa Homebrew:
brew install ollama
ollama serve &2. Elegir el modelo según tu RAM
- •8 GB -> llama3.2:3b o qwen2.5:3b (rápido, básico)
- •16 GB -> llama3.1:8b, qwen2.5:7b, mistral:7b (opción recomendada)
- •32 GB -> qwen2.5:14b, gemma2:27b-q4
- •64 GB+ -> llama3.3:70b-q4_K_M, qwen2.5:32b
3. Descargar y ejecutar
ollama pull llama3.1:8b
ollama run llama3.1:8b4. Consumirlo vía API compatible con OpenAI
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "http://localhost:11434/v1",
apiKey: "ollama",
});
const res = await client.chat.completions.create({
model: "llama3.1:8b",
messages: [{ role: "user", content: "Hola!" }],
});5. Conectar Cursor / Continue / Zed
En Cursor: Settings -> Models -> Add custom OpenAI model, URL http://localhost:11434/v1, model llama3.1:8b. En Continue (VS Code), agrega un proveedor `openai` con la misma baseURL en ~/.continue/config.json.
Solución de problemas
- •Modelo lento -> prueba una cuantización menor (:q4_K_M)
- •"connection refused" -> confirma que `ollama serve` está corriendo
- •RAM saturada -> usa un modelo más pequeño o cierra apps pesadas