Todas las guías
Ollama · Principiante

Ejecutar LLMs localmente en macOS con Ollama

Instala Ollama, descarga un modelo y haz la primera llamada local en menos de 10 minutos sin enviar datos a nadie.

8 min de lecturamacOS Apple Silicon (M1/M2/M3/M4)Actualizado jun 2026

Por qué Ollama

Ollama expone localmente una API compatible con OpenAI. Apunta cualquier cliente (Cursor, Continue, tu app) a http://localhost:11434 y usa el modelo gratis, offline y con privacidad.

1. Instalar

Descarga el instalador oficial en ollama.com/download o usa Homebrew:

brew install ollama
ollama serve &

2. Elegir el modelo según tu RAM

  • 8 GB -> llama3.2:3b o qwen2.5:3b (rápido, básico)
  • 16 GB -> llama3.1:8b, qwen2.5:7b, mistral:7b (opción recomendada)
  • 32 GB -> qwen2.5:14b, gemma2:27b-q4
  • 64 GB+ -> llama3.3:70b-q4_K_M, qwen2.5:32b

3. Descargar y ejecutar

ollama pull llama3.1:8b
ollama run llama3.1:8b

4. Consumirlo vía API compatible con OpenAI

import OpenAI from "openai";
const client = new OpenAI({
  baseURL: "http://localhost:11434/v1",
  apiKey: "ollama",
});
const res = await client.chat.completions.create({
  model: "llama3.1:8b",
  messages: [{ role: "user", content: "Hola!" }],
});

5. Conectar Cursor / Continue / Zed

En Cursor: Settings -> Models -> Add custom OpenAI model, URL http://localhost:11434/v1, model llama3.1:8b. En Continue (VS Code), agrega un proveedor `openai` con la misma baseURL en ~/.continue/config.json.

Solución de problemas

  • Modelo lento -> prueba una cuantización menor (:q4_K_M)
  • "connection refused" -> confirma que `ollama serve` está corriendo
  • RAM saturada -> usa un modelo más pequeño o cierra apps pesadas