Guía de IA Local

Corre IA de última generación en tu propio hardware.

Privacidad total, cero coste por token. De un portátil recién configurado a un LLM funcionando en unos 15 minutos.

¿Por qué correr IA localmente?

Privacidad
Tus prompts nunca salen de tu máquina.
Costo cero
Sin cargos de API. Sin límites de uso.
Offline
Funciona en un avión. Funciona sin internet.
Control total
Elige modelo, pesos y prompt de sistema.

Hardware necesario

TamañoRAM mínimaGPU recomendadaVelocidad
3B – 8B8 GBNinguna / integrada20-50 tok/s CPU
13B – 27B16 GB8 GB VRAM (RTX 3060)15-30 tok/s
70B (cuantizado)32-48 GB24 GB VRAM (RTX 4090 / M3 Max)10-20 tok/s
405B64+ GB unificadaM3 Ultra o 2x A1005-10 tok/s

Apple Silicon rinde por encima de su categoría gracias a la memoria unificada. Un M3 Max de 64 GB ejecuta Llama 3.3 70B mejor que muchas GPU de gaming caras.

Cuantización y GGUF

Un modelo 70B bruto ocupa unos 140 GB. La cuantización reduce ese tamaño al guardar pesos con menor precisión (4-bit, 5-bit, 8-bit), casi sin perder calidad en la mayoría de tareas. El formato .gguf es el estándar de la comunidad para modelos cuantizados.

Una buena opción predeterminada: Q4_K_M. Reduce el tamaño en ~4x preservando 98%+ de la calidad.

Elige tu herramienta de ejecución

Ollama
Instalación de una línea. CLI + API. El estándar para hackers.
ollama.com
LM Studio
GUI cuidada. Ideal para principiantes.
lmstudio.ai
Open WebUI
Clon autohospedado de ChatGPT. Multiusuario.
openwebui.com
AnythingLLM
RAG + documentos sobre modelos locales.
anythingllm.com

Inicio rápido de 15 minutos con Ollama

  1. 1Instala Ollama desde ollama.com. Hay versiones para macOS, Linux y Windows.
  2. 2Abre una terminal.
  3. 3Ejecuta: ollama pull llama3.3 — descarga un modelo cuantizado de unos 40 GB.
  4. 4Ejecuta: ollama run llama3.3 — empieza a conversar.
  5. 5Para una UI tipo ChatGPT, instala Open WebUI y apunta a localhost:11434.

Mejores modelos locales ahora