Todas las guías
llama.cpp · Avanzado

llama.cpp en Linux - máximo rendimiento sin sobrecarga

Compilar desde el código fuente da más rendimiento y control fino de opciones de GPU.

10 min de lecturaUbuntu 22.04+Fedora 40+NVIDIA CUDA 12+ opcionalActualizado jun 2026

1. Dependencias

sudo apt install -y build-essential cmake git
# CUDA opcional
sudo apt install -y nvidia-cuda-toolkit

2. Compilar

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build -j

3. Descargar un modelo GGUF

Usa `huggingface-cli download` para traer variantes como `Qwen2.5-7B-Instruct-GGUF` en formato Q4_K_M.

4. Servir como API compatible con OpenAI

./build/bin/llama-server \
  -m ./models/qwen2.5-7b-instruct-q4_k_m.gguf \
  --port 8080 --host 0.0.0.0 -c 8192 -ngl 99

Consejos de rendimiento

  • `-ngl 99` envía todas las capas a la GPU
  • `-c` controla el contexto; cuidado con la VRAM
  • `--flash-attn` acelera prompts largos