Todas las guías
llama.cpp · Avanzado
llama.cpp en Linux - máximo rendimiento sin sobrecarga
Compilar desde el código fuente da más rendimiento y control fino de opciones de GPU.
10 min de lecturaUbuntu 22.04+Fedora 40+NVIDIA CUDA 12+ opcionalActualizado jun 2026
1. Dependencias
sudo apt install -y build-essential cmake git
# CUDA opcional
sudo apt install -y nvidia-cuda-toolkit2. Compilar
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build -j3. Descargar un modelo GGUF
Usa `huggingface-cli download` para traer variantes como `Qwen2.5-7B-Instruct-GGUF` en formato Q4_K_M.
4. Servir como API compatible con OpenAI
./build/bin/llama-server \
-m ./models/qwen2.5-7b-instruct-q4_k_m.gguf \
--port 8080 --host 0.0.0.0 -c 8192 -ngl 99Consejos de rendimiento
- •`-ngl 99` envía todas las capas a la GPU
- •`-c` controla el contexto; cuidado con la VRAM
- •`--flash-attn` acelera prompts largos