All guides
llama.cpp · Avançado

llama.cpp no Linux — máximo desempenho sem sobrecarga

Compilar a partir do código-fonte entrega a maior vazão e controle fino das opções de GPU.

10 min readUbuntu 22.04+Fedora 40+NVIDIA CUDA 12+ opcionalUpdated jun. de 2026

1. Dependências

sudo apt install -y build-essential cmake git
# CUDA opcional
sudo apt install -y nvidia-cuda-toolkit

2. Buildar

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build -j

3. Baixar um modelo GGUF

Use `huggingface-cli download` pra pegar variantes como `Qwen2.5-7B-Instruct-GGUF` no formato Q4_K_M.

4. Servir como OpenAI-compatible

./build/bin/llama-server \
  -m ./models/qwen2.5-7b-instruct-q4_k_m.gguf \
  --port 8080 --host 0.0.0.0 -c 8192 -ngl 99

Dicas de performance

  • `-ngl 99` empurra todas as camadas pra GPU
  • `-c` controla o contexto — cuidado com VRAM
  • `--flash-attn` acelera prompts longos