All guides
llama.cpp · Avançado
llama.cpp no Linux — máximo desempenho sem sobrecarga
Compilar a partir do código-fonte entrega a maior vazão e controle fino das opções de GPU.
10 min readUbuntu 22.04+Fedora 40+NVIDIA CUDA 12+ opcionalUpdated jun. de 2026
1. Dependências
sudo apt install -y build-essential cmake git
# CUDA opcional
sudo apt install -y nvidia-cuda-toolkit2. Buildar
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build -j3. Baixar um modelo GGUF
Use `huggingface-cli download` pra pegar variantes como `Qwen2.5-7B-Instruct-GGUF` no formato Q4_K_M.
4. Servir como OpenAI-compatible
./build/bin/llama-server \
-m ./models/qwen2.5-7b-instruct-q4_k_m.gguf \
--port 8080 --host 0.0.0.0 -c 8192 -ngl 99Dicas de performance
- •`-ngl 99` empurra todas as camadas pra GPU
- •`-c` controla o contexto — cuidado com VRAM
- •`--flash-attn` acelera prompts longos