
llama.cpp
Georgi Gerganov, Diego Devesa
Visão geral
Em 10 de março de 2023, Georgi Gerganov fez o primeiro commit do llama.cpp no GitHub. A biblioteca, escrita em C e C++, tinha um objetivo: executar os modelos LLaMA da Meta em um CPU de laptop sem GPU. Em semanas, acumulou milhares de estrelas e uma comunidade crescente de desenvolvedores expandindo suas capacidades.
A inovação central é a quantização. Ao comprimir os pesos do modelo de ponto flutuante de 32 bits para inteiros de 4 ou 8 bits usando o formato GGUF, o llama.cpp reduz os requisitos de memória em 75% ou mais. Um modelo de 7 bilhões de parâmetros que precisaria de 28 GB de VRAM em uma GPU pode rodar em menos de 6 GB de RAM do sistema. O formato GGUF também agrupa o tokenizador, vocabulário e template de chat em um único arquivo, tornando a distribuição do modelo trivial.
O llama.cpp suporta uma gama excepcionalmente ampla de hardware: CPUs x86 com AVX2, Apple Silicon via Metal, GPUs NVIDIA com CUDA, GPUs AMD com hipBLAS, GPUs Intel com SYCL e até Vulkan. O projeto oferece ferramentas de linha de comando para geração, benchmarking e conversão de modelos, além de um servidor HTTP leve. Em 2025, conta com mais de 900 contribuidores e 69.000 estrelas no GitHub. Ferramentas como Ollama e LM Studio são construídas diretamente sobre o llama.cpp, tornando a inferência local de LLMs acessível a usuários não técnicos. A biblioteca se tornou o padrão de facto para executar grandes modelos de linguagem em hardware de consumo, permitindo experimentação privada e econômica de IA sem dependência de nuvem.
Palavras-chave
Informações do livro
- Autor
- Georgi Gerganov, Diego Devesa
- Publicado
- 2023-03-10
- Autor
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
Junte-se à comunidade
fãs comentando