Last updated
    llama.cpp
    Livro

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023

    Visão geral

    Em 10 de março de 2023, Georgi Gerganov fez o primeiro commit do llama.cpp no GitHub. A biblioteca, escrita em C e C++, tinha um objetivo: executar os modelos LLaMA da Meta em um CPU de laptop sem GPU. Em semanas, acumulou milhares de estrelas e uma comunidade crescente de desenvolvedores expandindo suas capacidades.

    A inovação central é a quantização. Ao comprimir os pesos do modelo de ponto flutuante de 32 bits para inteiros de 4 ou 8 bits usando o formato GGUF, o llama.cpp reduz os requisitos de memória em 75% ou mais. Um modelo de 7 bilhões de parâmetros que precisaria de 28 GB de VRAM em uma GPU pode rodar em menos de 6 GB de RAM do sistema. O formato GGUF também agrupa o tokenizador, vocabulário e template de chat em um único arquivo, tornando a distribuição do modelo trivial.

    O llama.cpp suporta uma gama excepcionalmente ampla de hardware: CPUs x86 com AVX2, Apple Silicon via Metal, GPUs NVIDIA com CUDA, GPUs AMD com hipBLAS, GPUs Intel com SYCL e até Vulkan. O projeto oferece ferramentas de linha de comando para geração, benchmarking e conversão de modelos, além de um servidor HTTP leve. Em 2025, conta com mais de 900 contribuidores e 69.000 estrelas no GitHub. Ferramentas como Ollama e LM Studio são construídas diretamente sobre o llama.cpp, tornando a inferência local de LLMs acessível a usuários não técnicos. A biblioteca se tornou o padrão de facto para executar grandes modelos de linguagem em hardware de consumo, permitindo experimentação privada e econômica de IA sem dependência de nuvem.

    Palavras-chave

    llama.cppGGUFquantizaçãoLLM localinferênciacódigo abertoGeorgi Gerganovinferência em CPUaprendizado de máquina

    Informações do livro

    Autor
    Georgi Gerganov, Diego Devesa
    Publicado
    2023-03-10
    Autor
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    Links

    Junte-se à comunidade

    fãs comentando