GGUF
GGUF é o formato de arquivo único que os runtimes de IA local carregam: os pesos do modelo, geralmente quantizados, junto com tudo o que é preciso para executá-lo.
Quando um modelo é preparado para uso local, seus pesos e seu tokenizador são empacotados em um único arquivo .gguf. Runtimes como Ollama, LM Studio e llama.cpp abrem esse arquivo e já estão prontos para conversar: sem montagem, sem downloads separados de configuração.
O formato vem do projeto llama.cpp como sucessor dos antigos arquivos GGML, e existe porque as publicações originais de um modelo não foram feitas para um notebook: os editores distribuem pesos em precisão completa divididos em muitos arquivos enormes, pensados para GPUs de data center. Um GGUF é o reempacotamento compacto, geralmente quantizado, que cabe em hardware de consumo.
Na prática, o arquivo GGUF É o download que precisa caber na sua memória. Seu tamanho em bytes não é uma estimativa: é um fato que você pode conferir antes de baixar, e é exatamente isso que este site faz.
Onde você vê isso no radar
Cada número de memória nas nossas tabelas de compatibilidade é medido a partir do tamanho em bytes de um arquivo GGUF real e publicado; o link GGUF ao lado de cada modelo aponta para o arquivo exato de onde esse número veio.
Ver quais GGUFs cabem na sua máquina →Termos relacionados