Skip to content
AI Model Radar

Glossário

GGUF

GGUF é o formato de arquivo único que os runtimes de IA local carregam: os pesos do modelo, geralmente quantizados, junto com tudo o que é preciso para executá-lo.

Quando um modelo é preparado para uso local, seus pesos e seu tokenizador são empacotados em um único arquivo .gguf. Runtimes como Ollama, LM Studio e llama.cpp abrem esse arquivo e já estão prontos para conversar: sem montagem, sem downloads separados de configuração.

O formato vem do projeto llama.cpp como sucessor dos antigos arquivos GGML, e existe porque as publicações originais de um modelo não foram feitas para um notebook: os editores distribuem pesos em precisão completa divididos em muitos arquivos enormes, pensados para GPUs de data center. Um GGUF é o reempacotamento compacto, geralmente quantizado, que cabe em hardware de consumo.

Na prática, o arquivo GGUF É o download que precisa caber na sua memória. Seu tamanho em bytes não é uma estimativa: é um fato que você pode conferir antes de baixar, e é exatamente isso que este site faz.

Onde você vê isso no radar

Cada número de memória nas nossas tabelas de compatibilidade é medido a partir do tamanho em bytes de um arquivo GGUF real e publicado; o link GGUF ao lado de cada modelo aponta para o arquivo exato de onde esse número veio.

Ver quais GGUFs cabem na sua máquina

Termos relacionados

QuantizaçãoSafetensorsRuntime local

Também em:EnglishEspañol

← Todos os termos