GGUF
GGUF es el formato de archivo único que cargan los runtimes de IA local: los pesos del modelo, normalmente cuantizados, junto con todo lo necesario para ejecutarlo.
Cuando un modelo se prepara para uso local, sus pesos y su tokenizador se empaquetan en un solo archivo .gguf. Runtimes como Ollama, LM Studio y llama.cpp abren ese archivo y ya están listos para conversar: sin ensamblaje ni descargas de configuración por separado.
El formato nace del proyecto llama.cpp como sucesor de sus antiguos archivos GGML, y existe porque las publicaciones originales de un modelo no están hechas para una laptop: los editores distribuyen pesos en precisión completa repartidos en muchos archivos enormes, pensados para GPUs de centro de datos. Un GGUF es el reempaquetado compacto, normalmente cuantizado, que cabe en hardware de consumo.
En la práctica, el archivo GGUF ES la descarga que tiene que caber en tu memoria. Su tamaño en bytes no es una estimación: es un dato comprobable antes de descargar, y eso es exactamente lo que hace este sitio.
Dónde lo ves en el radar
Cada cifra de memoria en nuestras tablas de compatibilidad se mide a partir del tamaño en bytes de un archivo GGUF real y publicado; el enlace GGUF junto a cada modelo apunta al archivo exacto del que sale ese número.
Ver qué GGUF caben en tu máquina →Términos relacionados