Skip to content
AI Model Radar

Glosario

Caché KV

La caché KV es la memoria de trabajo que el modelo llena mientras lee tu conversación: crece con cada token y, en contextos largos, puede rivalizar en tamaño con el propio modelo.

Mientras genera, el modelo guarda un registro de cada token que ha visto hasta el momento: las claves y los valores de sus capas de atención, de ahí el nombre. Ese registro es lo que permite que el token diez mil se relacione con el token tres sin releerlo todo.

El costo: la caché crece con la longitud del contexto, capa por capa. La memoria de tu máquina tiene que contener los pesos del modelo Y esta caché al mismo tiempo; por eso un modelo que cabe cómodamente para chats cortos puede fallar con un documento largo.

Las arquitecturas modernas atacan exactamente esto. Algunas guardan el contexto completo solo en una fracción de sus capas, otras usan ventanas deslizantes cortas en el resto, y los diseños de atención latente comprimen el registro de cada token en un vector pequeño. Dos modelos con el mismo número de parámetros pueden diferir enormemente en apetito de caché; por eso leerlo de la configuración publicada de cada modelo supera cualquier regla general.

Dónde lo ves en el radar

Nuestro motor de compatibilidad calcula la caché KV capa por capa a partir del archivo de configuración de cada modelo: es el número del medio en cada estimación de memoria, junto a pesos y sobrecarga.

Ver la aritmética de la caché por modelo

Términos relacionados

Ventana de contextoMemoria unificadaParámetros (7B, 70B)

También en:EnglishPortuguês

← Todos los términos