Ventana de contexto
La ventana de contexto es cuánto texto puede considerar un modelo a la vez, medido en tokens; y mantener ese texto en memoria cuesta VRAM a través de la caché KV.
Los modelos leen y escriben en tokens, fragmentos de palabra: aproximadamente 750 palabras en inglés por cada 1.000 tokens. La ventana de contexto es el total que el modelo puede tener a la vista a la vez: tus instrucciones, la conversación hasta ahora, cualquier documento pegado y la respuesta que se está escribiendo.
Los editores anuncian ventanas cada vez más grandes, y los números son reales, pero en tu máquina la ventana no es gratis. Cada token a la vista ocupa memoria de caché KV, así que una ventana enorme anunciada y una tarjeta gráfica modesta se encuentran a medio camino: el modelo ADMITE un millón de tokens, tu memoria decide cuántos puedes usar de verdad.
Por eso cualquier afirmación honesta de compatibilidad nombra su supuesto de contexto. El mismo modelo en la misma tarjeta puede ser un ajuste cómodo para el día a día en contextos cortos y una imposibilidad con un libro entero cargado.
Dónde lo ves en el radar
Cada estimación de compatibilidad del radar indica la longitud de contexto con la que se calculó; cambia el supuesto y el veredicto cambia honestamente con él.
Ver compatibilidades con su contexto declarado →Términos relacionados