Muestreo (top-p, top-k)
El muestreo es cómo un modelo elige cada token siguiente de su lista de candidatos: la temperatura reajusta las probabilidades, top-p y top-k recortan la lista, y juntos fijan cuán predecible o arriesgada es la salida.
En cada paso, un modelo no produce una palabra: produce una probabilidad para cada token de su vocabulario. El muestreo es la regla que convierte esa lista en una elección. La regla más simple, tomar siempre el token más probable, da texto repetitivo y plano; la generación real sortea entre la lista al azar, ponderando por esas probabilidades, y los ajustes deciden cuán amplio es el sorteo.
Top-k conserva solo los k tokens más probables y sortea entre ellos; top-p conserva el conjunto más pequeño cuyas probabilidades suman p —digamos 0,9—, así que la lista se encoge cuando el modelo está seguro y se amplía cuando no. La temperatura se aplica antes que ambos: por debajo de 1 afila las probabilidades hacia los favoritos, por encima de 1 las aplana. Los runtimes locales exponen los tres, normalmente con valores por defecto sensatos como temperatura 0,7 y top-p 0,9.
Elige los ajustes según la tarea. Código, extracción y todo lo que verifique una máquina quieren temperatura baja y un top-p estrecho; la lluvia de ideas y la ficción quieren lo contrario. Una semilla hace repetible una ejecución muestreada —misma semilla, mismos ajustes, mismos tokens—, algo que importa cuando comparas con justicia dos cuantizaciones de un mismo modelo.
Dónde lo ves en el radar
Los ajustes de muestreo cambian lo que un modelo dice, no lo que necesita: la memoria y la compatibilidad son las mismas a temperatura 0 y a 1,2. Por eso el buscador pregunta por hardware y contexto, nunca por muestreo.
Comprobar qué cabe, con los ajustes que sean →Términos relacionados