Inferencia
La inferencia es un modelo respondiendo: usar sus pesos ya entrenados para producir una salida. El entrenamiento es cómo se aprendieron esos pesos; la inferencia es cada uso posterior.
Un modelo tiene dos vidas. El entrenamiento ocurre una vez, en el editor, en clústeres enormes: ahí se aprenden los pesos. La inferencia es todo lo que viene después: cada chat, cada completado, cada llamada a la API vuelve a pasar esos pesos congelados sobre una entrada nueva. Cuando este sitio dice que un modelo «funciona» en algún lugar, se refiere a la inferencia.
Lo que exige la inferencia es exactamente lo que miden las páginas de compatibilidad: memoria suficiente para contener los pesos y la caché de contexto en crecimiento, y ancho de banda suficiente para transmitir una gran parte de esos pesos en cada token generado. Por eso la velocidad de generación sigue a la velocidad de la memoria, y por eso el mismo modelo se siente distinto en máquinas distintas.
Toda la pregunta de local frente a nube es una pregunta sobre inferencia: pagar a un proveedor por token para ejecutarla en su hardware, o quedarte con los pesos y pagar en electricidad y paciencia.
Dónde lo ves en el radar
La calculadora de costos pone precio a la inferencia del mismo modelo de tres maneras (API en la nube, tu propio hardware y una GPU alquilada) a partir de precios medidos y supuestos declarados.
Poner precio a tu inferencia de tres maneras →Términos relacionados