Runtime local
Un runtime local es la aplicación que realmente ejecuta modelos en tu máquina: carga un archivo GGUF, aprovecha tu GPU y te da una ventana de chat o una API.
Entre «este modelo cabe en tu tarjeta» y un chat funcionando hay una pieza de software. El runtime carga los pesos, gestiona la memoria y la caché KV, y expone el modelo: como ventana de chat de escritorio, como servicio en segundo plano que otras aplicaciones pueden llamar, o ambas cosas.
Las opciones conocidas son más hermanas que competidoras: aplicaciones pulidas de un clic, servicios pensados para la terminal, el motor desnudo para quienes les gusta trastear, e interfaces web que se montan encima. Casi todas cargan los mismos archivos GGUF y se apoyan en la misma familia de motores, así que la elección va de gusto por la interfaz y flujo de trabajo, no de qué modelos puedes ejecutar.
En la práctica: elige uno, descarga un modelo que quepa en tu memoria y estarás conversando en local en minutos, sin cuenta, sin nube y sin factura por token.
Dónde lo ves en el radar
Mantenemos una lista corta y curada de runtimes (qué es cada uno, a quién le conviene y dónde conseguirlo) en lugar de un directorio de cuarenta clones.
Elegir tu runtime →Términos relacionados