Skip to content
AI Model Radar

Glosario

Runtime local

Un runtime local es la aplicación que realmente ejecuta modelos en tu máquina: carga un archivo GGUF, aprovecha tu GPU y te da una ventana de chat o una API.

Entre «este modelo cabe en tu tarjeta» y un chat funcionando hay una pieza de software. El runtime carga los pesos, gestiona la memoria y la caché KV, y expone el modelo: como ventana de chat de escritorio, como servicio en segundo plano que otras aplicaciones pueden llamar, o ambas cosas.

Las opciones conocidas son más hermanas que competidoras: aplicaciones pulidas de un clic, servicios pensados para la terminal, el motor desnudo para quienes les gusta trastear, e interfaces web que se montan encima. Casi todas cargan los mismos archivos GGUF y se apoyan en la misma familia de motores, así que la elección va de gusto por la interfaz y flujo de trabajo, no de qué modelos puedes ejecutar.

En la práctica: elige uno, descarga un modelo que quepa en tu memoria y estarás conversando en local en minutos, sin cuenta, sin nube y sin factura por token.

Dónde lo ves en el radar

Mantenemos una lista corta y curada de runtimes (qué es cada uno, a quién le conviene y dónde conseguirlo) en lugar de un directorio de cuarenta clones.

Elegir tu runtime

Términos relacionados

GGUFCuantizaciónVRAM vs. RAM del sistema

También en:EnglishPortuguês

← Todos los términos