Skip to content
AI Model Radar

Glossário

Runtime local

Um runtime local é o aplicativo que realmente roda modelos na sua máquina: carrega um arquivo GGUF, aciona a sua GPU e entrega uma janela de chat ou uma API.

Entre «este modelo cabe na sua placa» e um chat funcionando existe uma peça de software. O runtime carrega os pesos, gerencia a memória e o cache KV, e expõe o modelo: como uma janela de chat no desktop, como um serviço em segundo plano que outros aplicativos podem chamar, ou ambos.

As opções conhecidas são mais irmãs do que concorrentes: aplicativos polidos de um clique, serviços voltados ao terminal, o motor puro para quem gosta de fuçar e interfaces web que se apoiam em cima. Quase todas carregam os mesmos arquivos GGUF e dependem da mesma família de motores; portanto, a escolha é de gosto por interface e fluxo de trabalho, não de quais modelos você consegue rodar.

Na prática: escolha um, baixe um modelo que caiba na sua memória e você estará conversando localmente em minutos, sem conta, sem nuvem, sem cobrança por token.

Onde você vê isso no radar

Mantemos uma lista curta e curada de runtimes (o que cada um é, para quem serve e onde obtê-lo) em vez de um diretório com quarenta clones.

Escolher o seu runtime

Termos relacionados

GGUFQuantizaçãoVRAM vs. RAM do sistema

Também em:EnglishEspañol

← Todos os termos