Runtime local
Um runtime local é o aplicativo que realmente roda modelos na sua máquina: carrega um arquivo GGUF, aciona a sua GPU e entrega uma janela de chat ou uma API.
Entre «este modelo cabe na sua placa» e um chat funcionando existe uma peça de software. O runtime carrega os pesos, gerencia a memória e o cache KV, e expõe o modelo: como uma janela de chat no desktop, como um serviço em segundo plano que outros aplicativos podem chamar, ou ambos.
As opções conhecidas são mais irmãs do que concorrentes: aplicativos polidos de um clique, serviços voltados ao terminal, o motor puro para quem gosta de fuçar e interfaces web que se apoiam em cima. Quase todas carregam os mesmos arquivos GGUF e dependem da mesma família de motores; portanto, a escolha é de gosto por interface e fluxo de trabalho, não de quais modelos você consegue rodar.
Na prática: escolha um, baixe um modelo que caiba na sua memória e você estará conversando localmente em minutos, sem conta, sem nuvem, sem cobrança por token.
Onde você vê isso no radar
Mantemos uma lista curta e curada de runtimes (o que cada um é, para quem serve e onde obtê-lo) em vez de um diretório com quarenta clones.
Escolher o seu runtime →Termos relacionados