Skip to content
AI Model Radar

Manual de campo

IA local, explicada sem rodeios.

Cada termo que o radar usa, respondido primeiro em uma frase e depois em um minuto de linguagem simples: sem alarde e sem presumir conhecimento prévio. Cada verbete termina onde o conceito faz trabalho de verdade neste site (as ferramentas estão em inglês).

18 termos, e crescendo

Também em:EnglishEspañol

01Cache KVO cache KV é a memória de trabalho que o modelo preenche enquanto lê a sua conversa: cresce a cada token e, em contextos longos, pode rivalizar em tamanho com o próprio modelo.02DestilaçãoA destilação treina um modelo pequeno para imitar as respostas de um maior: por isso existem muitos dos melhores modelos pequenos, e por isso herdam os hábitos do grande, bons e maus.03Fine-tuning (ajuste fino)O fine-tuning continua o treinamento de um modelo com os seus próprios exemplos para que ele adote um estilo, um formato ou uma especialidade: muda os pesos, enquanto um prompt apenas os instrui.04GGUFGGUF é o formato de arquivo único que os runtimes de IA local carregam: os pesos do modelo, geralmente quantizados, junto com tudo o que é preciso para executá-lo.05InferênciaInferência é um modelo respondendo: usar os pesos já treinados para produzir uma saída. Treinamento é como esses pesos foram aprendidos; inferência é cada uso depois disso.06Janela de contextoA janela de contexto é quanto texto um modelo consegue considerar de uma vez, medido em tokens; e manter esse texto na memória custa VRAM por meio do cache KV.07Memória unificadaMemória unificada é um único bloco de RAM compartilhado pelo processador e pelos núcleos gráficos: por isso Macs com Apple Silicon rodam modelos que em outra máquina exigiriam uma placa de vídeo enorme.08Mistura de especialistas (MoE)Um modelo de mistura de especialistas mantém muitas sub-redes especialistas, mas ativa só algumas por token: conhecimento de modelo grande na velocidade de um modelo pequeno, com a memória de modelo grande ainda necessária.09OffloadingO offloading divide um modelo entre a memória gráfica e a RAM comum quando ele não cabe por inteiro: o modelo roda, só que visivelmente mais devagar.10Parâmetros (7B, 70B)Parâmetros são os pesos aprendidos de um modelo, contados em bilhões: o B de 7B. Mais parâmetros significam mais memória, e só às vezes respostas melhores.11Pontuação de tendênciaA pontuação de tendência é a medida do próprio Hugging Face de com quais modelos a comunidade está interagindo neste momento: um sinal de impulso, não uma nota de qualidade.12QuantizaçãoA quantização armazena os pesos de um modelo com menos precisão (por exemplo, 4 bits em vez de 16), reduzindo a memória a cerca de um quarto com um pequeno custo em qualidade.13RAG (geração aumentada por recuperação)RAG permite que um modelo responda a partir dos seus próprios documentos: primeiro recupera os trechos relevantes e os coloca no prompt. Conhecimento sem retreinar nada.14Runtime localUm runtime local é o aplicativo que realmente roda modelos na sua máquina: carrega um arquivo GGUF, aciona a sua GPU e entrega uma janela de chat ou uma API.15SafetensorsSafetensors é o formato em que os modelos são publicados originalmente: pesos em precisão completa espalhados por muitos arquivos, feitos para GPUs de data center e treinamento, não para notebooks.16TemperaturaA temperatura é o controle que define quão ousadas são as escolhas de palavras de um modelo: valores baixos o deixam previsível e repetitivo, valores altos criativo e mais propenso a erros.17TokenUm token é a unidade que os modelos de IA realmente leem e escrevem: um fragmento de palavra de poucos caracteres; em 1.000 tokens cabem aproximadamente 750 palavras em inglês.18VRAM vs. RAM do sistemaVRAM é a memória da sua placa de vídeo: o espaço em que um modelo precisa caber, na maior parte, para rodar rápido. A RAM do sistema é a reserva, maior e mais lenta.