Skip to content
AI Model Radar

Glossário

Offloading

O offloading divide um modelo entre a memória gráfica e a RAM comum quando ele não cabe por inteiro: o modelo roda, só que visivelmente mais devagar.

Os runtimes locais posicionam o modelo camada por camada. Quando a placa de vídeo enche, as camadas restantes vão para a RAM do sistema e rodam na CPU. Nada quebra; cada token simplesmente precisa esperar pela parte lenta da máquina.

O quanto fica mais lento depende de quanto transbordou. Algumas camadas descarregadas podem ser toleráveis; rodar metade de um modelo a partir da RAM transforma um chat interativo em uma pausa para o café, porque a velocidade de geração segue a memória mais lenta que o modelo toca a cada token.

O offloading é uma boa ferramenta para usar ocasionalmente um modelo um tamanho acima do seu hardware, e o padrão errado para o trabalho diário. O enquadramento honesto: é uma troca que você deve escolher sabendo, não uma letra miúda atrás de uma promessa otimista de compatibilidade.

Onde você vê isso no radar

Nossos rótulos de compatibilidade dizem «Offload required» em vez de contar um modelo transbordado como compatível, e as recomendações de aluguel nunca assumem offloading.

Ver onde está o limite real do seu hardware

Termos relacionados

VRAM vs. RAM do sistemaMemória unificadaQuantização

Também em:EnglishEspañol

← Todos os termos