Skip to content
AI Model Radar

Glossário

Mistura de especialistas (MoE)

Um modelo de mistura de especialistas mantém muitas sub-redes especialistas, mas ativa só algumas por token: conhecimento de modelo grande na velocidade de um modelo pequeno, com a memória de modelo grande ainda necessária.

Em vez de uma rede densa que processa tudo, um modelo MoE contém dezenas ou centenas de «especialistas» menores e um roteador que escolhe um punhado por token. Rótulos como 35B-A3B dizem isso diretamente: 35 bilhões de parâmetros no total, cerca de 3 bilhões ativos para qualquer token.

A divisão explica o apelo e a pegadinha. Velocidade e custo de computação seguem os parâmetros ATIVOS: o modelo gera como um modelo pequeno. A memória segue o TOTAL: todos os especialistas precisam estar carregados, porque o roteador pode chamar qualquer um a qualquer momento. Um MoE é rápido de rodar e pesado de manter.

Para uso local, isso significa que o download e o cálculo de compatibilidade se importam com o número grande, enquanto a sensação do modelo em uso acompanha o pequeno. Nenhum dos números sozinho descreve o modelo; juntos, sim.

Onde você vê isso no radar

Os modelos MoE no painel carregam os dois números no rótulo, total e ativo, porque a sua memória paga por um e a sua paciência pelo outro.

Identificar os modelos MoE no painel

Termos relacionados

Parâmetros (7B, 70B)Cache KVQuantização

Também em:EnglishEspañol

← Todos os termos