Mistura de especialistas (MoE)
Um modelo de mistura de especialistas mantém muitas sub-redes especialistas, mas ativa só algumas por token: conhecimento de modelo grande na velocidade de um modelo pequeno, com a memória de modelo grande ainda necessária.
Em vez de uma rede densa que processa tudo, um modelo MoE contém dezenas ou centenas de «especialistas» menores e um roteador que escolhe um punhado por token. Rótulos como 35B-A3B dizem isso diretamente: 35 bilhões de parâmetros no total, cerca de 3 bilhões ativos para qualquer token.
A divisão explica o apelo e a pegadinha. Velocidade e custo de computação seguem os parâmetros ATIVOS: o modelo gera como um modelo pequeno. A memória segue o TOTAL: todos os especialistas precisam estar carregados, porque o roteador pode chamar qualquer um a qualquer momento. Um MoE é rápido de rodar e pesado de manter.
Para uso local, isso significa que o download e o cálculo de compatibilidade se importam com o número grande, enquanto a sensação do modelo em uso acompanha o pequeno. Nenhum dos números sozinho descreve o modelo; juntos, sim.
Onde você vê isso no radar
Os modelos MoE no painel carregam os dois números no rótulo, total e ativo, porque a sua memória paga por um e a sua paciência pelo outro.
Identificar os modelos MoE no painel →Termos relacionados