Skip to content
AI Model Radar

Glosario

Mezcla de expertos (MoE)

Un modelo de mezcla de expertos mantiene muchas subredes especialistas pero activa solo unas pocas por token: conocimiento de modelo grande a velocidad de modelo pequeño, con la memoria de modelo grande todavía necesaria.

En lugar de una red densa que lo procesa todo, un modelo MoE contiene decenas o cientos de «expertos» más pequeños y un enrutador que elige un puñado por token. Etiquetas como 35B-A3B lo dicen directamente: 35 mil millones de parámetros en total, unos 3 mil millones activos para cualquier token dado.

La división explica el atractivo y la trampa. La velocidad y el costo de cómputo siguen a los parámetros ACTIVOS: el modelo genera como uno pequeño. La memoria sigue al TOTAL: todos los expertos deben estar cargados, porque el enrutador puede llamar a cualquiera en cualquier momento. Un MoE es rápido de ejecutar y pesado de sostener.

Para el uso local eso significa que la descarga y el cálculo de compatibilidad miran el número grande, mientras que la sensación del modelo en uso sigue al pequeño. Ningún número por sí solo describe el modelo; juntos, sí.

Dónde lo ves en el radar

Los modelos MoE del tablero llevan ambos números en su etiqueta, total y activo, porque tu memoria paga por uno y tu paciencia por el otro.

Identificar los modelos MoE en el tablero

Términos relacionados

Parámetros (7B, 70B)Caché KVCuantización

También en:EnglishPortuguês

← Todos los términos