Offloading
El offloading reparte un modelo entre la memoria gráfica y la RAM normal cuando no cabe por completo: el modelo funciona, solo que notablemente más lento.
Los runtimes locales colocan el modelo capa por capa. Cuando la tarjeta gráfica se llena, las capas restantes van a la RAM del sistema y se ejecutan en la CPU. Nada se rompe; simplemente cada token tiene que esperar a la parte lenta de la máquina.
Cuánto más lento depende de cuánto se desbordó. Unas pocas capas descargadas pueden ser tolerables; ejecutar medio modelo desde la RAM convierte un chat interactivo en una pausa para el café, porque la velocidad de generación sigue a la memoria más lenta que el modelo toca en cada token.
El offloading es una buena herramienta para usar de vez en cuando un modelo una talla por encima de tu hardware, y el peor valor por defecto para el trabajo diario. El encuadre honesto: es un intercambio que debes elegir a sabiendas, no una letra pequeña detrás de una promesa optimista de compatibilidad.
Dónde lo ves en el radar
Nuestras etiquetas de compatibilidad dicen «Offload required» en lugar de contar un modelo desbordado como compatible, y las recomendaciones de alquiler nunca asumen offloading.
Ver dónde está el límite real de tu hardware →Términos relacionados