Skip to content
AI Model Radar

Manual de campo

IA local, explicada sin rodeos.

Cada término que usa el radar, respondido primero en una frase y después en un minuto de lenguaje sencillo: sin bombo y sin dar por hecho conocimientos previos. Cada entrada termina donde el concepto hace trabajo real en este sitio (las herramientas están en inglés).

18 términos, y creciendo

También en:EnglishPortuguês

01Caché KVLa caché KV es la memoria de trabajo que el modelo llena mientras lee tu conversación: crece con cada token y, en contextos largos, puede rivalizar en tamaño con el propio modelo.02CuantizaciónLa cuantización guarda los pesos de un modelo con menos precisión (por ejemplo 4 bits en lugar de 16), reduciendo la memoria a cerca de una cuarta parte con un pequeño costo en calidad.03DestilaciónLa destilación entrena a un modelo pequeño para imitar las respuestas de uno más grande: por eso existen muchos de los mejores modelos pequeños, y por eso heredan los hábitos del grande, buenos y malos.04Fine-tuning (ajuste fino)El fine-tuning continúa el entrenamiento de un modelo con tus propios ejemplos para que adopte un estilo, un formato o una especialidad: cambia los pesos, mientras que un prompt solo les da instrucciones.05GGUFGGUF es el formato de archivo único que cargan los runtimes de IA local: los pesos del modelo, normalmente cuantizados, junto con todo lo necesario para ejecutarlo.06InferenciaLa inferencia es un modelo respondiendo: usar sus pesos ya entrenados para producir una salida. El entrenamiento es cómo se aprendieron esos pesos; la inferencia es cada uso posterior.07Memoria unificadaLa memoria unificada es un solo bloque de RAM compartido por el procesador y los núcleos gráficos: por eso las Mac con Apple Silicon ejecutan modelos que en otra máquina exigirían una tarjeta gráfica enorme.08Mezcla de expertos (MoE)Un modelo de mezcla de expertos mantiene muchas subredes especialistas pero activa solo unas pocas por token: conocimiento de modelo grande a velocidad de modelo pequeño, con la memoria de modelo grande todavía necesaria.09OffloadingEl offloading reparte un modelo entre la memoria gráfica y la RAM normal cuando no cabe por completo: el modelo funciona, solo que notablemente más lento.10Parámetros (7B, 70B)Los parámetros son los pesos aprendidos de un modelo, contados en miles de millones: la B de 7B. Más parámetros significan más memoria, y solo a veces mejores respuestas.11Puntuación de tendenciaLa puntuación de tendencia es la medida propia de Hugging Face de con qué modelos está interactuando la comunidad en este momento: una señal de impulso, no una nota de calidad.12RAG (generación aumentada por recuperación)RAG permite que un modelo responda a partir de tus propios documentos: primero recupera los pasajes relevantes y los coloca en el prompt. Conocimiento sin reentrenar nada.13Runtime localUn runtime local es la aplicación que realmente ejecuta modelos en tu máquina: carga un archivo GGUF, aprovecha tu GPU y te da una ventana de chat o una API.14SafetensorsSafetensors es el formato en que los modelos se publican originalmente: pesos en precisión completa repartidos en muchos archivos, pensados para GPUs de centro de datos y entrenamiento, no para laptops.15TemperaturaLa temperatura es el control que fija cuán arriesgadas son las elecciones de palabras de un modelo: valores bajos lo hacen predecible y repetitivo, valores altos creativo y más propenso a errores.16TokenUn token es la unidad que los modelos de IA realmente leen y escriben: un fragmento de palabra de unos pocos caracteres; en 1.000 tokens caben aproximadamente 750 palabras en inglés.17Ventana de contextoLa ventana de contexto es cuánto texto puede considerar un modelo a la vez, medido en tokens; y mantener ese texto en memoria cuesta VRAM a través de la caché KV.18VRAM vs. RAM del sistemaLa VRAM es la memoria de tu tarjeta gráfica: el espacio en el que un modelo debe caber en su mayor parte para funcionar rápido. La RAM del sistema es el respaldo, más grande y más lento.