Skip to content
AI Model Radar

Glossário

Inferência

Inferência é um modelo respondendo: usar os pesos já treinados para produzir uma saída. Treinamento é como esses pesos foram aprendidos; inferência é cada uso depois disso.

Um modelo tem duas vidas. O treinamento acontece uma vez, no editor, em clusters enormes: é ali que os pesos são aprendidos. A inferência é tudo o que vem depois: cada chat, cada complemento, cada chamada de API repassa esses pesos congelados sobre uma entrada nova. Quando este site diz que um modelo «roda» em algum lugar, está falando de inferência.

O que a inferência exige é exatamente o que as páginas de compatibilidade medem: memória suficiente para conter os pesos e o cache de contexto em crescimento, e largura de banda suficiente para transmitir uma grande parte desses pesos a cada token gerado. É por isso que a velocidade de geração acompanha a velocidade da memória, e por isso o mesmo modelo parece diferente em máquinas diferentes.

Toda a questão de local versus nuvem é uma questão sobre inferência: pagar a um provedor por token para rodá-la no hardware dele, ou manter os pesos com você e pagar em eletricidade e paciência.

Onde você vê isso no radar

A calculadora de custos precifica a inferência do mesmo modelo de três maneiras (API na nuvem, seu próprio hardware e uma GPU alugada) a partir de preços medidos e premissas declaradas.

Precificar a sua inferência de três maneiras

Termos relacionados

TokenParâmetros (7B, 70B)Runtime local

Também em:EnglishEspañol

← Todos os termos