Transformer, atenção, tokenização, quantização, fine-tuning e raciocínio.
A parte que a maioria dos cursos pula. Como a atenção funciona matematicamente, por que a tokenização explica erro de contagem, o que a quantização troca por memória, quando fine-tuning muda comportamento e por que não resolve falta de conhecimento. Entender isto é a diferença entre ajustar parâmetro por tentativa e prever o que vai acontecer.
Agrupados pela trilha de origem — o tema atravessa 20 trilhas.
As consultas de maior intenção deste tema, respondidas aqui.
É o campo que constrói sistemas capazes de executar tarefas que exigiriam decisão humana, e hoje sua vertente dominante é o aprendizado de máquina: em vez de escrever a regra, mostra-se exemplos e o sistema ajusta parâmetros até acertar. Modelo de linguagem é um caso particular disso — treinado para prever o próximo pedaço de texto, o que explica tanto a fluência quanto os erros.
São três círculos concêntricos: IA é o campo, aprendizado de máquina é a abordagem que aprende de dados em vez de regra escrita, e modelo de linguagem grande é um tipo específico de modelo de aprendizado de máquina. Confundir os níveis leva a decisão errada de ferramenta — muito problema tratado como caso de LLM é caso de ML tabular, que é mais barato, mais rápido e explicável.
Precisão numérica dos pesos, em troca de memória e velocidade — o modelo passa a caber em GPU menor e responde mais rápido. A perda de qualidade costuma ser pequena até certo ponto e depois desaba, e o ponto varia por modelo e por tarefa. Por isso quantização é decisão que se MEDE com o seu próprio conjunto de avaliação, não que se escolhe por recomendação genérica.