Um aluno que decorou as respostas da prova do ano passado tira dez naquela prova. Na prova nova, afunda. Com modelo acontece a mesma coisa, e tem nome: overfitting, ou sobreajuste.
No simulador, os pontos pretos são os exemplos de treino. Eles seguem uma curva suave, com um pouco de ruído, como dado de verdade. A curva roxa é o modelo. O controle muda o quanto ela pode se dobrar.
Acompanha a forma geral sem perseguir cada ponto.
Erro no treino
0,050
Erro nos dados novos
?
DesafioEncontre o grau com o menor erro nos dados novos.
Com flexibilidade zero, o modelo é uma linha deitada. Erra tudo porque ignora o padrão. Isso é o contrário, underfitting.
Subindo um pouco, ele pega a forma geral. O erro no treino cai e o erro nos dados novos cai junto.
Lá no alto, a curva passa exatamente em cima de cada ponto preto. Erro de treino zero. Mostre os dados novos: entre um ponto e outro, a curva faz voltas que não têm nada a ver com o fenômeno. Ela decorou o ruído.
Como os modelos grandes lidam com isso
Todo treino sério guarda uma parte dos dados que o modelo nunca vê, e mede nela. Se o erro de treino cai e o erro nesses dados sobe, o modelo começou a decorar.
Os modelos de linguagem vivem numa situação estranha: têm bilhões de parâmetros, o bastante para decorar muito. Ainda assim, generalizam bem, porque veem uma quantidade enorme de texto variado. Mas decoram pedaços. Um texto famoso, repetido muitas vezes na internet, pode sair palavra por palavra.
Glossário da aula
- Overfitting
- Quando o modelo aprende os exemplos, ruído incluído, e erra em dados novos.
- Validação
- Dados separados que o modelo não vê no treino. Servem para medir se ele generaliza.
- Generalizar
- Acertar em casos que não estavam nos exemplos. É o objetivo de todo treino.
Confere rapidinho
O erro de treino chegou a zero. O que isso garante?
