Pense no erro do modelo como uma paisagem. Cada combinação de números dá uma altura: lá em cima, o modelo erra muito; lá embaixo, erra pouco. Treinar é descer até o ponto mais baixo.
O problema: o modelo está no escuro. Ele não vê o vale inteiro. Só sente a inclinação do chão onde está pisando. Então faz a única coisa possível: dá um passo morro abaixo, sente de novo, dá outro passo.
Inclinação aqui: 5,94
DesafioChegue ao fundo do vale em até 12 passos.
Três coisas aparecem quando você brinca com o passo.
Com passo pequeno, a bolinha chega, mas demora. Num modelo grande, "demorar" quer dizer semanas de computador ligado.
Com passo grande, ela passa do ponto, volta, passa de novo. Grande demais, sai do vale.
Mesmo com um passo razoável, ela pode parar num buraco que não é o fundo. Ali a inclinação é zero, então ela acha que chegou. Isso é um mínimo local.
Por que isso importa para quem só usa IA
Todo modelo que você usa passou por isso bilhões de vezes. Ele terminou num ponto baixo do vale para os dados que viu. Não existe garantia de que seja o ponto mais baixo possível, nem de que o vale dos dados de treino seja o mesmo vale do seu problema.
Glossário da aula
- Gradiente
- A direção em que o erro sobe mais rápido. O treino anda no sentido contrário.
- Taxa de aprendizado
- O tamanho do passo. Pequena demais demora; grande demais pula o fundo.
- Mínimo local
- Um ponto baixo que não é o mais baixo. Parece o fim, mas não é.
Confere rapidinho
A bolinha fica pulando de um lado para o outro do vale e nunca assenta. O que ajustar?
