Agora dá para montar o quebra-cabeça. Tokens da aula 8, embeddings da 9, a próxima peça da 10 e a atenção da 11. O Transformer é essas peças numa ordem, com uma delas repetida muitas vezes.
Tokens
O texto vira uma fila de ids, um por pedaço.
formato: 6 ids
DesafioPasse o texto por todas as etapas até sair a próxima peça.
Cada faixa colorida é o vetor de um token. No começo, ele carrega só "que palavra sou eu e em que posição estou". A cada camada, a atenção mistura contexto e a rede de cada posição processa. Depois de dezenas de camadas, o vetor de "manhã" carrega algo como "sou 'manhã', no fim de uma frase sobre o horário de uma padaria, depois de 'sábado de'".
Na etapa das chances, só o último token importa: é dele que sai a previsão da próxima peça. Os outros já fizeram o trabalho deles, que era passar contexto adiante.
Onde mora o "conhecimento"
Não existe uma tabela de fatos dentro do modelo. O que ele "sabe" está espalhado nos bilhões de pesos, principalmente nas redes de posição de cada camada. Pesquisadores conseguem achar alguns fatos específicos e até editá-los, mas boa parte continua difícil de localizar.
Isso explica um comportamento que você já viu: o modelo sabe muita coisa, mas não sabe o que sabe. Ele não consulta uma ficha para ver se o dado está lá. Ele só continua o texto.
Glossário da aula
- Transformer
- A arquitetura de rede baseada em atenção, de 2017. Todos os grandes modelos de linguagem de hoje derivam dela.
- Camada
- Um bloco de atenção mais rede de posição. Os modelos empilham dezenas.
- Autorregressivo
- Que gera uma peça por vez, usando as peças que já gerou como entrada da próxima.
Confere rapidinho
Depois de passar por todas as camadas, de qual token sai a previsão da próxima peça?
