Leia: "O gato não subiu no telhado porque ele estava com medo". Quem estava com medo? Você sabe na hora: o gato. Agora troque "medo" por "molhado". "Ele" passa a ser o telhado.
O sentido de "ele" depende de outras palavras da frase, às vezes longe. O embedding de "ele" é sempre o mesmo, então alguma coisa precisa deixar cada palavra puxar informação das outras. Essa coisa é a atenção.
Em 2017, oito pesquisadores do Google publicaram um artigo chamado "Attention Is All You Need". A proposta: montar uma rede inteira em cima desse mecanismo. Chamaram de Transformer. O GPT (Generative Pre-trained Transformer) é essa arquitetura.
Olha a palavra logo antes. Ajuda a montar expressões.
O novo sentido de “ele” = 85% de “porque” + 5% de “ele”.
DesafioDescubra para quem o “ele” olha na cabeça de referência.
O que você está vendo
Clique numa palavra. Ela passa a ser a que "pergunta". As outras acendem conforme o peso que recebem. O quadro de baixo mostra o resultado: o novo sentido daquela palavra vira uma mistura das palavras que ela olhou, na proporção dos pesos.
Cada cabeça olha por um critério diferente. A "Vizinho" só olha a palavra anterior. A "Referência" liga pronomes a quem eles se referem. A "Quem faz o quê" liga verbos a quem age. Um modelo de verdade tem dezenas de cabeças por camada, todas ao mesmo tempo, e ninguém escolhe o critério de cada uma: o treino descobre.
Deixe a máscara do GPT ligada. Com ela, cada palavra só enxerga as anteriores. Isso é obrigatório num modelo que escreve da esquerda para a direita: na hora de gerar "ele", as palavras seguintes ainda não existem. Desligue para ver como seria um modelo que lê a frase inteira de uma vez, como os usados em busca e classificação.
Por que isso destravou tudo
Antes do Transformer, os modelos de texto liam uma palavra por vez, carregando um resumo do que já tinham lido. Frase longa, resumo apertado, começo esquecido. E como cada passo dependia do anterior, era difícil treinar em paralelo.
Na atenção, cada palavra olha para todas as outras de uma vez, com a distância que for. E as contas de todas as palavras podem rodar ao mesmo tempo numa placa de vídeo. Isso permitiu treinar em quantidades de texto que antes não cabiam em tempo nenhum.
Glossário da aula
- Atenção
- O mecanismo que deixa cada token misturar em si a informação dos outros, com pesos que dependem do contexto.
- Cabeça de atenção
- Um conjunto de Q, K e V. Várias cabeças olham a mesma frase por critérios diferentes.
- Máscara causal
- A regra que impede um token de olhar para os que vêm depois. É o que deixa o GPT escrever da esquerda para a direita.
Confere rapidinho
Na frase do simulador, por que “ele” consegue virar “gato” e não “telhado”?
