O tokenizador trocou "padaria" pelo número 4.812, digamos. Esse número é só uma etiqueta. O 4.812 não é "maior" que o 4.811, nem mais parecido com ele.
Por isso, a primeira coisa que o modelo faz com cada id é trocar por uma lista de números: o embedding. Pense em coordenadas. Cada token vira um ponto num mapa, e o treino arruma o mapa para que tokens usados em situações parecidas fiquem perto.
Toque uma palavra. As mais parecidas acendem: rainha (0,71), príncipe (0,71), princesa (0,58).
Conta com palavras
Ponto mais perto do resultado
príncipe
parecença 1,00
DesafioResolva a analogia: rei − homem + mulher.
No mapa, "rei" fica perto de "rainha" e "príncipe". "Pão" fica perto de "bolo" e "café". Ninguém escreveu isso. Num modelo real, a arrumação sai do treino: palavras que aparecem nos mesmos tipos de frase acabam com números parecidos.
A conta com palavras é o truque que ficou famoso com o word2vec, em 2013. A diferença entre "rei" e "homem" guarda algo como "realeza". Somando essa diferença a "mulher", o ponto cai perto de "rainha".
Um detalhe que muda tudo
"Banco" de praça e "banco" de dinheiro são o mesmo token, com o mesmo embedding de partida. O mapa sozinho não resolve isso. Quem resolve é a atenção, daqui a duas aulas: ela deixa cada token puxar sentido das palavras em volta.
Glossário da aula
- Embedding
- A lista de números que representa um token. Tokens parecidos ganham listas parecidas.
- Vetor
- Uma lista ordenada de números. Dá para somar, subtrair e medir a distância entre dois.
- Similaridade de cosseno
- Uma medida de quanto dois vetores apontam para o mesmo lado.
Confere rapidinho
Quem decidiu que “rei” fica perto de “rainha” no mapa de um modelo real?
