Uma rede neural só faz conta com números. Antes de qualquer coisa, o texto precisa virar uma fila de números. O programa que faz isso é o tokenizador, e cada pedaço que ele corta é um token.
Cortar por letra deixaria a fila comprida demais: uma frase de 40 letras viraria 40 passos. Cortar por palavra inteira exigiria um vocabulário infinito, com toda palavra, nome e erro de digitação. Os modelos de hoje ficam no meio: pedaços que aparecem muito viram um token só; o resto é montado com pedaços menores.
Sem nenhuma fusão, cada letra é um token. O modelo teria que ler letra por letra.
DesafioFaça a frase caber em 12 tokens ou menos.
O controle mostra o tokenizador aprendendo. Ele começou com as letras de um texto curto sobre padaria. A cada fusão, achou a dupla de símbolos vizinhos mais comum e juntou num símbolo novo. "p" + "a" vira "pa". Depois "pa" + "d". E assim por diante, até "padaria" virar um pedaço só.
Escreva uma palavra que não aparece no texto de treino, como "cardiologista". Ela sai picada em pedaços pequenos. O modelo ainda consegue ler, só gasta mais tokens.
Por que isso importa no dia a dia
O preço e o limite são em tokens. Quando uma API cobra "por milhão de tokens" ou diz que a janela tem tantos mil tokens, é esta conta. Os tokenizadores foram treinados com muito mais texto em inglês, então o mesmo conteúdo em português costuma gastar um pouco mais de tokens.
O modelo não vê letras. Pergunte quantas letras "r" tem uma palavra e ele pode errar: para ele, a palavra pode ser um ou dois pedaços, sem as letras separadas. Contar, soletrar e inverter texto são tarefas difíceis por causa do tokenizador, não por falta de inteligência.
Glossário da aula
- Token
- Um pedaço de texto com um número. Pode ser uma palavra inteira, um pedaço de palavra ou um sinal.
- Tokenizador
- O programa que corta o texto em tokens e troca cada um pelo seu número.
- Vocabulário
- A lista de todos os tokens que o modelo conhece.
Confere rapidinho
Por que um modelo erra ao contar as letras de uma palavra?
