Por dentro da conversa com a IA · Capítulo 1 de 6
Você está escrevendo uma mensagem: “Não vou conseguir chegar no horário porque…” Antes de terminar, talvez já consiga imaginar algumas continuações: “o trânsito parou”, “o ônibus atrasou”, “surgiu um imprevisto”. Se a frase fosse “Era uma vez, num castelo…”, as possibilidades mudariam. Você usa o que leu, o contexto e o que sabe sobre a vida para antecipar o que pode vir.
É tentador dizer que uma IA faz a mesma coisa. Há uma semelhança útil, mas precisamos examiná-la com cuidado. Um modelo de linguagem é um sistema matemático treinado com muitos exemplos de texto para estimar quais pedaços poderiam aparecer em seguida. Isso não significa que alguém tenha escrito uma regra para cada frase. O sistema ajusta uma grande quantidade de números internos, chamados parâmetros, até melhorar suas previsões.
Antes de entrar no modelo, uma frase é dividida em unidades. Uma unidade pode ser uma palavra, parte de uma palavra, um sinal ou até um espaço, conforme o sistema usado. Cada unidade é um token. Pense num jogo de montar: nem toda peça corresponde a uma palavra inteira. Uma palavra comum pode caber numa peça; uma palavra rara pode exigir várias.
Por isso, “prever a próxima palavra” é uma simplificação. O nome mais preciso para muitos modelos é prever o próximo token. Rico Sennrich, Barry Haddow e Alexandra Birch estudaram o uso de partes de palavras para lidar com vocabulário raro em tradução automática. Os detalhes da divisão variam de modelo para modelo; não há um corte universal para todas as palavras. Sennrich, Haddow e Birch, 2016
Imagine que um trecho termine em “A professora abriu o livro e começou a…” O modelo atribui chances diferentes às possíveis continuações. Durante o treinamento, comparamos sua previsão com o pedaço que de fato vinha no exemplo. A diferença produz um sinal de erro; um algoritmo usa esse sinal para ajustar os parâmetros. Isso se repete em grande escala.
Não é uma professora apontando individualmente “esta frase significa coragem” ou “esta é uma boa metáfora”. O modelo recebe uma tarefa mensurável: melhorar suas previsões. Mas prever bem textos humanos exige captar relações. Se numa notícia “o banco elevou os juros”, banco tem um sentido; se alguém “sentou no banco da praça”, tem outro. A frase ao redor ajuda a escolher. Para continuar uma história de modo coerente, importa saber quem fez o quê, onde e quando.
Esse é o ponto surpreendente: uma tarefa aparentemente estreita pode favorecer o aprendizado de regularidades gramaticais, associações entre assuntos e relações que ajudam em novas frases. Os autores do estudo do GPT-3, liderado por Tom Brown, investigaram capacidades que apareceram num modelo treinado como previsor de texto. Isso não quer dizer que ele tenha aprendido toda relação corretamente nem que conheça a realidade como uma pessoa. Brown e colaboradores, 2020
Outra imagem comum é a de uma biblioteca com todas as páginas arquivadas dentro do modelo. Ela também engana. Os parâmetros são números ajustados pelo treinamento, não uma estante de documentos que o modelo consulta automaticamente a cada resposta. Parte do conteúdo pode ser memorizada, inclusive de forma indesejada, mas a operação normal não consiste em procurar uma frase e copiá-la inteira. Também não há garantia de que uma afirmação repetida no treinamento seja verdadeira.
O modelo pode produzir uma frase nova combinando relações aprendidas e o contexto da conversa. Pode igualmente completar uma ideia falsa de maneira impecável. É por isso que uma resposta fluente merece atenção, não confiança automática.
Considere uma coleção de textos sobre saúde. Alguns foram escritos por profissionais com cuidado; outros contêm boatos. A tarefa de previsão não traz, sozinha, um selo de qualidade para distinguir um tipo do outro. O modelo pode aprender que determinada frase aparece com frequência sem aprender que ela é confiável. Ele também encontra modos de falar preconceituosos ou equivocados, porque esses modos estão nos textos humanos. Seleção de dados, avaliação e etapas posteriores de treinamento tentam reduzir problemas, mas não apagam automaticamente sua origem.
Há ainda uma diferença entre treinamento e uso. Durante o treinamento, os parâmetros são ajustados repetidamente. Numa conversa comum, sua pergunta fornece um contexto temporário para a resposta; ela não significa, por si só, que você mudou os parâmetros fundamentais do modelo. Plataformas podem guardar conversas ou atualizar sistemas por processos separados, sujeitos às suas políticas. Para entender uma resposta específica, importa saber se o assistente recebeu documentos, usou uma ferramenta de busca ou respondeu apenas com o contexto disponível. É uma distinção simples que evita a ideia de uma memória única e mágica.
Também ajuda separar previsão de escolha final. O modelo calcula possibilidades, mas o sistema que gera a resposta decide como selecionar a próxima parte. Configurações diferentes podem produzir textos diferentes a partir da mesma pergunta. Isso explica alguma variação sem que seja necessário imaginar uma opinião pessoal mudando de um minuto para outro.
Chama-se arquitetura a forma de organizar os componentes do sistema. O Transformer, apresentado por Ashish Vaswani e colegas em 2017, tornou-se uma base importante para modelos de linguagem. Seu mecanismo de atenção permite calcular relações entre partes do texto no contexto disponível. Pense na frase “A menina guardou a chave na bolsa porque ela estava aberta”. Para interpretar “ela”, é útil olhar além da palavra vizinha. A analogia serve para dar intuição; o mecanismo real opera com números, não com uma leitura consciente da frase. Vaswani e colaboradores, 2017
O treinamento inicial ajuda o modelo a continuar textos. Isso explica uma parte de sua habilidade com a linguagem, mas deixa uma pergunta aberta. Se ele é treinado para continuar sequências, por que, quando perguntamos algo, costuma responder como um assistente prestativo em vez de inventar a próxima pergunta? A resposta está nas etapas seguintes de treinamento. Esse é o próximo artigo.
Leituras e fontes: Sennrich, Haddow e Birch (2016); Vaswani e colaboradores (2017); Brown e colaboradores (2020).
Continue a leitura: ← Índice da série · Capítulo #02 →
Assine a newsletter e receba conteúdos objetivos para aplicar no trabalho e na carreira.
Quero receber os conteúdos