#02 — Por que a IA responde de forma tão humana?

Por dentro da conversa com a IA · Capítulo 2 de 6

Você pede ajuda para escrever uma mensagem delicada. A resposta vem organizada, evita palavras duras e ainda sugere uma versão mais curta. Parece que alguém percebeu o seu constrangimento. Como um sistema treinado para prever pedaços de texto aprendeu a ajudar numa situação assim?

O primeiro artigo mostrou a base: ao prever continuações, o modelo aprende muitas relações presentes na linguagem. Só que um bom continuador de textos não é, por isso, um bom assistente. Se você escrever “Qual é a capital da Bahia?”, uma continuação plausível de uma página de perguntas poderia ser “Qual é a capital de Pernambuco?”. Uma pessoa esperando ajuda prefere “Salvador”, talvez com uma explicação se houver dúvida.

Mostrar o tipo de resposta desejado

Uma etapa possível é apresentar exemplos de pedidos e respostas consideradas boas. O modelo é ajustado para produzir algo semelhante quando recebe uma nova instrução. Esse procedimento se chama ajuste supervisionado: há exemplos que orientam a mudança dos parâmetros. Não é uma lista fixa de respostas. O objetivo é aprender padrões úteis em muitas situações.

Long Ouyang e colaboradores descreveram um processo assim no trabalho sobre o InstructGPT: partiram de um modelo previamente treinado e usaram demonstrações escritas por pessoas para ajustá-lo ao seguimento de instruções. Não devemos assumir que todos os assistentes atuais usam exatamente a mesma receita. Ouyang e colaboradores, 2022

Comparar respostas também ensina

Imagine duas respostas à pergunta “Como posso dizer a uma colega que preciso de mais prazo?”

Uma diz: “Não posso entregar. Aguarde.” Outra propõe informar o motivo, oferecer uma data realista e reconhecer o impacto no trabalho da colega. Pessoas podem comparar as duas. Um sistema pode então aprender a favorecer respostas que receberam melhor avaliação. No exemplo do InstructGPT, essas preferências alimentaram uma etapa chamada aprendizado por reforço com feedback humano, ou RLHF. “Reforço” aqui indica um processo de ajustar o comportamento com base em sinais de avaliação, não uma recompensa sentida pela máquina. Ouyang e colaboradores, 2022

Outros métodos de ajuste existem. Alguns usam preferências de pessoas, outros incorporam avaliações ou regras de formas diferentes. A explicação geral permanece: além de aprender padrões de textos, o assistente passa por treinamento para seguir pedidos e responder de modo considerado útil.

De onde vem o tom acolhedor?

Da linguagem humana e dos exemplos valorizados no treinamento. Quando alguém diz “Estou nervoso com a entrevista de amanhã”, uma resposta que organiza o problema e oferece passos pode ser mais útil que uma lista fria de definições. O modelo aprende padrões desse tipo. Pode usar primeira pessoa, fazer perguntas, adaptar o nível de detalhe e parecer atento.

Essa aparência tem utilidade. Uma explicação clara reduz o esforço de quem está aprendendo. Mas pode criar uma impressão equivocada: a de que o sistema conhece você como um amigo ou viveu aquilo que descreve. Uma resposta pode expressar cuidado sem que isso demonstre uma experiência pessoal de cuidado. O comportamento observável e a experiência interna são perguntas diferentes.

A boa forma pode esconder um erro

Pense num aluno que apresenta uma conta errada com caligrafia impecável e fala tranquila. A apresentação não conserta o cálculo. Com IA, o problema é parecido: um texto seguro e gentil pode conter uma data inventada, uma fonte inexistente ou uma conclusão que não segue das evidências.

Isso não torna a ferramenta inútil. Muda a maneira de usá-la. Em tarefas importantes, peça que ela explique de onde saiu uma informação, confira a fonte original e teste o exemplo por outro caminho. Se houver uma decisão a tomar, examine também o que a resposta deixou de fora. O ajuste para ser prestativo melhora a conversa; não instala um detector infalível de verdade.

Quem decide o que é “uma boa resposta”?

No exemplo das duas mensagens para a colega, muita gente concordaria que a segunda ajuda mais. Em outros casos, a escolha é difícil. Uma resposta curta pode ser ideal para quem está com pressa e insuficiente para quem quer estudar. Pessoas podem discordar sobre tom, detalhes e riscos aceitáveis. Os avaliadores usam critérios, mas seus julgamentos não representam automaticamente todas as culturas, necessidades e situações.

Além disso, o assistente não recebe apenas o seu pedido. Pode haver instruções do produto, restrições de segurança e informações recuperadas de ferramentas. O comportamento final nasce da combinação do treinamento com esse contexto de uso. Por isso, dois sistemas treinados com técnicas parecidas podem responder de formas diferentes, e o mesmo sistema pode mudar de comportamento quando uma ferramenta ou uma instrução adicional entra na conversa.

Veja um pequeno exercício. Faça a mesma pergunta de três maneiras: “Explique para alguém que nunca estudou isso”; “Dê apenas a conclusão”; “Mostre as dúvidas e as fontes”. A resposta muda porque o modelo procura atender às instruções presentes. Isso é uma capacidade prática, não uma prova de que ele avaliou sua situação como faria um amigo. Para tirar proveito dela, diga qual é seu objetivo, o que já sabe e que tipo de evidência espera.

O que ainda falta explicar

Até aqui falamos do treinamento e do comportamento que vemos na tela. Mas será que a máquina produz cada pedaço da resposta sem qualquer preparo? Pesquisadores começaram a investigar como certas ideias se organizam durante o processamento. Veremos o que conseguiram observar — e o que ainda não conseguem — no próximo artigo.

Leituras e fontes: Ouyang e colaboradores (2022); OpenAI, explicação do estudo; Bender, Gebru, McMillan-Major e Shmitchell (2021), sobre riscos da fluência e do treinamento em grandes conjuntos de texto.


Continue a leitura: ← Capítulo #01 · Capítulo #03 →

Quer receber mais guias práticos sobre IA e trabalho?

Assine a newsletter e receba conteúdos objetivos para aplicar no trabalho e na carreira.

Quero receber os conteúdos
Compartilhe este artigo:
Gilmar Barros

Gilmar Barros

Mestre em Educação Profissional e Tecnológica, engenheiro de software e profissional de transformação digital. Produz conteúdos sobre inteligência artificial, carreira e desenvolvimento pessoal e profissional.

Logo GB- Gilmar Barros
Visão geral de privacidade

Este site utiliza cookies estritamente necessários para funcionar corretamente e manter suas preferências. Tratamos seus dados com transparência e respeito à Lei Geral de Proteção de Dados (LGPD). Você pode consultar mais informações na nossa Política de Privacidade.