Série IA sem mistério · #03 de 06. Veja a ordem completa de leitura.
O painel da equipe de atendimento mostrava um número bonito: 95% de acertos. Parecia motivo para comemorar. Mas Ana, que coordenava a equipe, abriu as mensagens classificadas pelo sistema e encontrou algo estranho: todas as solicitações urgentes tinham passado despercebidas.
O sistema analisara mil mensagens. Novecentas e cinquenta eram comuns; cinquenta precisavam de atenção rápida. Sua estratégia era simples: chamar todas de comuns. Acertou as 950 comuns e errou justamente as 50 urgentes. Tecnicamente, 95% de acerto. Na rotina da equipe, um fracasso.
Esse exemplo é inventado, mas o problema é real: um número só pode esconder os erros que mais importam. Então, como avaliar melhor?
No caso de Ana, o modelo não escreve respostas aos clientes. Ele tenta decidir quais mensagens merecem atenção rápida. Sua saída tem duas categorias: “urgente” e “comum”. Antes de medir desempenho, é preciso definir o que conta como urgência e ter exemplos classificados de forma consistente por pessoas que conhecem o atendimento.
Também é preciso testar com mensagens que não foram usadas para treinar ou escolher o modelo. Caso contrário, podemos medir apenas a habilidade de repetir o passado. Falamos sobre essa diferença no artigo anterior da série.
Em vez de olhar apenas a porcentagem geral, Ana monta uma tabela simples. Quando a mensagem é urgente e o sistema a marca como comum, temos um urgente perdido. Quando ela é comum e o sistema a marca como urgente, temos um alarme falso. Também contamos os casos que ele identificou corretamente em cada grupo.
Essa contagem é conhecida como matriz de confusão. O nome é técnico, mas a ideia é doméstica: pôr cada acerto e cada tipo de erro em sua gaveta. A aula 4 do curso de Machine Learning de Paulo Orenstein, no IMPA, mostra por que a taxa geral de erro pode ser pouco informativa quando os erros se distribuem de modo desigual entre as categorias.
Vamos imaginar outro sistema, testado nas mesmas mil mensagens. Ele encontra 40 das 50 urgentes e deixa passar dez. Ao mesmo tempo, marca 40 mensagens comuns como urgentes. No total, acerta 950 mensagens: 910 comuns e 40 urgentes. Também tem 95% de acerto, mas seu comportamento é bem diferente do primeiro.
A primeira é: de todas as mensagens realmente urgentes, quantas encontramos? No segundo sistema, 40 de 50. São 80%. Essa medida costuma ser chamada de recall ou sensibilidade. As dez que ficaram de fora representam o risco de não perceber uma necessidade importante.
A segunda é: de todas as mensagens que o sistema chamou de urgentes, quantas eram mesmo? Ele sinalizou 80: 40 urgentes e 40 comuns. Metade dos alertas estava correta. Essa medida é a precisão. Os alarmes falsos exigem tempo de quem vai conferir a fila.
Note a diferença: o primeiro sistema acertou 95% no total, mas encontrou zero das urgentes. O segundo também acertou 95%, encontrou 80% das urgentes e produziu 40 alarmes falsos. A escolha não sai pronta de uma fórmula. Ana precisa discutir quanto custa deixar um caso passar e quanto trabalho a equipe consegue dedicar à revisão.
Muitos classificadores atribuem uma pontuação a cada mensagem. O sistema pode sinalizar como urgente tudo que passe de determinado limite. Se baixarmos esse limite, mais mensagens entram na fila prioritária: talvez encontremos mais urgentes, mas também apareçam mais alarmes falsos. Se o aumentarmos, a fila diminui e alguns casos importantes podem ficar de fora.
A aula do IMPA apresenta justamente a mudança desse limite de decisão e a comparação entre falsos positivos e falsos negativos. O ponto prático é este: o limite deve ser escolhido para o serviço que se quer oferecer, com testes em dados adequados e revisão quando a operação mudar.
Uma mensagem pode ser ambígua. Em vez de forçar toda dúvida a uma decisão automática, Ana pode mandar os casos incertos para uma pessoa. Isso muda o desenho do trabalho: a IA ajuda a organizar a fila, enquanto a equipe continua capaz de corrigir o caminho.
O número no painel de Ana continuava em 95%. O que mudou foi a pergunta da equipe. Já não bastava saber quantas mensagens o sistema acertava. Era preciso saber quem ficava esperando quando ele errava.
Para aprofundar: curso Machine Learning de Paulo Orenstein (IMPA, 2026), especialmente a aula 4 sobre classificação e avaliação. Os números e a história de Ana são exemplos didáticos criados para este artigo.
Na série: ← #02 — Por que uma IA acerta nos testes e erra na vida real?
Próximo artigo: #04 — Como testar uma IA sem deixar que ela veja a prova antes →
Assine a newsletter e receba conteúdos objetivos para aplicar no trabalho e na carreira.
Quero receber os conteúdos