Série IA sem mistério · #02 de 06. Veja a ordem completa de leitura.
A padaria de Marta começou a usar um sistema para prever quantos pães preparar a cada manhã. Na apresentação, o resultado parecia excelente: quase sempre chegava perto da quantidade vendida nos dias anteriores. Na primeira semana de uso, porém, faltou pão no sábado e sobrou muito na segunda-feira.
O sistema tinha “acertado” os números que já conhecia. O problema apareceu quando precisou lidar com dias novos. Esse desencontro acontece em projetos de inteligência artificial e tem uma pergunta no centro: o teste foi parecido com a vida real que o modelo encontraria?
Para treinar a previsão da padaria, juntamos registros antigos: dia da semana, feriados, promoções, clima disponível antes da abertura e quantidade vendida. O modelo ajusta suas regras internas para diminuir os erros nesses registros.
Se receber liberdade demais para se ajustar a poucos exemplos, ele pode se prender a coincidências. Talvez numa amostra pequena todos os sábados com chuva tenham tido vendas baixas, mas isso se devia a uma obra na rua naquele mês. O modelo encontra uma relação que funcionou ali; em outro sábado chuvoso, sem obra, erra. É o sobreajuste, também chamado de overfitting.
Há o problema oposto: um modelo simples demais pode ignorar padrões reais. Se prevê sempre a mesma quantidade, não percebe que domingos e dias úteis têm demandas diferentes. O objetivo é encontrar uma solução que aprenda o suficiente sem se prender aos detalhes passageiros do passado.
Uma maneira de avaliar o sistema é separar os dados por finalidade. Os dados de treino ajudam a ajustar o modelo. Os de validação ajudam a escolher entre versões, por exemplo uma mais simples e outra mais flexível. O conjunto de teste fica reservado para a avaliação final, depois dessas escolhas.
Pense numa receita de pão. Você desenvolve a receita na cozinha, experimenta algumas versões e escolhe uma. Para saber como ela funciona fora dali, pede a alguém que prepare uma fornada seguindo suas instruções. Se você mudar a receita depois de ver essa fornada, precisará de outra avaliação independente para medir a versão nova.
Em aprendizado de máquina, a separação só ajuda se for respeitada. Usar repetidamente o resultado do teste para ajustar o modelo transforma o teste em mais uma parte do treino. A aula sobre métodos de reamostragem de Paulo Orenstein, no IMPA mostra também a validação cruzada: repetir a avaliação com diferentes partes dos dados para comparar alternativas. As escolhas feitas a partir dos dados precisam ocorrer dentro de cada etapa dessa validação.
Agora suponha que a planilha da padaria inclua o valor total registrado no caixa ao fim do dia. Com ele, prever quantos pães foram vendidos pode ficar muito fácil. Só há um detalhe: às seis da manhã, quando Marta precisa decidir o que assar, o total do caixa ainda não existe.
Essa informação entrou pela porta dos fundos. Chamamos isso de vazamento de dados: o modelo recebe, direta ou indiretamente, uma pista que não estaria disponível no momento da previsão. O teste pode parecer ótimo e, mesmo assim, não representar o uso real.
O vazamento nem sempre é tão óbvio. Pode ocorrer quando registros quase idênticos aparecem no treino e no teste, quando dados do futuro são usados para construir uma variável do passado ou quando escolhemos as melhores pistas olhando a base inteira antes de separar as partes. A aula do IMPA traz um exemplo em que selecionar variáveis dessa forma produz uma avaliação enganosa.
Mesmo um teste bem-feito depende dos exemplos disponíveis. A padaria pode mudar de endereço, abrir uma escola na vizinhança ou começar a vender por aplicativo. O comportamento dos clientes muda; as relações aprendidas com meses anteriores podem deixar de valer.
Por isso, em problemas ligados ao tempo, costuma fazer sentido treinar com dados mais antigos e verificar o desempenho em períodos posteriores. Misturar aleatoriamente registros de meses futuros no treino pode criar uma avaliação confortável demais para uma previsão que, na prática, sempre precisa olhar para a frente.
Depois da implantação, é preciso acompanhar os erros. Em quais dias a previsão falha mais? O erro custa a mesma coisa quando sobra pão e quando falta? Talvez Marta prefira um pequeno excedente a deixar clientes sem produto. A métrica deve refletir essa escolha, e a decisão final pode combinar previsão com experiência humana.
Naquela segunda-feira, Marta não precisava ouvir que o modelo tinha uma ótima nota no laboratório. Precisava saber quantos pães assar e o que fazer quando a previsão falhasse. É para isso que serve uma avaliação honesta: transformar um número bonito em uma decisão que aguenta a manhã seguinte.
Para aprofundar: curso Machine Learning de Paulo Orenstein (IMPA, 2026), sobretudo a revisão da semana 1 e a aula 5 sobre validação e reamostragem. A história da padaria é um exemplo fictício criado para explicar os conceitos.
Na série: ← #01 — Como uma IA aprende com exemplos?
Próximo artigo: #03 — Como saber se um modelo de IA é realmente bom? →
Assine a newsletter e receba conteúdos objetivos para aplicar no trabalho e na carreira.
Quero receber os conteúdos