Série IA sem mistério · #05 de 06. Veja a ordem completa de leitura.
Na padaria de Marcelo, a sexta-feira começou com uma surpresa: sobraram pães demais. A ferramenta que ajudava a planejar a fornada tinha previsto uma manhã movimentada. Marcelo olhou as anotações e descobriu o motivo da confiança: em algumas sextas-feiras do registro antigo, a equipe usara avental azul e vendera muito pão. O sistema aprendera a tratar a cor do avental como pista de movimento.
Mas o avental não traz clientes pela porta. Naquelas sextas-feiras, talvez houvesse pagamento de salários, um evento no bairro ou simplesmente uma coincidência. A história é inventada, mas a pergunta que ela levanta é importante: dar mais informações a uma IA sempre melhora suas previsões?
Para estimar quantos pães preparar, Marcelo poderia olhar o dia da semana, vendas recentes, feriados e previsão do tempo. São pistas que podem estar disponíveis antes de começar a fornada. Ele também poderia incluir a música tocada na loja, a cor do avental e o número de letras no nome de quem abriu o caixa.
Com informações suficientes, é fácil encontrar coincidências nos registros antigos. Um modelo muito flexível pode se ajustar a elas e parecer excelente no treino. Só que uma coincidência de ontem pode desaparecer amanhã. É o problema que chamamos de sobreajuste: aprender detalhes dos exemplos vistos que pouco ajudam diante de exemplos novos.
Isso não quer dizer que toda variável inesperada seja inútil. Às vezes uma pista surpreendente revela um hábito real. A pergunta decisiva é se ela melhora a previsão em dados adequados que não guiaram a escolha e se estará disponível na hora certa.
Uma estratégia é comparar modelos que usam conjuntos diferentes de informações. Marcelo pode começar com dia da semana e vendas recentes, depois verificar se o tempo ou os feriados acrescentam algo. Ao escolher, deve olhar o desempenho em dados de validação, não apenas no treino. No artigo anterior, vimos por que o teste final deve ficar reservado até o fim.
A aula 7 do curso de Machine Learning de Paulo Orenstein, no IMPA, apresenta a seleção de variáveis como uma das formas de lidar com excesso de informações. Ela também mostra um cuidado: quanto mais combinações testamos, maior a chance de escolher uma que se deu bem por sorte na validação. Por isso, a equipe não deve transformar a busca pelo “melhor número” numa caça sem fim.
Existe outra ideia: deixar o modelo considerar várias pistas, mas evitar que ele atribua um peso enorme a uma delas sem evidência suficiente. Em modelos lineares, essa família de técnicas se chama regularização.
Imagine que o sistema tente prever a venda de amanhã somando pequenas contribuições: uma para sexta-feira, outra para chuva, outra para o movimento da semana. Se o histórico for curto, ele pode acabar dando uma influência desproporcional ao avental azul. A regularização impõe uma espécie de custo para pesos grandes. O modelo passa a precisar de evidência mais consistente para confiar tanto em uma pista.
Duas técnicas discutidas na aula são ridge e lasso. A primeira tende a reduzir os pesos sem zerá-los; a segunda pode levar alguns pesos exatamente a zero, deixando certas variáveis de fora da previsão. Não há campeã universal. A escolha e a intensidade desse freio precisam ser avaliadas com dados de validação, sempre com o teste final preservado.
Marcelo poderia reagir ao erro usando só uma informação: o dia da semana. Seria simples, mas talvez ignorasse o feriado prolongado, o fechamento de uma escola próxima ou uma mudança real no movimento. Simplificar demais também pode piorar a previsão.
O objetivo é encontrar um equilíbrio. Quando o modelo se prende demais aos registros antigos, ele sofre com o sobreajuste. Quando é rígido demais para captar padrões importantes, falha por outro motivo. A comparação em exemplos novos ajuda a escolher o nível de complexidade que serve à tarefa.
Marcelo não precisa proibir o avental azul. Só não deve deixar que ele decida quantos pães vão para o forno. A boa previsão usa o passado como pista, sem confundir coincidência com regra.
Para aprofundar: curso Machine Learning de Paulo Orenstein (IMPA, 2026), especialmente a aula 7 sobre seleção de modelos lineares e regularização. Marcelo e a padaria são exemplos didáticos criados para este artigo.
Na série: ← #04 — Como testar uma IA sem deixar que ela veja a prova antes
Próximo artigo: #06 — Quando a vida faz curva →
Assine a newsletter e receba conteúdos objetivos para aplicar no trabalho e na carreira.
Quero receber os conteúdos