Descrever uma unidade inspirada em neurônios e medir informação são problemas diferentes. Na década de 1940, essas duas linhas ofereceram ferramentas matemáticas que depois participariam da história da inteligência artificial.
Pense em uma mensagem que precisa atravessar um canal com interferência. Agora pense em uma pequena unidade que recebe sinais e só produz uma saída quando determinada condição é atendida. A primeira situação envolve comunicação; a segunda, uma forma de processamento. Ambas podem ser estudadas matematicamente sem resolver, de uma só vez, o significado da mensagem ou toda a complexidade de um cérebro.
Voltamos aos anos 1940 porque as ideias desta série se desenvolveram em paralelo. Enquanto Turing investigava computação e comportamento, outros pesquisadores construíam modelos sobre organização de sinais e transmissão de informação. A história fica mais clara quando reconhecemos essas convergências sem fundir todos os problemas.
Um neurônio matemático é uma simplificação
Em 1943, Warren McCulloch e Walter Pitts publicaram um modelo lógico de atividade nervosa. O trabalho investigava redes de unidades idealizadas, com comportamentos descritos por regras, e suas relações com operações lógicas. O modelo selecionava propriedades da atividade nervosa para estudar suas relações lógicas. [1]
Um modelo seleciona propriedades para responder a uma pergunta. Uma planta baixa descreve a disposição de uma casa, mas não sua temperatura, seus ruídos e as memórias de quem mora nela. Da mesma forma, um neurônio artificial não contém todos os fenômenos químicos e elétricos de um neurônio real.
Para visualizar uma unidade de limiar, suponha duas entradas que podem valer zero ou um. A saída será um somente quando a soma alcançar dois. Com zero e zero, a saída é zero. Com um e zero, também. Com um e um, ela passa a um. Essa é uma explicação didática de uma operação lógica do tipo “E”.

Redes acrescentam relações entre unidades
Uma unidade isolada pode realizar uma operação limitada. Ao conectar unidades, criamos relações entre resultados intermediários. A saída de uma pode tornar-se entrada de outra. A rede passa a representar uma composição de operações, não apenas uma decisão única.
As conexões e regras de uma rede podem ser montadas manualmente. Em outros modelos, parâmetros são ajustados por um procedimento de treinamento. A distinção será importante quando chegarmos ao perceptron e às redes profundas: possuir unidades conectadas e aprender com exemplos são características relacionadas, mas diferentes.
Os círculos e as linhas dos diagramas representam essa organização matemática. Seu alcance aparece nas operações realizadas e nos resultados obtidos, que examinaremos nos capítulos sobre treinamento.
Shannon pergunta como transmitir mensagens
Em 1948, Claude Shannon publicou A Mathematical Theory of Communication. O trabalho desenvolveu uma teoria para tratar transmissão, incerteza, codificação e ruído. Uma distinção fundamental é que o problema técnico da comunicação pode ser analisado sem tomar o significado semântico da mensagem como a grandeza principal. [2]
Semântica diz respeito ao significado. Uma sequência de sinais pode ser transmitida corretamente e continuar incompreensível para alguém que não conhece o código. Também pode estar perfeitamente preservada e afirmar algo falso. Fidelidade de transmissão, interpretação e verdade são perguntas diferentes.
Imagine que um sistema copie, sem alterar nenhuma letra, uma notícia inventada. A transmissão foi fiel. Isso não transformou a notícia em evidência. Essa separação continua útil quando tratamos de arquivos, mensagens e respostas geradas por máquinas.

O que significa um bit
Um bit representa uma unidade binária: duas possibilidades, convencionalmente indicadas por zero e um. Diferentes dispositivos representam esses dois estados por meios físicos distintos.
Em um exemplo simples, precisamos comunicar qual de duas opções igualmente prováveis foi escolhida. Uma distinção binária resolve a tarefa. Para quatro possibilidades igualmente prováveis, podemos usar duas posições binárias: 00, 01, 10 e 11. Para oito, três posições são suficientes.
O exemplo ajuda a compreender a relação entre quantidade de alternativas e necessidade de representação. Duas posições binárias distinguem quatro estados. Em arquivos de texto, imagem ou som, o tamanho também depende das convenções de codificação, das redundâncias e da compressão.
Informação não é sinônimo de importância
Na teoria da informação, o grau de surpresa de um resultado se relaciona à sua probabilidade dentro de um modelo. Um evento esperado traz menos novidade do que um evento raro. Isso não equivale à importância emocional, política ou prática de uma mensagem. [2]
Se alguém repete seu nome cem vezes, a sequência pode ter pouca novidade para você. Uma mensagem curta sobre um encontro pode mudar seu dia. O tamanho do texto e a relevância para quem o recebe não são a mesma coisa. Essa comparação ilustra a necessidade de dizer qual sentido de “informação” estamos usando.
Também precisamos conhecer a distribuição assumida. Chamar um acontecimento de surpreendente depende de nossas expectativas. Um modelo probabilístico pode representar essas expectativas de modo explícito; não descobre automaticamente o significado humano de todas as surpresas.

Por que essas ideias aparecem na história da IA
Redes artificiais oferecem formas de transformar sinais. A teoria da informação fornece maneiras de pensar representação, incerteza e comunicação. Em trabalhos posteriores, conceitos dessas áreas aparecem em objetivos de treinamento, codificação e análise de sistemas. O livro Deep Learning, de Goodfellow, Bengio e Courville, apresenta fundamentos de probabilidade e informação como parte da formação matemática para essas técnicas. [3]
Para transformar esses fundamentos em aplicações, outros trabalhos desenvolveram métodos de treinamento, reuniram dados e exploraram novos recursos computacionais. As escolhas de engenharia e avaliação também foram decisivas.
Vários caminhos de pesquisa coexistiram, e alguns conceitos ganharam usos que seus autores não especificaram originalmente. Essa circulação de ideias faz parte da história da IA.
Um exercício para distinguir três níveis
Escreva uma frase em um código que outra pessoa não conhece. Primeiro, peça que ela copie os sinais. Depois, forneça a chave e peça que interprete. Finalmente, solicite que verifique se a afirmação corresponde à realidade.
As três tarefas exigem critérios diferentes. Na cópia, comparamos sinais. Na interpretação, examinamos a correspondência com uma convenção. Na verificação, precisamos de evidências sobre o mundo. A atividade torna observáveis três funções que a palavra “informação” costuma reunir.
Essa distinção será especialmente valiosa quando chegarmos a sistemas que produzem linguagem. Uma resposta pode estar bem formada e ser fácil de transmitir, mas ainda exigir interpretação e conferência. A organização matemática é indispensável; ela não elimina as demais perguntas.
No próximo capítulo, encontraremos pesquisadores tentando reunir diferentes ambições sob um nome comum. Em Dartmouth, “inteligência artificial” se tornaria a expressão de um programa de investigação.