O lançamento do Guided Vision, no Gemini Live, aponta um uso valioso da inteligência artificial: facilitar o acesso à informação visual. Para transformar essa possibilidade em inclusão no trabalho e na educação, porém, precisamos distinguir assistência de precisão garantida — e oferecer escolhas a quem utiliza a tecnologia.
Imagine participar de uma reunião em que alguém apresenta um gráfico e comenta: “Como vocês podem ver, o resultado está aqui”. Para uma pessoa cega, a informação pode terminar justamente onde a explicação deveria começar. A barreira está na maneira como o conteúdo foi compartilhado.
Agora imagine poder perguntar ao celular o que aparece naquele material, solicitar detalhes e explorar a informação no seu próprio ritmo. Essa possibilidade ajuda a entender por que a inteligência artificial pode ter um valor que não cabe apenas nas métricas de produtividade: ampliar a participação das pessoas.
Em 1º de outubro de 2026, o Google publicou o anúncio de lançamento do Guided Vision, recurso de assistência visual do Gemini Live para Android. Segundo a empresa, ele descreve imagens captadas pela câmera e oferece orientações faladas para melhorar o enquadramento. O desenvolvimento envolveu a Aira, empresa de interpretação visual, e mais de mil participantes de sua rede de testes. Esses números são informações do fornecedor, não uma avaliação independente de eficácia.
A novidade merece atenção. Seu valor, entretanto, será medido pelas barreiras que ajuda a remover e pela capacidade de reconhecer quando não consegue ajudar.
Uma descrição automática pode informar que há uma mesa, documentos e um computador. Uma conversa permite perguntar qual documento está à esquerda ou pedir a leitura de um trecho específico.
Essa interação é possível com sistemas multimodais, capazes de trabalhar com diferentes tipos de informação, como texto, áudio e imagem. A pessoa apresenta uma necessidade; o sistema usa o conteúdo disponível para elaborar uma resposta.
No Guided Vision, a documentação descreve também instruções para reposicionar a câmera. Se o objeto estiver mal enquadrado, o aplicativo pode orientar ajustes antes de continuar a interpretação. O recurso está em distribuição gradual: o anúncio não significa que todas as contas já tenham acesso. A ativação, quando disponível, fica nas configurações do aplicativo Gemini, na opção de Guided Vision no Live. Veja a documentação do Guided Vision.
O Google informa compatibilidade com Android 9 ou superior, nas regiões e nos idiomas atendidos pelo Gemini Live. O anúncio menciona participação de comunidades brasileiras nos testes, mas isso não comprova disponibilidade imediata em cada aparelho no Brasil.
Pense em uma profissional com baixa visão que deseja conferir a organização visual de uma apresentação antes de enviá-la. Ela pode preferir consultar um colega, utilizar uma ferramenta de ampliação ou experimentar uma descrição por IA.
O avanço está em ampliar essas opções.
Em um cenário hipotético, ela poderia perguntar: “Descreva a posição dos elementos deste slide, sem avaliar se estão bonitos”. Depois: “Há algum texto aparentemente cortado?”. São perguntas delimitadas, cujas respostas podem orientar uma revisão.
Lucy Jiang, Lotus Zhang e Leah Findlater discutem essa perspectiva em um trabalho disponibilizado em 10 de outubro de 2025, voltado a um workshop sobre tecnologias assistivas no trabalho. As autoras propõem descrições contextualizadas para apoiar criação, análise crítica e consumo de materiais visuais. Trata-se de uma contribuição de design, não de um experimento que demonstre ganhos de produtividade.
A implicação é importante: uma pessoa pode querer compreender um material, produzir algo ou avaliar o próprio trabalho. Cada objetivo exige uma assistência diferente.
É aqui que o entusiasmo precisa encontrar a pesquisa.
Ricardo E. Gonzalez Penuela e colegas acompanharam 20 pessoas cegas ou com baixa visão durante duas semanas, usando o aplicativo experimental VisionPal, baseado em GPT-4o. O estudo foi disponibilizado em fevereiro de 2026 e vinculado à conferência CHI 2026.
Na análise das conversas, 122 de 549 respostas — 22,2% — continham informação falsa. Ainda assim, os participantes relataram níveis relativamente elevados de confiança e satisfação. O resultado mostra que a experiência percebida e a correção das respostas podem se afastar.
Esse percentual pertence àquele aplicativo, modelo, conjunto de perguntas e condições de pesquisa. Não é uma taxa de erro do Guided Vision, que não foi avaliado no estudo. A contribuição da pesquisa é mostrar por que avaliações de assistência visual precisam examinar erros, além de ouvir se os usuários gostaram da experiência. Consulte o estudo de diário sobre assistência visual.
Para quem adota uma ferramenta, a pergunta útil passa a ser: “Como vou perceber e corrigir uma resposta equivocada nesta tarefa?”.
Outro estudo, de Ruei-Che Chang e colegas, disponibilizado em 5 de agosto de 2025, investigou o uso de vídeo ao vivo do ChatGPT com oito participantes cegos ou com deficiência visual. Os pesquisadores observaram dificuldades em situações dinâmicas, informações espaciais imprecisas e respostas capazes de gerar confusão.
A amostra é pequena e o sistema estudado é diferente do novo recurso do Google. Mesmo assim, o trabalho oferece evidências de problemas que merecem avaliação específica em assistentes visuais.
A própria documentação do Guided Vision delimita seu uso: ele pode cometer erros e não deve ser empregado para navegação ou detecção de obstáculos, nem substituir recursos de mobilidade.
Isso ajuda a separar situações muito diferentes. Descrever a estampa de uma camiseta admite uma margem de erro que não seria aceitável ao decidir se é seguro atravessar uma rua. O critério de confiança deve acompanhar a consequência da decisão.
Considere uma aula sobre gráficos. Como exemplo de uso a experimentar, um estudante poderia solicitar uma descrição inicial da imagem e perguntar sobre títulos, legendas ou organização dos elementos.
O professor, por sua vez, deveria disponibilizar os dados e uma explicação acessível. Assim, o estudante teria meios de comparar a descrição com uma fonte verificável.
Minha proposta pedagógica é usar a IA como uma possibilidade adicional de exploração. A instituição continua responsável por preparar materiais que possam ser utilizados por seus alunos. Entregar uma imagem sem descrição e transferir toda a adaptação ao celular do estudante seria uma escolha pobre de ensino.
Também convém preservar a pergunta do próprio aluno. Talvez ele queira localizar uma informação, compreender uma relação ou discutir uma hipótese. Uma descrição longa pode ser menos útil que uma resposta curta, orientada à dúvida que ele apresentou.
A qualidade da inclusão aparece quando o estudante consegue participar da atividade com condições reais de compreender, questionar e contribuir.
Uma mesa de trabalho pode conter um crachá, um documento de cliente ou uma informação confidencial ao fundo. Por isso, a discussão sobre assistência visual também envolve privacidade.
Tanusree Sharma e colegas entrevistaram 21 pessoas cegas ou com baixa visão em uma pesquisa disponibilizada em junho de 2025. O trabalho identificou decisões que equilibravam privacidade, eficiência e autonomia. Entre as preferências de design estavam processamento no próprio aparelho e mecanismos para ocultar conteúdo sensível. Essas são necessidades apontadas pelos participantes, não funcionalidades que podemos presumir presentes em qualquer aplicativo.
Na prática, uma organização pode preparar uma área de teste sem documentos reais, explicar o que será captado e oferecer alternativas. A documentação do Gemini Live também orienta pedir permissão antes de incluir outras pessoas em uma conversa com gravação.
A pessoa precisa conseguir decidir o que compartilhar. Acessibilidade e controle sobre a própria informação devem caminhar juntos.
Uma proposta inicial seria realizar um teste pequeno, conduzido com os profissionais que desejam utilizar a ferramenta.
Escolha uma tarefa de baixo risco, como explorar a organização de um material visual público. Defina antecipadamente o que seria um resultado útil e mantenha uma forma de conferir a resposta.
Durante o teste, registre quatro aspectos: se a pessoa conseguiu concluir a tarefa, quanto esforço foi necessário, quais erros ocorreram e como foram corrigidos. Pergunte também se ela gostaria de continuar usando aquele recurso.
Essa avaliação evita tratar velocidade como o único resultado relevante. Uma atividade pode levar o mesmo tempo e, ainda assim, oferecer mais privacidade, liberdade de escolha ou participação.
Também permite identificar situações em que a tecnologia acrescenta trabalho. Se cada resposta exige uma conferência difícil, talvez outra forma de acesso seja mais adequada.
Há uma conexão importante entre essa pauta e o desenvolvimento humano. Falar em autonomia exige olhar para as condições que permitem agir, aprender e participar.
Uma ferramenta pode abrir uma possibilidade. O ambiente precisa permitir que a pessoa a utilize, recuse ou combine com outros apoios.
Por isso, proponho avaliar o bom uso da IA com uma pergunta concreta: depois que a tecnologia entrou, a pessoa passou a ter mais controle sobre sua atividade?
Se ela consegue acessar informações, formular suas próprias perguntas e escolher como realizar uma tarefa, existe um benefício a investigar e fortalecer. Se passou apenas a depender de respostas difíceis de verificar, ainda temos um problema de projeto.
O futuro desejável da assistência visual será construído com pessoas cegas e com baixa visão participando das decisões. A tecnologia deve aprender a escutar essas escolhas tão bem quanto promete descrever o mundo.
Imagem de capa ilustrativa, gerada com inteligência artificial.
Assine a newsletter e receba conteúdos objetivos para aplicar no trabalho e na carreira.
Quero receber os conteúdos