O teste de Turing envelheceu? Quando conversar já não basta

O teste de Turing transformou a pergunta sobre máquinas pensantes em um problema de comportamento: uma máquina conseguiria conversar sem ser reconhecida como máquina? Com os modelos de linguagem atuais, essa fronteira ficou menos segura — mas o teste não perdeu completamente sua importância.


SÉRIE · Máquinas podem pensar?
3 de 6

A pergunta que Turing preferiu não responder

No texto anterior, vimos que Alan Turing ajudou a definir o que significa executar um procedimento por meio de computação.

Em 1950, ele voltou a uma pergunta muito mais difícil:

máquinas podem pensar?

O problema estava nas próprias palavras. O que exatamente significa “pensar”? E quais máquinas deveriam entrar nessa definição?

No artigo Computing Machinery and Intelligence, publicado na revista Mind, Turing considerou a formulação imprecisa demais para conduzir a discussão.

Em vez de tentar definir pensamento, propôs substituí-la por um problema observável.

Nascia o chamado jogo da imitação.

A versão apresentada por Turing envolvia um interrogador separado dos demais participantes e comunicação por texto.

Em uma das adaptações que se tornaram conhecidas posteriormente como teste de Turing, a questão central passou a ser: uma pessoa consegue distinguir, apenas pela conversa, um interlocutor humano de uma máquina?

A mudança é importante.

Turing não precisava abrir a máquina e procurar alguma “essência da inteligência”.

Podia observar o que ela fazia.

O que o teste de Turing mede?

O teste costuma ser apresentado como se fosse uma prova de inteligência.

É uma interpretação forte demais.

O que ele avalia diretamente é a capacidade de uma máquina produzir comportamento linguístico suficientemente convincente para ser confundido com o de uma pessoa.

Isso exige bastante coisa.

A máquina precisa acompanhar a conversa, responder ao contexto, adaptar a linguagem e lidar com perguntas inesperadas sem revelar rapidamente sua natureza.

Turing chegou a prever que, por volta do ano 2000, computadores poderiam jogar o jogo de modo que um interrogador médio tivesse no máximo 70% de chance de fazer a identificação correta depois de cinco minutos de conversa.

Mas o teste não verifica diretamente consciência, experiência subjetiva ou compreensão.

Ele observa desempenho.

Essa diferença se tornou muito mais importante com a inteligência artificial generativa.

Quando máquinas começaram a conversar bem

Durante décadas, sustentar uma conversa convincente parecia uma fronteira difícil.

Hoje, modelos de linguagem escrevem textos, explicam conceitos, mantêm contexto, adaptam o tom e respondem a perguntas de maneira suficientemente natural para que, em certas condições, seja difícil identificar quem está do outro lado.

Em 2025, pesquisadores da Universidade da Califórnia em San Diego realizaram testes de Turing controlados e pré-registrados envolvendo ELIZA, GPT-4o, Llama 3.1 e GPT-4.5.

Os participantes conversavam por cinco minutos simultaneamente com outro ser humano e com um dos sistemas e depois precisavam decidir qual interlocutor era humano.

Quando recebeu instruções para assumir uma persona humana, o GPT-4.5 foi escolhido como humano em 73% das rodadas — mais frequentemente que o próprio participante humano com quem era comparado.

O resultado é interessante, mas exige cuidado.

Ele não significa que “a inteligência artificial passou definitivamente no teste de Turing”.

Não existe uma única implementação universal do teste, e o desempenho depende do sistema, das instruções, do tempo de conversa e do desenho experimental.

O estudo mostra algo mais específico e talvez mais importante:

a capacidade de parecer humano em uma conversa já não é uma fronteira puramente hipotética.

Parecer compreender é compreender?

É aqui que o problema muda.

Um sistema pode conversar sobre dor sem sentir dor.

Pode explicar justiça sem possuir responsabilidade moral; Pode descrever Paris sem jamais ter caminhado por suas ruas; Pode produzir uma resposta convincente e, ainda assim, cometer erros factuais ou inventar informações.

Isso não torna a conversa irrelevante.

Mostra apenas que desempenho linguístico e compreensão não são necessariamente a mesma coisa.

Nos modelos de linguagem, as respostas são produzidas a partir de relações aprendidas durante o treinamento e do contexto fornecido durante a interação.

Como vimos anteriormente em o que é um modelo de linguagem, gerar uma sequência linguística adequada não exige que o sistema possua uma experiência humana do significado.

Por isso, uma frase continua podendo soar compreensiva mesmo quando não temos base para afirmar que exista compreensão por trás dela.

A conversa continua sendo evidência de capacidade.

Só deixou de resolver sozinha a questão sobre inteligência.

O teste de Turing ainda serve?

Serve — desde que não seja usado para responder perguntas que ele não mede.

O teste continua importante porque mostra algo fundamental sobre nossa relação com outras mentes: não observamos diretamente o pensamento dos outros.

Inferimos estados mentais a partir de comportamento, linguagem e interação.

Com outras pessoas, essa inferência ocorre dentro de um conjunto muito maior de evidências: compartilhamos corpo, história evolutiva, experiências biológicas e uma vida social semelhante.

Com uma máquina, essa base desaparece. Resta sobretudo o comportamento observado.

É justamente por isso que sistemas conversacionais podem produzir uma impressão tão forte de presença.

Quando uma máquina responde bem, lembra o contexto e ajusta o tom, nossa tendência natural é interpretar esses sinais como faríamos diante de outra pessoa.

O teste de Turing continua útil para estudar essa fronteira. O que ele já não oferece é um carimbo simples dizendo:

“isto pensa”.

Conversar já não encerra a discussão

Turing teve um mérito extraordinário ao deslocar a discussão de uma definição abstrata de pensamento para algo que podia ser observado.

Setenta e seis anos depois, máquinas já conseguem produzir, em determinadas condições, exatamente o tipo de comportamento que tornou o jogo da imitação interessante.

Isso não torna o teste inútil. Torna a pergunta seguinte inevitável.

Se uma máquina consegue produzir respostas corretas e convincentes sem que saibamos se compreende aquilo que diz, então o comportamento deixa uma lacuna.

Em 1980, o filósofo John Searle construiu um experimento mental justamente para explorar essa diferença.

Uma pessoa poderia manipular símbolos perfeitamente, produzir todas as respostas esperadas e, ainda assim, não compreender uma única palavra?

Essa é a porta do quarto chinês.


MÁQUINAS PODEM PENSAR?

Próximo: O quarto chinês: a IA entende ou apenas manipula símbolos?

3 de 6 — Teste de Turing

Anterior: Máquina de Turing: o que é e por que ela é universal?


Deixe um comentário