Modelos de lenguaje superan el test de Turing, pero el resultado plantea dudas metodológicas
Un estudio realizado por investigadores de la Universidad de California asegura que dos modelos de lenguaje, GPT-4.5 y LLaMa-3.1-405B, han logrado superar el Test de Turing, una prueba ideada hace 75 años por Alan Turing para evaluar la capacidad de las máquinas para simular el comportamiento humano. El experimento consistió en conversaciones simultáneas de cinco minutos entre un humano, otro humano y una IA, donde el objetivo del interrogador era identificar cuál de los dos era la persona real. Los resultados mostraron que, especialmente cuando se dotaba a los modelos de una ‘personalidad’ específica, estos eran confundidos con humanos en un porcentaje elevado: 73% en el caso de GPT-4.5 y 56% para LLaMa-3.1. Sin embargo, las críticas no tardaron en llegar. Muchos apuntan que las conversaciones eran triviales, con preguntas poco profundas, y que los interrogadores no intentaron realmente identificar a la IA. Además, se sugiere que la cortesía humana o la falta de motivación académica pudo haber influido en el resultado. El debate sigue abierto: ¿es suficiente con engañar a humanos poco exigentes para afirmar que una IA ha pasado el test de Turing? ¿O deberíamos replantear los criterios del test en el contexto actual de la inteligencia artificial?
