Un estudio indica que GPT-4.5 supera a los humanos en pruebas de indistinguibilidad conversacional
Un reciente estudio llevado a cabo por la Universidad de California en San Diego ha generado debate en la comunidad científica al demostrar que el modelo de lenguaje GPT-4.5 de OpenAI fue capaz de superar el test de Turing en un 73 % de los casos, cuando se le asignaban ‘prompts con personalidad’. Esta prueba, que simula conversaciones humanas entre una persona y una IA sin que el evaluador sepa quién es quién, buscaba medir cuán convincentemente una IA puede parecer humana. El experimento involucró a unos 300 participantes que interactuaban en línea, comparando humanos reales con diversos modelos de IA, como GPT-4o, LLaMA 3.1 y el clásico ELIZA. Los resultados revelaron que GPT-4.5 fue confundido con humanos más veces que los propios humanos, especialmente cuando se le proporcionaba una identidad definida. Sin personalidad, sin embargo, el rendimiento del modelo cayó drásticamente. Esto sugiere que el modo en que se guía a las IA a través de instrucciones específicas tiene un gran impacto en su efectividad. A pesar de no ser una medida definitiva de inteligencia, el test de Turing sigue siendo relevante para explorar los límites de la interacción humano-máquina. Los hallazgos plantean preocupaciones éticas y sociales, dado el potencial de estas IAs para sustituir a personas en contextos comunicativos reales.
