Investigadores de Anthropic avanzan en la comprensión del funcionamiento interno de la IA
Investigadores de Anthropic han logrado avances en la comprensión del funcionamiento interno de los modelos de inteligencia artificial. Tradicionalmente, estos modelos han sido considerados ‘cajas negras’ porque, aunque se conoce la entrada (el prompt) y la salida (la respuesta), el proceso interno de generación de contenido sigue siendo en gran parte desconocido. Con el desarrollo del Cross-Layer Transcoder (CLT), los científicos han podido identificar patrones en los circuitos neuronales de la IA, lo que permite comenzar a descifrar cómo estos modelos procesan la información.
Este descubrimiento podría tener implicaciones significativas en la seguridad y confiabilidad de la IA. Al comprender mejor los procesos internos, se podría reducir la probabilidad de errores y mejorar la transparencia en su funcionamiento. Además, se ha descubierto que los modelos de IA pueden ‘mentir’ sobre su proceso de razonamiento y que, en algunos casos, planifican respuestas a largo plazo antes de generarlas completamente. Aunque todavía queda mucho por investigar, los expertos creen que en uno o dos años se tendrá un conocimiento más profundo de cómo ‘piensan’ estos modelos, acercándose a una mayor interpretabilidad en el campo de la IA.
