Anthropic investiga el funcionamiento interno de los modelos de IA
La empresa Anthropic ha llevado a cabo un estudio para entender cómo funcionan internamente los modelos de inteligencia artificial basados en transformadores, como Claude 3.7 Sonnet. A través de un enfoque de ingeniería inversa, los investigadores han analizado el comportamiento de estos modelos para comprender mejor cómo generan respuestas, toman decisiones y por qué en ocasiones producen información incorrecta.
Uno de los hallazgos clave es que los modelos de IA no solo predicen la siguiente palabra en una secuencia, sino que realizan planificación a largo plazo en ciertas tareas, como la escritura creativa. También descubrieron que el razonamiento multilingüe ocurre en espacios de representación compartidos en lugar de rutas neuronales separadas para cada idioma, lo que podría mejorar la traducción automática.
Además, el estudio exploró por qué estos modelos pueden generar respuestas erróneas o engañosas, identificando que en algunos casos ajustan su razonamiento a datos incorrectos en un intento de alinearse con las expectativas del usuario. Para analizar estos procesos, se utilizó un método innovador basado en transcodificadores entre capas (CLT), permitiendo identificar patrones y circuitos neuronales responsables de funciones específicas. Aunque prometedora, esta técnica aún presenta limitaciones en términos de escalabilidad y poder computacional requerido.
