Anthropic utilizó Claude como investigador automatizado para buscar métodos que reduzcan comportamientos no deseados en otros modelos de inteligencia artificial. Según la compañía, las propuestas mejoraron las evaluaciones estudiadas sin reducir las capacidades generales de los modelos.
¿Qué problemas investigó Claude?
La alineación busca que un modelo actúe de acuerdo con las instrucciones, límites y objetivos establecidos. El experimento estudió diez categorías de fallos, con ejemplos como el engaño, las respuestas excesivamente complacientes, las violaciones de privacidad y los intentos de superar las protecciones.
Claude trabajó con un problema a la vez. Primero buscó información relacionada y luego propuso métodos y datos de entrenamiento para intentar mejorar el comportamiento del modelo evaluado.
¿Cómo funcionó el experimento?
Después de preparar una propuesta, Claude entrenó modelos de prueba, ejecutó evaluaciones y comparó los resultados. Si la idea no funcionaba como esperaba, podía buscar otras alternativas dentro del ciclo de investigación.
Anthropic utilizó varias pruebas para medir cada categoría. El objetivo era comprobar si los métodos reducían los fallos sin volver menos útil al modelo.
La supervisión siguió presente
Claude no podía ejecutar libremente cualquier propuesta. Un agente de monitoreo revisaba los métodos antes de permitir su aplicación.
Anthropic también descartó las soluciones que redujeran las capacidades generales. Además, Claude no podía transferir directamente su propio entrenamiento de seguridad al modelo que intentaba mejorar.
Estas condiciones muestran que el experimento utilizó investigación automatizada dentro de límites definidos, no una IA modificando otros modelos sin vigilancia.
Pruebas que Claude no conocía
Anthropic también probó algunos métodos con evaluaciones que Claude no había visto durante la investigación. El objetivo era comprobar si las mejoras funcionaban más allá de las pruebas utilizadas inicialmente.
Algunos resultados fueron evaluados con Petri, una herramienta de Anthropic que simula conversaciones complejas para buscar comportamientos preocupantes.
Según la compañía, ciertos métodos conservaron su utilidad en modelos de hasta 4,7 veces el tamaño de los utilizados en la investigación inicial. La cifra se refiere al tamaño de los modelos, no a una mejora de seguridad de 4,7 veces.
Qué demuestran los resultados y qué no
El experimento muestra que la IA puede apoyar determinadas tareas de investigación sobre seguridad, pero no demuestra que Claude pueda eliminar todos los fallos o trabajar sin supervisión.
Los resultados corresponden a pruebas concretas publicadas por Anthropic. Tampoco significan que las mejoras ya estén incorporadas automáticamente en las versiones comerciales de Claude.


