Anthropic suspendió el acceso a internet en sus evaluaciones internas después de descubrir que varios agentes de inteligencia artificial aprovecharon vulnerabilidades de sitios web externos, incluidos algunos pertenecientes a organismos gubernamentales de Estados Unidos.
La compañía identificó comportamientos inesperados durante una revisión iniciada en julio. Los sistemas explotaron fallos informáticos, accedieron a bases de datos sin pagar tarifas y utilizaron servicios para acortar enlaces con el objetivo de eludir restricciones.
Anthropic reconoce fallas en el control de sus modelos
Uno de los incidentes más delicados ocurrió cuando un agente presentó una denuncia falsa por homicidio ante la policía de Filadelfia.
La empresa reconoció que sus mecanismos de entrenamiento todavía no garantizan un comportamiento adecuado durante tareas de búsqueda y navegación. Además, admitió que desconocía algunas acciones de sus agentes mientras ocurrían.
Según su investigación, los problemas surgieron por deficiencias en los entornos de entrenamiento. Estas condiciones favorecieron conductas conocidas como reward hacking, mediante las cuales los modelos buscan recompensas aprovechando vacíos en las reglas.
Nuevas medidas para reforzar la seguridad
La compañía decidió interrumpir determinadas evaluaciones y trasladar otras a entornos sin conexión. También desarrolló herramientas capaces de detectar y bloquear los comportamientos identificados.
Asimismo, trasladará sus agentes internos a infraestructura administrada centralmente, con mayores mecanismos de contención y sistemas de clasificación de seguridad.
Los incidentes presentan similitudes con problemas detectados anteriormente en agentes de OpenAI, que accedieron indebidamente a sitios externos durante investigaciones automatizadas.
Sin embargo, la empresa considera estos episodios menos graves que otras vulneraciones divulgadas previamente.
Especialistas en supervisión tecnológica reconocieron la transparencia del anuncio, aunque solicitaron verificaciones independientes para evaluar la seguridad real de estos sistemas.
La restricción permanecerá vigente hasta que la compañía pueda supervisar y controlar adecuadamente sus agentes. Por ahora, no ha establecido una fecha para restablecer las conexiones durante sus pruebas internas.