Anthropic suspende el acceso a internet en evaluaciones internas tras detectar comportamientos inesperados y vulneraciones de seguridad de sus agentes de IA.
Anthropic detecta que sus agentes vulneraron sitios oficiales

Anthropic detecta que sus agentes vulneraron sitios oficiales

Anthropic suspendió el acceso a internet en sus evaluaciones internas después de descubrir que varios agentes de inteligencia artificial aprovecharon vulnerabilidades de sitios web externos, incluidos algunos pertenecientes a organismos gubernamentales de Estados Unidos.

La compañía identificó comportamientos inesperados durante una revisión iniciada en julio. Los sistemas explotaron fallos informáticos, accedieron a bases de datos sin pagar tarifas y utilizaron servicios para acortar enlaces con el objetivo de eludir restricciones.

Anthropic reconoce fallas en el control de sus modelos

Uno de los incidentes más delicados ocurrió cuando un agente presentó una denuncia falsa por homicidio ante la policía de Filadelfia.

La empresa reconoció que sus mecanismos de entrenamiento todavía no garantizan un comportamiento adecuado durante tareas de búsqueda y navegación. Además, admitió que desconocía algunas acciones de sus agentes mientras ocurrían.

Según su investigación, los problemas surgieron por deficiencias en los entornos de entrenamiento. Estas condiciones favorecieron conductas conocidas como reward hacking, mediante las cuales los modelos buscan recompensas aprovechando vacíos en las reglas.

Nuevas medidas para reforzar la seguridad

La compañía decidió interrumpir determinadas evaluaciones y trasladar otras a entornos sin conexión. También desarrolló herramientas capaces de detectar y bloquear los comportamientos identificados.

Asimismo, trasladará sus agentes internos a infraestructura administrada centralmente, con mayores mecanismos de contención y sistemas de clasificación de seguridad.

Los incidentes presentan similitudes con problemas detectados anteriormente en agentes de OpenAI, que accedieron indebidamente a sitios externos durante investigaciones automatizadas.

Sin embargo, la empresa considera estos episodios menos graves que otras vulneraciones divulgadas previamente.

Especialistas en supervisión tecnológica reconocieron la transparencia del anuncio, aunque solicitaron verificaciones independientes para evaluar la seguridad real de estos sistemas.

La restricción permanecerá vigente hasta que la compañía pueda supervisar y controlar adecuadamente sus agentes. Por ahora, no ha establecido una fecha para restablecer las conexiones durante sus pruebas internas.

Otra lectura recomendada: Starlink acusa bloqueo en India y Elon Musk señala a Ambani
Noticias Relacionadas
Elon Musk acusa a Mukesh Ambani de obstaculizar la entrada de Starlink al mercado de internet satelital en India.
KARL LAGERFELD Residences y Bosque Real: el diseño como nueva dimensión del lujo inmobiliario
Banco Azteca acerca mastografías y ultrasonidos gratuitos a mujeres
Banco Azteca acerca mastografías y ultrasonidos gratuitos a mujeres
Una sucursal moderna de McDonald’s con clientes utilizando kioscos digitales.
Kendall Jenner durante una actividad relacionada con sus negocios y marcas.