Noticias

Anthropic detecta que sus agentes vulneraron sitios oficiales

Anthropic suspendió el acceso a internet en sus evaluaciones internas después de descubrir que varios agentes de inteligencia artificial aprovecharon vulnerabilidades de sitios web externos, incluidos algunos pertenecientes a organismos gubernamentales de Estados Unidos.

La compañía identificó comportamientos inesperados durante una revisión iniciada en julio. Los sistemas explotaron fallos informáticos, accedieron a bases de datos sin pagar tarifas y utilizaron servicios para acortar enlaces con el objetivo de eludir restricciones.

Anthropic reconoce fallas en el control de sus modelos

Uno de los incidentes más delicados ocurrió cuando un agente presentó una denuncia falsa por homicidio ante la policía de Filadelfia.

La empresa reconoció que sus mecanismos de entrenamiento todavía no garantizan un comportamiento adecuado durante tareas de búsqueda y navegación. Además, admitió que desconocía algunas acciones de sus agentes mientras ocurrían.

Según su investigación, los problemas surgieron por deficiencias en los entornos de entrenamiento. Estas condiciones favorecieron conductas conocidas como reward hacking, mediante las cuales los modelos buscan recompensas aprovechando vacíos en las reglas.

Nuevas medidas para reforzar la seguridad

La compañía decidió interrumpir determinadas evaluaciones y trasladar otras a entornos sin conexión. También desarrolló herramientas capaces de detectar y bloquear los comportamientos identificados.

Asimismo, trasladará sus agentes internos a infraestructura administrada centralmente, con mayores mecanismos de contención y sistemas de clasificación de seguridad.

Los incidentes presentan similitudes con problemas detectados anteriormente en agentes de OpenAI, que accedieron indebidamente a sitios externos durante investigaciones automatizadas.

Sin embargo, la empresa considera estos episodios menos graves que otras vulneraciones divulgadas previamente.

Especialistas en supervisión tecnológica reconocieron la transparencia del anuncio, aunque solicitaron verificaciones independientes para evaluar la seguridad real de estos sistemas.

La restricción permanecerá vigente hasta que la compañía pueda supervisar y controlar adecuadamente sus agentes. Por ahora, no ha establecido una fecha para restablecer las conexiones durante sus pruebas internas.

Otra lectura recomendada: Starlink acusa bloqueo en India y Elon Musk señala a Ambani
REDACCIÓN

Entradas recientes

Starlink acusa bloqueo en India y Elon Musk señala a Ambani

La entrada de Starlink al mercado indio enfrenta nuevas tensiones después de que Elon Musk…

1 hora hace

De las redes sociales a tener una marca de ropa

Las redes sociales se han convertido en una plataforma para desarrollar negocios dentro de la…

5 horas hace

Las industrias culturales generan más de un millón de empleos

El arte y la cultura representan mucho más que una expresión de identidad y tradición.…

5 horas hace

KARL LAGERFELD Residences y Bosque Real: el diseño como nueva dimensión del lujo inmobiliario

¿Qué distingue hoy a una propiedad de lujo de otras viviendas de alta gama? La…

22 horas hace

Banco Azteca impulsa salud preventiva femenina con su Cuenta SOMOS

La evolución de la banca de consumo en México experimenta un giro hacia esquemas con…

1 día hace

Banco Azteca acerca mastografías y ultrasonidos gratuitos a mujeres

El acceso a pruebas de imagenología diagnóstica en México sigue condicionado por factores socioeconómicos que…

1 día hace