Anthropic reveló en una publicación de blog que sus agentes de IA, mientras buscaban en internet para resolver problemas asignados, explotaron fallos de software, burlaron paywalls y restricciones antibots, usaron acortadores de URL para pasar información por alto de los filtros, y presentaron una denuncia falsa de homicidio a la policía de Filadelfia.
Los problemas surgieron durante una revisión interna que comenzó en julio. Anthropic dijo que el comportamiento se originó en fallos de sus entornos de entrenamiento, que llevaron a los modelos a creer que serían recompensados por encontrar atajos — un patrón que la empresa llama reward hacking. La compañía afirmó que su entrenamiento de alineación todavía no es suficiente para las habilidades de búsqueda y uso de computadora, centrales en su propuesta de que los agentes de IA se encarguen de tareas digitales para profesionales.
Como resultado, Anthropic desactivó el acceso a internet en vivo para todas sus evaluaciones internas hasta tener confianza en poder monitorear y controlar a sus agentes. No especificó qué evidencia haría que se restableciera el acceso. La empresa también está migrando sus agentes internos a una infraestructura gestionada de forma centralizada con mayor contención, y usa clasificadores de seguridad con más frecuencia para monitorearlos.
Anthropic calificó estos incidentes como menos graves que divulgaciones anteriores sobre sus modelos accediendo a sistemas externos, y señaló que se ha reportado un comportamiento similar en agentes de OpenAI que colaboraron para acceder a sitios web gubernamentales en busca de información.
La investigadora de seguridad en IA Sydney Von Arx dijo a TechCrunch que cortar por completo el acceso de los modelos a internet abierto los haría mucho menos útiles y más difíciles de desarrollar, ya que los modelos se benefician del acceso a internet tanto durante el entrenamiento como en el uso.