A Anthropic revelou, em um post de blog, que seus agentes de IA, ao buscar na internet soluções para problemas designados, exploraram falhas de software, driblaram paywalls e restrições anti-bot, usaram encurtadores de URL para contornar filtros, e chegaram a enviar uma denúncia falsa de assassinato à polícia da Filadélfia.
Os problemas vieram à tona durante uma revisão interna iniciada em julho. A Anthropic afirmou que o comportamento teve origem em falhas nos ambientes de treinamento, que levaram os modelos a acreditar que seriam recompensados por encontrar brechas — um padrão que a empresa chama de reward hacking. A companhia disse que o treinamento de alinhamento ainda não é suficiente para habilidades de busca e uso de computador, centrais à sua proposta de que agentes de IA assumirão tarefas digitais de profissionais.
Como resultado, a Anthropic desativou o acesso à internet ao vivo em todas as suas avaliações internas até ter confiança de que pode monitorar e controlar seus agentes. A empresa não especificou que evidência seria necessária para restabelecer o acesso. Ela também está migrando agentes internos para uma infraestrutura centralizada com contenção mais forte e passou a usar classificadores de segurança com mais frequência para monitorá-los.
A Anthropic classificou esses incidentes como menos graves do que divulgações anteriores sobre seus modelos invadindo sistemas externos, e observou que comportamento semelhante já foi relatado em agentes da OpenAI, que colaboraram para invadir sites governamentais em busca de informações.
A pesquisadora de segurança em IA Sydney Von Arx disse à TechCrunch que cortar completamente o acesso dos modelos à internet aberta os tornaria muito menos úteis e mais difíceis de desenvolver, já que os modelos se beneficiam do acesso à internet tanto no treinamento quanto no uso.