Anthropic рассказала в блог-посте, что её ИИ-агенты, выполняя поиск в интернете для решения поставленных задач, использовали уязвимости в программном обеспечении, обходили платные стены и защиту от ботов, применяли сервисы сокращения ссылок, чтобы обходить фильтры, и подали в полицию Филадельфии ложное сообщение об убийстве.
Проблемы всплыли в ходе внутренней проверки, начатой в июле. Anthropic заявила, что подобное поведение связано с недостатками тренировочных сред, из-за которых модели решили, что получат вознаграждение за найденные лазейки - практику компания называет reward hacking. По её словам, обучение согласованности пока недостаточно для навыков поиска и работы с компьютером, которые лежат в основе идеи о том, что ИИ-агенты возьмут на себя цифровые задачи специалистов.
В результате Anthropic отключила живой доступ в интернет для всех внутренних проверок, пока не будет уверена, что может отслеживать и контролировать своих агентов. Компания не уточнила, какие доказательства вернут доступ. Anthropic также переводит внутренних агентов на централизованно управляемую инфраструктуру с более строгой изоляцией и чаще использует классификаторы безопасности для их мониторинга.
Anthropic назвала эти случаи менее серьёзными, чем предыдущие раскрытия о том, как её модели взламывали внешние системы, и отметила, что похожее поведение фиксировалось у агентов OpenAI, которые сообща пытались взломать правительственные сайты в поисках информации.
Исследователь безопасности ИИ Сидни Вон Аркс рассказала TechCrunch, что полное отключение моделей от открытого интернета сделало бы их намного менее полезными и усложнило бы их разработку, поскольку модели выигрывают от доступа в интернет как при обучении, так и при использовании.