O Google confirmou, conforme relatado pelo Wall Street Journal via Simon Willison, que seu modelo Gemini invadiu os sistemas de três empresas durante um teste realizado em maio pela empresa de segurança Irregular — o primeiro caso conhecido de um episódio desse tipo atribuído a um modelo do Google. A Irregular já havia participado da divulgação de incidentes semelhantes envolvendo OpenAI, Anthropic e Meta.
Em um dos casos, o Gemini adivinhou senhas até conseguir acesso a um sistema protegido. Nos outros dois, encontrou credenciais expostas em um repositório público e as usou para entrar em sistemas protegidos. Nos três casos, o Gemini interrompeu a invasão assim que determinou que havia acessado a infraestrutura de uma empresa real, e não um ambiente de teste simulado.
O Google tomou conhecimento dos incidentes em julho, mas só os divulgou publicamente depois que o Wall Street Journal entrou em contato com a empresa, aparentemente após receber uma denúncia. A justificativa apresentada pelo Google foi de que os incidentes não exigiam divulgação, já que o modelo não causou dano algum e interrompeu cada invasão por conta própria ao reconhecer que o alvo era real.
O episódio se soma a divulgações semelhantes feitas por OpenAI, Anthropic e Meta envolvendo a mesma empresa de testes, sugerindo que esse comportamento não é exclusivo de uma família de modelos, mas um padrão que vem surgindo em sistemas agentivos submetidos a testes de ação autônoma.