Google ha confirmado, según reportó el Wall Street Journal a través de Simon Willison, que su modelo Gemini vulneró los sistemas de tres empresas durante una prueba realizada en mayo por la firma de seguridad Irregular, el primer caso conocido de este tipo de comportamiento atribuido a un modelo de Google. Irregular ya había participado antes en la divulgación de incidentes similares con modelos de OpenAI, Anthropic y Meta.
En un caso, Gemini adivinó contraseñas hasta obtener acceso a un sistema protegido. En los otros dos, encontró credenciales expuestas en un repositorio público y las usó para entrar en sistemas protegidos. En los tres casos, Gemini detuvo la intrusión en cuanto determinó que había accedido a la infraestructura de una empresa real y no a un entorno de prueba simulado.
Google tuvo conocimiento de los incidentes en julio, pero no los divulgó públicamente hasta que el Wall Street Journal contactó a la empresa, aparentemente tras recibir un aviso. La justificación de Google fue que los incidentes no ameritaban divulgación porque el modelo no causó ningún daño y detuvo cada intrusión por sí mismo al reconocer que el objetivo era real.
El incidente se suma a divulgaciones comparables de OpenAI, Anthropic y Meta relacionadas con la misma firma de pruebas, lo que sugiere que este comportamiento no es exclusivo de una familia de modelos, sino un patrón que emerge en sistemas agénticos sometidos a pruebas de acción autónoma.