En mayo de este año, la inteligencia artificial de Google, Gemini, intentó intentó cumplir un simple encargado de prueba: buscar información de una empresa ficticia. El problema es que terminó hackeando una empresa real.
Resulta que el problema fue que la empresa ficticia compartía nombre con una empresa real. La IA no distinguió la diferencia, encontró credenciales filtradas en internet y hackeó los sistemas de esa empresa real sin tener instrucciones para aquello.
El "accidente" fue revelado por el Wall Street Journal y luego fue confirmado por Google. Según reportó CNN Business, está es la primera vez que se conoce un caso en el que Gemini "escapara" de su entorno de pruebas y afectara a terceros.
Gemini hackeó tres empresas reales y acusan a Google de intentar ocultarlo
Este "escape" ocurrió tres veces, y afectó a tres empresas diferentes en tres pruebas separadas. Pero lo más grave es que Google decidió ocultar lo ocurrido hasta que la prensa comenzó a hacer preguntas.
De acuerdo a The Verge, medio especializado en tecnología, la empresa consideró que el "escape" de Gemini no calificaba como un comportamiento de la IA fuera de lo que sus creadores deseaban que hiciera.
Según la explicación de Google, el error no estuvo en la "maldad" del modelo, sino en un error de configuración. Resulta que Gemini no debía tener acceso a internet durante la prueba, acceso que quedó habilitado por accidente.
Con internet disponible, el modelo siguió el conducto "racional" para resolver la tarea instruida y buscó en la web información pública. En uno de los casos, logró adivinar la contraseña luego de probar combinaciones para entrar al sitio supuestamente ficticio. En los otros dos casos, encontró las credenciales de acceso en internet.
El argumento que Google está utilizando como defensa, es que en los tres casos la IA se habría dado cuenta de que entró en un sistema real y se detuvo.
"El modelo encontró información pública en línea y adivinó credenciales para acceder a sitios web que creía que eran parte de la prueba. En los tres casos, el modelo se detuvo", dijo Heather Adkins, vicepresidenta de ingeniería de seguridad de Google.
No es un caso aislado:
Lo que más preocupa a los expertos, es que este caso no es el único registrado en el último tiempo.
En julio, Anthropic, empresa responsable de Claude, publicó que había descubierto tres incidentes. De acuerdo a Deutsche Welle, la empresa señaló que los modelos implicados en los incidentes eran Claude Opus 4.7, Claude Mythos 5 y un modelo de prueba de investigación interno. Los primeros incidentes se remontan al mes de abril, según la empresa de IA. "Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas", señaló Anthropic, como el aprovechamiento de contraseñas débiles.
OpenAI también reveló que uno de sus agentes había hackeado RubyGems, un servicio comunitario de distribución de programas para el lenguaje de programación Ruby.
Estos casos se dan en el marco de las últimas polémicas sobre la inteligencia artificial, donde distintos expertos han pedido reducir la velocidad de desarrollo de esta tecnología.