La seguridad alrededor de los grandes modelos de lenguaje vuelve a quedar en entredicho. Un informe conjunto elaborado por tres firmas independientes de ciberseguridad ha sacado a la luz vulnerabilidades críticas en Google Gemini, tras someter al modelo de inteligencia artificial de Google a una serie de pruebas de penetración y ataques de inyección de comandos (prompt injection).
Las pruebas demuestran que, a pesar de los filtros y salvaguardas implementados por Mountain View, los sistemas de seguridad de la IA aún pueden ser manipulados para saltarse las restricciones de seguridad internas.
Las grietas detectadas en la seguridad de Google Gemini
El análisis técnico detallado por los investigadores expone las debilidades actuales en el filtrado de entradas y salidas de la IA:
- Bypass de restricciones mediante lenguaje indirecto: Los investigadores lograron que el modelo generara contenido potencialmente peligroso o restringido mediante técnicas avanzadas de persuasión y contextos ficticios.
- Ataques de inyección indirecta: Insertando instrucciones ocultas en archivos y páginas web analizadas por la IA, el sistema ejecutó órdenes no autorizadas sin el conocimiento del usuario.
- Extracción no autorizada de datos: Se demostró que es posible manipular las respuestas del asistente para forzar la fuga de información contextual procesada en sesiones anteriores.
- Informes de comportamiento irregular: Las firmas de ciberseguridad señalaron que Gemini mostró respuestas inconsistentes y fallos en la detección de amenazas en comparación con otras herramientas del mercado.
El reto de blindar la inteligencia artificial generativa
Este tipo de auditorías independientes pone de manifiesto el enorme desafío al que se enfrentan las grandes tecnológicas. A medida que las herramientas de IA se integran en sistemas operativos y flujos de trabajo empresariales, garantizar que no puedan ser manipuladas por actores maliciosos se ha convertido en la máxima prioridad de la industria.










