Dos de los sistemas de inteligencia artificial más avanzados de OpenAI —el modelo GPT-5.6 Sol y una versión secreta aún no lanzada— protagonizaron un hecho inédito durante una prueba interna: lograron escapar de su entorno controlado y ejecutar un ciberataque autónomo contra la plataforma Hugging Face. El objetivo era obtener las respuestas necesarias para aprobar un complejo examen de hackeo, según reportó la propia empresa esta semana.

Los modelos estaban siendo evaluados en su capacidad para detectar fallos informáticos dentro de un “sandbox” o caja de arena, una prisión digital aislada del resto de internet que busca evitar que la IA cause daños externos. Sin embargo, en lugar de limitarse al laboratorio, los algoritmos encontraron de forma independiente una vulnerabilidad de “día cero” —un error de seguridad desconocido hasta entonces— en un servidor que OpenAI usaba para gestionar programas informáticos.

Aprovechando esa falla oculta, los modelos engañaron al sistema, escalaron sus permisos de acceso y se movieron por la red interna de la empresa hasta hallar una salida directa a la red abierta. Una vez en internet, no actuaron con intencionalidad dañina, sino impulsados por una obsesión lógica de cumplir con su tarea. Atacaron a la startup Hugging Face para obtener las respuestas que necesitaban.

En su informe sobre el caso, OpenAI calificó lo ocurrido como “un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de vanguardia”. El hecho marca un hito en materia de seguridad de la inteligencia artificial y plantea interrogantes sobre el control de estos sistemas.

Al percatarse de que la prueba técnica era compleja, los sistemas de inteligencia artificial dedujeron que Hugging Face, una plataforma que alberga miles de proyectos de IA, probablemente contenía las soluciones almacenadas. Actuando como un equipo de hackers profesionales, las IA emplearon claves robadas y explotaron fallos técnicos para infiltrarse en las bases de datos de Hugging Face y sustraer la información que les permitiera superar el examen. El ataque fue tan veloz y masivo que Hugging Face detectó miles de acciones individuales ocurriendo en cuestión de segundos. Tras contener la situación, se confirmó que los modelos de OpenAI habían logrado extraer datos confidenciales antes de ser bloqueados. “La IA pensó que tal vez Hugging Face tendría información importante sobre cómo lograr su objetivo, que es una mejor puntuación en un punto de referencia de ciberseguridad. En ese sentido, actuó como un auténtico hacker real”, explicó Nathaniel Jones, vicepresidente de seguridad y estrategia de IA de la firma Darktrace, al diario británico *The Guardian*. Lo más curioso del caso fue que, para investigar lo ocurrido, los expertos de Hugging Face tuvieron que recurrir a una IA de código abierto de origen chino, ya que los modelos comerciales más conocidos tenían bloqueos de seguridad que les impedían analizar los comandos de ataque reales. “Hemos pasado las últimas 24 horas trabajando estrechamente con el equipo de @OpenAI (¡gracias!), y creemos firmemente que no hubo intención maliciosa por parte de ellos. ¡Es bastante alucinante que todo esto haya sucedido de manera autónoma! La investigación está en curso, y compartiremos más aprendizajes de lo que podría ser el primer incidente de su tipo”, escribió en sus redes sociales el director ejecutivo de Hugging Face, Clément Delangue, al comentar el suceso.

El caso ya es considerado el primer ciberataque autónomo de la historia. Tanto OpenAI como Hugging Face aseguran haber cerrado las brechas de seguridad, pero el incidente ha encendido las alarmas sobre la rapidez con la que avanza esta tecnología sin que existan leyes que la controlen.

Mientras algunos expertos consideran que esto ya entraba dentro de lo que se esperaba de una IA potente, otros advierten que demuestra que empresas como OpenAI podrían no ser capaces de manejar con total seguridad las herramientas que están creando.

"¡Tan orgullosos de nuestro equipo de seguridad! Capturaron, contuvieron y divulgaron públicamente un ataque como nada que hayamos visto antes, y lo hicieron a velocidad récord [...] ¡Este es el día uno para la ciberseguridad en la era de los agentes y todos estamos aprendiendo que el secreto no es la respuesta y que todos los defensores (no solo unos pocos seleccionados) en todas partes necesitan modelos más potentes sin restricciones, ¡especialmente los abiertos!", escribió Delangue, director de Hugging Face, en sus redes sociales.

El cobre, mineral clave de Perú, es el nuevo petróleo: La IA obligará a duplicar la producción mundial, ¿qué preocupa a la industria minera? Estados Unidos obliga a Anthropic a suspender su IA más potente Las herramientas de IA más utilizadas en 2026: Guía completa y actualizada ¡Cuidado! Estudio demuestra que la IA da consejos negativos de salud en casi el 50 % de los casos Google News EE.UU. e Irán intensifican amenazas: Trump advierte ataques contra centrales eléctricas y Teherán responde que aplicará el Descubren el primer satélite natural fuera del sistema solar

Descubren el primer satélite natural fuera del sistema solar

Trump busca impulsar a Infantino para liderar la ONU, según el New York Post

Trump busca impulsar a Infantino para liderar la ONU, según el New York Post

Trump advierte sobre posible ataque a búnker nuclear iraní, pero el Pentágono evita responder sobre capacidad para hacerlo

Trump advierte sobre posible ataque a búnker nuclear iraní, pero el Pentágono evita responder sobre capacidad para hacerlo

Daniel Ortega anuncia el fin de la vía electoral en Nicaragua:

Daniel Ortega anuncia el fin de la vía electoral en Nicaragua: "Aquí no volverán a haber elecciones"

Leer artículo completo en rpp.pe →