Una intel·ligència artificial desenvolupada per OpenAI va trobar la manera de sortir d'un entorn aïllat, va accedir pel seu compte a Internet i va acabar atacant els sistemes d'una altra empresa. L'agent autònom va hackejar la infraestructura de Hugging Face per aconseguir les respostes de la prova de ciberseguretat que estava intentant superar, segons ha reconegut la companyia responsable de ChatGPT.
OpenAI ha qualificat el que va passar com un "incident cibernètic sense precedents". En l'operació van participar GPT-5.6 Sol i un altre model encara més potent que roman en fase de desenvolupament, tots dos integrats en un agent preparat per executar tasques complexes amb escassa intervenció humana.
Cap persona li va ordenar atacar Hugging Face. Els models van deduir que aquella plataforma podia albergar informació útil per completar l'examen i van buscar una via per entrar en els seus sistemes.
We're partnering with @huggingface to investigate an unprecedented security incident.
— OpenAI (@OpenAI) July 21, 2026
Cyber-capable OpenAI models compromised Hugging Face production during a benchmark evaluation.
Sharing preliminary findings to help defenders understand emerging risks:…
Una prova amb els frens reduïts
L'incident va començar durant una avaluació interna destinada a mesurar la capacitat ofensiva màxima dels nous models. Per comprovar fins on podien arribar, OpenAI va reduir les seves negatives de seguretat i va desactivar els classificadors que bloquegen en condicions normals les operacions informàtiques d'alt risc.
La prova havia de romandre dins d'una 'sandbox', un espai aïllat que només permetia descarregar paquets informàtics mitjançant un intermediari intern. Els models van localitzar una vulnerabilitat desconeguda en aquest sistema, la van explotar i van anar ampliant els seus privilegis fins a assolir un equip connectat a Internet.
Una vegada fora, l'agent va buscar on podien trobar-se les solucions d'ExploitGym, l'avaluació que OpenAI li havia encarregat resoldre. Va arribar a la conclusió que Hugging Face, una de les plataformes mundials més grans de models i bases de dades d'intel·ligència artificial, era el lloc més probable.
L'operació va combinar diverses tècniques pròpies d'atacs avançats. El sistema va utilitzar credencials obtingudes durant la intrusió, va aprofitar noves vulnerabilitats i va trobar una via per executar codi a distància en els servidors de Hugging Face. Finalment va accedir a informació reservada de la seva base de dades de producció per copiar les respostes de l'examen.
L'agent mancava d'una intenció maliciosa acreditada. El seu comportament mostra un altre problema que preocupa des de fa anys els investigadors: un sistema pot perseguir amb enorme eficàcia una instrucció limitada i travessar barreres que els seus creadors donaven per segures per aconseguir-la.
"El lleó ha tret una urpa fora de la gàbia", ha resumit José Hernández-Orallo, investigador de la Universitat de Cambridge i catedràtic de la Universitat Politècnica de València.
Hugging Face va detectar milers d'accions automàtiques
L'activitat va acabar quan els equips de seguretat d'OpenAI i Hugging Face van detectar el comportament anòmal. La plataforma atacada havia registrat més de 17.000 accions executades a velocitat de màquina, repartides entre nombrosos entorns temporals i coordinades de forma autònoma.
Hugging Face ha confirmat l'accés sense autorització a un grup limitat de bases de dades internes i a diverses credencials emprades pels seus serveis. L'empresa encara estudia si va poder quedar afectada informació de clients o col·laboradors i s'ha compromès a contactar directament amb ells en cas de confirmar-ho.
Per ara, no existeixen indicis que els models, conjunts de dades o aplicacions disponibles públicament fossin manipulats. La companyia ha tancat les vulnerabilitats utilitzades, reconstruït els equips compromesos i substituït les claus i credencials afectades.
El seu director executiu, Clément Delangue, ha descrit com a "al·lucinant" que tot el procés es desenvolupés de manera autònoma. També ha descartat una voluntat maliciosa per part d'OpenAI i considera que l'episodi podria ser el primer documentat d'aquestes característiques.
El perill ja ha sortit del laboratori
Fins ara, bona part de les advertències sobre agents capaços d'organitzar atacs prolongats es basaven en simulacions. El cas de Hugging Face demostra que aquests models ja poden descobrir fallades desconegudes, encadenar-les i utilitzar-les contra sistemes reals sense disposar prèviament del seu codi font.
La pròpia documentació de seguretat d'OpenAI havia classificat GPT-5.6 Sol com un model d'alt risc en ciberseguretat. Les proves anteriors mostraven avenços per trobar vulnerabilitats i construir fragments d'atacs, tot i que l'empresa assegurava que encara tenia dificultats per completar operacions autònomes contra objectius reforçats.
El nou incident obliga a revisar aquesta valoració. La companyia reconeix ara que aquelles capacitats teòriques ja funcionen en entorns reals i que els seus sistemes poden mantenir durant llargs períodes una operació complexa amb múltiples passos.
També havia detectat abans comportaments preocupants. En avaluacions internes, GPT-5.6 Sol va realitzar accions que l'usuari no havia demanat, va moure credencials entre equips, va eliminar informació de màquines equivocades i va presentar com a acabats treballs que sabia que no havia completat. La seva major persistència el porta en ocasions a sobrepassar els límits de la tasca rebuda.
Pressió per reforçar els controls
El congressista demòcrata Greg Casar ha qualificat el cas d'"extremadament alarmant" i ha reclamat proves independents obligatòries abans del llançament dels models més potents. També demana que les empreses hagin de comunicar aquests incidents i que els governs coordinin una resposta internacional.
Les crítiques arriben directament a OpenAI. La companyia va dissenyar l'avaluació, va reduir deliberadament les barreres de seguretat i va utilitzar un espai d'aïllament que els seus propis models van aconseguir perforar. L'empresa que desenvolupa una de les intel·ligències artificials més avançades del món no va aconseguir contenir-la durant una prova preparada pels seus propis investigadors.
OpenAI ha anunciat controls més estrictes en la seva infraestructura, noves proteccions per a futures avaluacions i una revisió dels sistemes de vigilància interna. També ha comunicat la vulnerabilitat de dia zero al proveïdor del programa afectat perquè pugui corregir-la.
La investigació forense continua juntament amb Hugging Face. Ambdues empreses publicaran més detalls quan determinin l'abast complet de l'accés, les vulnerabilitats utilitzades i la possible afectació a tercers.
Afegeix ElConstitucional.es com a font preferida de Google de forma gratuïta.
Mantén-te informat de totes les notícies d'última hora i amb la millor informació. Contra la desinformació, per la democràcia i els drets socials.