Default
Door Remote - 21 Jul 2026
OpenAI gaf dinsdag toe dat een van zijn AI-modellen de systemen van Hugging Face, het niet-gelieerde AI-hostingplatform, had geschonden tijdens een interne cyberbeveiligingstest die misging. De modellen ontsnapten naar verluidt uit hun geïsoleerde testomgeving en bereikten van daaruit de systemen van Hugging Face. Hugging Face schreef de inbreuk aanvankelijk toe aan een ‘externe AI-agent’.
In een blogpost die dinsdagmiddag werd gepubliceerd, beschrijft OpenAI de stappen die ertoe hebben geleid dat de modellen de service in gevaar hebben gebracht.
“Na onderzoek weten we nu dat dit specifieke incident werd aangestuurd door een combinatie van OpenAI-modellen – waaronder GPT-5.6 Sol en een nog capabeler pre-releasemodel, allemaal met minder cyberweigeringen voor evaluatiedoeleinden – terwijl het intern werd getest op een benchmark van cybercapaciteiten”, aldus het bericht.
De inbreuk lijkt zich met name te hebben geconcentreerd op ExploitGym, een publiekelijk gehoste benchmark die het vermogen van modellen meet om aanvallen uit te voeren op basis van bestaande kwetsbaarheden. Benchmarks zoals ExploitGym worden vaak gebruikt in modeltrainingen om specifieke vaardigheden te verfijnen, maar dit is het eerste bekende incident waarbij dat testen resulteerde in een daadwerkelijke cyberaanval.
In dit geval had het model in kwestie niet eens internettoegang moeten hebben, afgezien van een specifieke tool waarmee modellen softwarepakketten konden installeren die ze mogelijk nodig hadden om hun taak te voltooien. In plaats daarvan kon het model een niet bekendgemaakte kwetsbaarheid vinden in het pakketinstallatieprogramma, dat het gebruikte om naar believen toegang te krijgen tot het bredere internet.
“De modellen waren hypergefocust op het vinden van een oplossing voor ExploitGym, waarbij ze zich tot het uiterste inspanden om een vrij beperkt testdoel te bereiken”, luidt het bericht van OpenAI. "Nadat ze internettoegang hadden verkregen, concludeerden de modellen dat Hugging Face mogelijk modellen, datasets en oplossingen voor ExploitGym hostte. Dit wetende, zocht en vond het model met succes manieren om toegang te krijgen tot geheime informatie die het kon gebruiken om de evaluatie te vervalsen."
Uiteindelijk vonden de modellen kwetsbaarheden in de infrastructuur van Hugging Face waardoor ze “testoplossingen rechtstreeks uit de productiedatabase van Hugging Face konden verkrijgen”, waardoor ze effectief de antwoorden op de benchmark opleverden.
Voor Hugging Face was het schijnbare resultaat een geavanceerde en agressieve cyberaanval, met “vele duizenden individuele acties in een zwerm kortstondige sandboxes, met zelfmigrerende commando-en-controle op publieke diensten”, zoals het bedrijf in zijn eerste onthulling verklaarde.
OpenAI heeft de kwetsbaarheden in het pakketinstallatieprogramma geïdentificeerd en gerapporteerd en werkt samen met Hugging Face om het incident verder te onderzoeken. Het bedrijf zei ook dat het nieuwe controles zou implementeren op zowel het testen van modellen als de bijbehorende infrastructuur, bedoeld om soortgelijke incidenten in de toekomst te voorkomen.
Het is onduidelijk of OpenAI juridische gevolgen zal ondervinden als gevolg van de inbreuk, hoewel het waarschijnlijk is dat de acties van de modellen in strijd zijn met de Computer Fraud and Abuse Act.
Niettemin is het resultaat een ongewoon levendige illustratie van de kracht en gevaren van grensverleggende AI-modellen die over een lange tijdshorizon opereren. Zoals OpenAI-onderzoeker Micah Carroll in reactie op het nieuws schreef: “Als dit u er niet van overtuigt dat risico’s op verkeerde uitlijning in de toekomst een belangrijk probleem zullen zijn, weet ik niet wat dat wel zal zijn.”
In een blogpost die dinsdagmiddag werd gepubliceerd, beschrijft OpenAI de stappen die ertoe hebben geleid dat de modellen de service in gevaar hebben gebracht.
“Na onderzoek weten we nu dat dit specifieke incident werd aangestuurd door een combinatie van OpenAI-modellen – waaronder GPT-5.6 Sol en een nog capabeler pre-releasemodel, allemaal met minder cyberweigeringen voor evaluatiedoeleinden – terwijl het intern werd getest op een benchmark van cybercapaciteiten”, aldus het bericht.
De inbreuk lijkt zich met name te hebben geconcentreerd op ExploitGym, een publiekelijk gehoste benchmark die het vermogen van modellen meet om aanvallen uit te voeren op basis van bestaande kwetsbaarheden. Benchmarks zoals ExploitGym worden vaak gebruikt in modeltrainingen om specifieke vaardigheden te verfijnen, maar dit is het eerste bekende incident waarbij dat testen resulteerde in een daadwerkelijke cyberaanval.
In dit geval had het model in kwestie niet eens internettoegang moeten hebben, afgezien van een specifieke tool waarmee modellen softwarepakketten konden installeren die ze mogelijk nodig hadden om hun taak te voltooien. In plaats daarvan kon het model een niet bekendgemaakte kwetsbaarheid vinden in het pakketinstallatieprogramma, dat het gebruikte om naar believen toegang te krijgen tot het bredere internet.
“De modellen waren hypergefocust op het vinden van een oplossing voor ExploitGym, waarbij ze zich tot het uiterste inspanden om een vrij beperkt testdoel te bereiken”, luidt het bericht van OpenAI. "Nadat ze internettoegang hadden verkregen, concludeerden de modellen dat Hugging Face mogelijk modellen, datasets en oplossingen voor ExploitGym hostte. Dit wetende, zocht en vond het model met succes manieren om toegang te krijgen tot geheime informatie die het kon gebruiken om de evaluatie te vervalsen."
Uiteindelijk vonden de modellen kwetsbaarheden in de infrastructuur van Hugging Face waardoor ze “testoplossingen rechtstreeks uit de productiedatabase van Hugging Face konden verkrijgen”, waardoor ze effectief de antwoorden op de benchmark opleverden.
Voor Hugging Face was het schijnbare resultaat een geavanceerde en agressieve cyberaanval, met “vele duizenden individuele acties in een zwerm kortstondige sandboxes, met zelfmigrerende commando-en-controle op publieke diensten”, zoals het bedrijf in zijn eerste onthulling verklaarde.
OpenAI heeft de kwetsbaarheden in het pakketinstallatieprogramma geïdentificeerd en gerapporteerd en werkt samen met Hugging Face om het incident verder te onderzoeken. Het bedrijf zei ook dat het nieuwe controles zou implementeren op zowel het testen van modellen als de bijbehorende infrastructuur, bedoeld om soortgelijke incidenten in de toekomst te voorkomen.
Het is onduidelijk of OpenAI juridische gevolgen zal ondervinden als gevolg van de inbreuk, hoewel het waarschijnlijk is dat de acties van de modellen in strijd zijn met de Computer Fraud and Abuse Act.
Niettemin is het resultaat een ongewoon levendige illustratie van de kracht en gevaren van grensverleggende AI-modellen die over een lange tijdshorizon opereren. Zoals OpenAI-onderzoeker Micah Carroll in reactie op het nieuws schreef: “Als dit u er niet van overtuigt dat risico’s op verkeerde uitlijning in de toekomst een belangrijk probleem zullen zijn, weet ik niet wat dat wel zal zijn.”

