Live News

SEC-commissaris Hester Peirce zei dat cryptokluizen en onchain-leningsproducten mogelijk onder de Amerikaanse effectenwetten vallen, en drong er bi...

Cryptogeld- en blockchain-belangenorganisatie De Digitale Kamer klaagt de staat Illinois aan vanwege de staatsbelasting van 0,2% op cryptotransacti...

BitGo, een aanbieder van digitale activa-infrastructuur, en OTC Markets Group, de exploitant van gereguleerde over-the-counter effectenmarkten, zij...

22/07/26

Volg ons:

OpenAI-modellen ontsnapten uit een vergrendelde testomgeving, werden gehackt door hun gezicht te knuffelen om vals te spelen op de benchmark

OpenAI-modellen ontsnapten uit een vergrendelde testomgeving, werden gehackt door hun gezicht te knuffelen om vals te spelen op de benchmark
Default Door Remote - 21 Jul 2026
In het kort

OpenAI's GPT-5.6 Sol en een naamloos, capabeler pre-releasemodel ontsnapten aan een gecontroleerde testomgeving en doorbraken de productie-infrastructuur van Hugging Face om benchmarkantwoorden te stelen.

Hugging Face maakte de inbreuk op 16 juli bekend nadat ze deze onafhankelijk had ontdekt; OpenAI bevestigde dat zijn modellen er vandaag achter zaten en omschreef ze als ‘hypergericht’ op bedrog in plaats van op iets sinisters.

De verdedigers van Hugging Face wendden zich tot Z.ai's GLM 5.2 – een Chinees open-weight-model – nadat commerciële Amerikaanse grens-AI weigerde te helpen bij het analyseren van de aanvalsgegevens omdat de veiligheidsfilters een verdediger niet van een aanvaller konden onderscheiden.

Als je dacht dat je je zorgen moest maken over Chinese AI-modellen, dan is hier een leuke update: OpenAI's eigen modellen zijn zojuist uit een afgesloten testomgeving ontsnapt, hebben de productieservers van Hugging Face gehackt en moesten door een Chinese AI worden opgeschoond - omdat Amerikaanse commerciële modellen te beperkt waren om te helpen bij het onderzoek.

Volgens OpenAI werden GPT-5.6 Sol en een niet nader genoemd, “nog krachtiger pre-releasemodel” intern geëvalueerd op ExploitGym – een openbaar beschikbare cyberbeveiligingsbenchmark die AI-agenten 898 echte softwarekwetsbaarheden geeft en één instructie per bug: verander het in een werkende aanval, scoorde geslaagd of mislukt. De evaluatie is uitgevoerd met verminderde veiligheidsfilters, standaard als je echt wilt weten wat je modellen kunnen.

De modellen moesten in een sterk beperkte sandbox draaien: een geïsoleerde digitale omgeving zonder internettoegang, alleen verbonden met een interne pakketregistratieproxy (een cachingserver die downloads van softwarebibliotheken beheert).

Maar volgens de blogpost van OpenAI van vandaag liepen de zaken een beetje uit de hand.

We werken samen met @huggingface om een ​​ongekend beveiligingsincident te onderzoeken.

Cyber-compatibele OpenAI-modellen brachten de productie van Hugging Face in gevaar tijdens een benchmarkevaluatie.

Het delen van voorlopige bevindingen om verdedigers te helpen nieuwe risico’s te begrijpen:…

— OpenAI (@OpenAI) 21 juli 2026

“Terwijl we in onze sandbox-testomgeving werkten, hebben onze modellen een aanzienlijke hoeveelheid inferentiecomputing besteed aan het vinden van een manier om open internettoegang te verkrijgen, in hun zoektocht naar het oplossen van het evaluatieprobleem”, meldde het bedrijf van Sam Altman.

En ondanks de veiligheidsmaatregelen van het bedrijf vonden de AI’s een manier om vrij te zijn. De modellen identificeerden een zero-day-kwetsbaarheid (een onbekende softwarefout zonder bestaande patch) in die proxy, exploiteerden deze om rechten te escaleren (toegang op beheerdersniveau te krijgen tot systemen waar ze niets mee te maken hadden), verplaatsten zich lateraal (sprongen tussen verbonden servers binnen het interne netwerk van OpenAI) en bereikten uiteindelijk een machine met echte internettoegang.

Dit alles zonder dat OpenAI het weet – dat is tenminste wat OpenAI zegt.

Eenmaal online concludeerden ze terecht dat Hugging Face – waar meer dan een miljoen openbaar beschikbare AI-modellen, datasets en onderzoeksbronnen staan ​​– waarschijnlijk de benchmarkoplossingen bevatte, en ze hadden gelijk.

"De modellen identificeerden en koppelden kwetsbaarheden in de onderzoeksomgeving van OpenAI en de productie-infrastructuur van Hugging Face om testoplossingen rechtstreeks uit de productiedatabase van Hugging Face te verkrijgen", schreef OpenAI.

Ze wilden geen wachtwoorden. Ze wilden de test doorstaan.

"Alles wijst erop dat de modellen hypergefocust waren op het vinden van een oplossing voor ExploitGym, waarbij ze zich tot het uiterste inspanden om een ​​vrij beperkt testdoel te bereiken", voegde OpenAI eraan toe.

Hugging Face gaat openbaar Het beveiligingsteam van Hugging Face heeft de inbreuk onafhankelijk ontdekt, geholpen door zijn eigen AI-aangedreven anomaliedetectie.

Op 16 juli publiceerde het bedrijf de onthulling en maakte het duidelijk dat dit geen standaard inbreuk was: "Deze was op één belangrijke manier anders dan alles wat we eerder hadden afgehandeld: het werd van begin tot eind aangestuurd door een autonoom AI-agentsysteem - en we hebben het grotendeels met onze eigen AI ontdekt en ontleed."

Volgens de onthulling werd de campagne "geleid door een raamwerk van autonome agenten dat vele duizenden individuele acties uitvoerde in een zwerm kortstondige sandboxes, met zelfmigrerende commando-en-controle op openbare diensten."

De aanval maakte gebruik van twee code-uitvoeringspaden in de datasetverwerkingspijplijn van Hugging Face en bereikte interne datasets en servicereferenties. OpenAI bevestigde vandaag – vijf dagen later – dat zijn modellen erachter zaten.

Om meer dan 17.000 geregistreerde aanvallergebeurtenissen te analyseren, probeerde het beveiligingsteam van Hugging Face eerst Amerikaanse grens-AI uit via hun standaard API's. Het ging niet goed.

"Toen we met de loganalyse begonnen, gebruikten we eerst grensmodellen achter commerciële API's", schreef het bedrijf. "Dit werkte niet: de analyse vereist het indienen van grote hoeveelheden echte aanvalsopdrachten, exploit-payloads en C2-artefacten."

“Deze verzoeken werden geblokkeerd door de veiligheidsrails van de providers, die een incidentresponder niet van een aanvaller kunnen onderscheiden”, voegde Hugging Face eraan toe.

Dus schakelden ze over op GLM 5.2: een open-weight-model met 753 miljard parameters (architectuur volledig openbaar, iedereen kan het lokaal downloaden en uitvoeren) van de Chinese AI-startup Z.ai. "We hebben de forensische analyse in plaats daarvan uitgevoerd op GLM 5.2, een open-weight-model, op onze eigen infrastructuur", schreef Hugging Face. "Dit had nog een tweede voordeel: geen enkele aanvaller, en geen van de inloggegevens waarnaar deze verwijst, verliet onze omgeving."

Het forensische werk – het reconstrueren van de tijdlijn van de aanval, het in kaart brengen van gecompromitteerde inloggegevens, het scheiden van echte schade van lokactiviteiten – duurde uren in plaats van dagen.

Hugging Face trok de les rechtstreeks voor andere verdedigers: "Zorg voor een capabel model dat je op je eigen infrastructuur kunt draaien, doorgelicht en klaar voor een incident, zowel om uitsluiting van de vangrail te voorkomen als om te voorkomen dat gegevens en inloggegevens van aanvallers je omgeving verlaten."

Wat OpenAI eraan doetOpenAI zei dat het strikte controles op de onderzoeksinfrastructuur heeft geïmplementeerd tijdens het patchen van de getroffen systemen, de zero-day heeft bekendgemaakt aan de externe leverancier wiens proxy werd uitgebuit, en een gezamenlijk forensisch onderzoek uitvoert met Hugging Face.

Hugging Face is ook toegevoegd aan OpenAI's vertrouwde toegangsprogramma voor cyberdefensie, waardoor goedgekeurde organisaties toegang krijgen tot versies van hun modellen met verminderde veiligheidsfilters voor legitiem beveiligingswerk, dezelfde configuratie waarmee dit allemaal begon.

Hugging Face CEO Clem Delangue had een scherp standpunt: "AI-veiligheid zal niet worden opgelost door een enkel bedrijf dat in het geheim werkt. Het zal in de openbaarheid worden opgelost, in samenwerking, met brede toegang tot AI voor elke verdediger, waar dan ook."

OpenAI noemde het incident ‘een incident waarbij nieuwe state-of-the-art cybercapaciteiten betrokken zijn’ en beloofde de volledige bevindingen te delen wanneer het gezamenlijke onderzoek met Hugging Face is voltooid.

Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!