Live News

Crypto handelt voorzichtig...

Uit de cijfers van SK Hynix bleek dat de kwartaalwinst van het bedrijf meer dan verzesvoudigde, en dat de aandelen met bijna een vijfde daalden omd...

De VS verbieden mensachtigen en andere geavanceerde robots die buiten de Verenigde Staten zijn gemaakt, zo kondigde de FCC aan, en zei dat “geavanc...

29/07/26

Volg ons:

De Hugging Face-inbreuk van OpenAI heeft het debat over afstemming en controle nieuw leven ingeblazen

De Hugging Face-inbreuk van OpenAI heeft het debat over afstemming en controle nieuw leven ingeblazen
Default Door Remote - 27 Jul 2026
Vorige week heeft een nog niet uitgebracht model, gebouwd door OpenAI, tijdens interne tests inbreuk gemaakt op de systemen van Hugging Face, en veel theoretisch onderzoek werd plotseling heel praktisch. De hack was het eerste verifieerbare geval waarin een AI-lab de controle over zijn eigen model verloor en exploits aan elkaar koppelde om toegang te krijgen die het nooit had mogen hebben. Maar hoewel de AI-industrie verenigd is in haar ongerustheid, is er een verdeeldheid ontstaan ​​in de manier waarop onderzoekers willen reageren.

Voor sommigen is het probleem een ​​fundamenteel cyberbeveiligingsprobleem: de sandbox slaagde er niet in het model te bevatten, en de cyberbeveiligingssystemen van Hugging Face slaagden er niet in het buiten te houden. Deze problemen kunnen worden opgelost door bugs te patchen en robuustere controle- en inperkingsmethoden te bouwen voor steeds capabeler wordende AI die de neiging heeft om in autonome omgevingen schurkenstaten te worden. 

Maar een ander kamp heeft een meer pessimistische kijk. Voor hen betekenen de snel toenemende mogelijkheden van AI dat het controleren van malafide modellen een verloren zaak is. De enige robuuste beveiliging komt voort uit het ervoor zorgen dat de modellen überhaupt niet proberen te ontsnappen – een uitdaging die vaak afstemming wordt genoemd. In termen van afstemming is het probleem dat het OpenAI-model probeerde vals te spelen, en het oplossen van dat probleem is urgenter dan pogingen tot inperking op de korte termijn.

Afgaande op zijn publieke verklaringen neemt OpenAI beide kampen serieus. Het bedrijf heeft haast gemaakt met het repareren van de bugs die bij de hack betrokken waren, en verwees in zijn verklaring naar zowel afstemming als monitoringbenaderingen nadat de inbreuk openbaar werd. Maar de reactie van het bedrijf suggereert ook een filosofie die veel veiligheidsonderzoekers ongerust heeft gemaakt: in plaats van de ontwikkeling van capabelere modellen te vertragen of te stoppen, zou het zich in plaats daarvan moeten concentreren op het bouwen van sterkere kooien eromheen.  

“Naarmate modellen langere en complexere taken op zich nemen, kunnen mislukkingen die evaluaties over het hoofd zien grotere gevolgen hebben”, zei OpenAI in een postmortem van het incident. “We zullen blijven werken aan het verkleinen van de kloof tussen evaluatie en implementatie: het testen van modellen over langere trajecten, het verbeteren van de afstemming, het bouwen van monitoring die kan ingrijpen en het geven van duidelijker inzicht en controle aan gebruikers.”

Het nieuwste grensmodel van OpenAI zal waarschijnlijker dan zijn voorganger afwijkend gedrag vertonen. Beeldcredits: OpenAI

Er is ook reden om te denken dat de modellen van OpenAI steeds minder op één lijn komen te liggen naarmate ze krachtiger worden. Volgens de systeemkaart van OpenAI is GPT-5.6 Sol aanzienlijk gevoeliger voor verkeerde uitlijning dan zijn voorganger, GPT-5.5. Bij implementatiesimulaties ontdekte het bedrijf ook dat het model eerder beperkingen zou omzeilen, destructieve acties zou ondernemen en ongeautoriseerde gegevensoverdrachten zou uitvoeren dan GPT-5.5. Deze cijfers werden bij de eerste release grotendeels over het hoofd gezien, maar in de nasleep van de inbreuk krijgen ze een tweede blik – vooral omdat Sol een van de betrokken modellen was.

In een post op sociale media betoogde Dean Ball, hoofd van Strategic Futures van OpenAI, dat monitoring en transparantie de beste manieren zijn om deze tendensen onder controle te houden. 

“Deze kwesties zullen belangrijker worden naarmate de mogelijkheden van modellen verbeteren en naarmate de inzet van hun inzet toeneemt”, zei hij. "De oplossing is noch alarmisme, noch zelfgenoegzaamheid. In plaats daarvan geloof ik dat de oplossing ligt in zorgvuldige meting en monitoring, een technische mentaliteit en transparantie."

Een voormalige OpenAI-onderzoeker vertelde TechCrunch dat het bedrijf de neiging heeft zich te concentreren op ‘uiterlijke afstemming’ in plaats van op ‘innerlijke afstemming’ – in wezen het verschil tussen een AI-systeem dat een reeks waarden begrijpt en deze op overtuigende wijze kan vertegenwoordigen, en een systeem dat deze waarden daadwerkelijk in de kern heeft. In dit geval was uitlijning naar buiten niet genoeg om het model ervan te overtuigen dat het niet mocht frauderen tijdens de test.

OpenAI reageerde niet op herhaalde verzoeken om meer informatie.

Voor op afstemming gerichte onderzoekers is de reactie van OpenAI niet goed genoeg. Zvi Mowshowitz, een schrijver die zich richt op nieuwe AI-ontwikkelingen, betoogde dat de beslissing van OpenAI om het incident als een infrastructuurprobleem te behandelen de onmiddellijke cyberveiligheidsproblemen kan helpen oplossen, maar op de lange termijn zal mislukken. 

“Dit is een uitlijningsprobleem”, schreef Mowshowitz in een recent Substack-blog. "Dit zijn de modellen die niet goed op elkaar zijn afgestemd, en alle OpenAI-modellen vertonen ernstige tekenen van precies het probleem waar we ons allemaal het meest zorgen over maken, op een manier die waarschijnlijk op een diep niveau in hun training is ingebed. De hele trainingspijplijn moet in dit licht worden aangepakt, anders zal het alleen maar erger worden."

Verschillende experts vertelden TechCrunch dat het incident het bewijs is dat de huidige trainingsmethoden systemen opleveren die optimaliseren voor resultaten in plaats van menselijke bedoelingen te internaliseren. 

Redwood Research, een non-profitorganisatie voor veiligheids- en beveiligingsonderzoek op het gebied van AI, heeft het modelgedrag van OpenAI in dit geval geclassificeerd als ‘score-zoekende verkeerde uitlijning’, een patroon waarin AI-modellen een hoge score proberen te behalen, ongeacht instructies, bijwerkingen of gevolgen verderop in de keten. 

“Modellen met deze uitlijningseigenschappen zouden een ‘Potemkin-dorp’ van valse successen kunnen opzetten, zodat het lijkt alsof alles goed gaat terwijl dat niet zo is”, schreven Alex Mallen en Girish Gupta, twee onderzoekers bij Redwood, in een recent artikel. 

Scorezoekend gedrag en andere afwijkingen zijn niet uniek voor OpenAI. Anthropic heeft verschillende artikelen gepubliceerd over opkomend gedrag van verkeerde afstemming dat aan de oppervlakte komt wanneer zijn grensmodellen worden geoptimaliseerd of in autonome omgevingen worden geplaatst, waaronder bedrog, beloningshacking en kwaadwillige autonomie. 

“We zien nog steeds consequent modellen die beperkingen proberen te omzeilen en bedrieglijk handelen wanneer hen wordt gevraagd taken uit te voeren die op het randje van hun kunnen liggen”, vertelde Neev Parikh, een AI-veiligheidsonderzoeker bij de non-profitorganisatie METR, via e-mail aan TechCrunch. “In ons grensrisicorapport zagen we dit gedrag redelijk consistent, ondanks pogingen van bedrijven om dit gedrag te verminderen.”

Impliciet in de reactie van OpenAI op het Hugging Face-incident is de veronderstelling dat de ontwikkeling zal doorgaan op nog capabelere systemen, of ze nu op de juiste manier op elkaar zijn afgestemd of niet. Teruggaan naar de tekentafel is niet echt een optie als de bedrijfsmodellen van AI-bedrijven afhankelijk zijn van het leveren van de volgende generatie modellen. Als het misschien nooit mogelijk zal zijn om met zekerheid te weten of een model volledig op één lijn ligt, dan komt de praktische vraag neer op hoe je steeds capabeler wordende systemen veilig kunt beheersen en controleren.

“Er is nog geen goed begrip van hoe de meest capabele AI-systemen op elkaar af te stemmen, maar er is veel meer consensus over hoe ze te controleren”, vertelde Steven Adler – een voormalig veiligheidsonderzoeker bij OpenAI en huidig ​​hoofdwetenschapper van Guidelight AI Standards, een organisatie die een standaard publiceert voor het vermijden van incidenten zoals die van Hugging Face – aan TechCrunch. “Elk bedrijf heeft manieren om dit te bereiken.”