Live News

Update 5 augustus, 12.10 uur PT: Wispr Flow heeft officieel zijn notetaker voor Mac gelanceerd...

In het kort Bitcoin bridge Boltz heeft zijn Bitcoin-swapservice voor onbepaalde tijd opgeschort...

Elon Musk besteedde tijdens de eerste winstoproep van SpaceX enkele buitenaardse beweringen over de activiteiten van het bedrijf en de toekomstpers...

05/08/26

Volg ons:

AI-modellen met een open gewicht zijn bezig de grens in te halen. Het veiligheidsgat blijft bestaan. 

AI-modellen met een open gewicht zijn bezig de grens in te halen. Het veiligheidsgat blijft bestaan. 
Default Door Remote - 04 Aug 2026
Terwijl beleidsmakers debatteren over hoe ze steeds krachtigere AI-systemen zoals OpenAI’s GPT-5.6 Sol en Anthropic’s Mythos moeten besturen, heeft een Chinees open-weight model de kloof met de leiders van de industrie verkleind.  

GLM-5.2, het open-weight AI-model van het Chinese Z.ai, loopt slechts een paar maanden achter op OpenAI's GPT-5.5 en Anthropic's Claude Opus 4.7 over cyber- en biocapaciteiten, volgens een nieuw rapport van AI-veiligheidsnon-profitorganisatie SaferAI. Maar de kloof tussen grenscapaciteiten en veiligheidspraktijken wordt groter. 

Volgens de evaluatie van SaferAI, die de non-profitorganisatie uitvoerde via de openbare API van Z.ai, weigerde GLM-5.2 geen van de aanstootgevende cyber- of biologietaken voor tweeërlei gebruik die het kreeg. Ter vergelijking: Claude Opus 4.7 “weigerde zo consequent dat SaferAI CyberGym er helemaal niet op kon voltooien.” (CyberGym is een benchmark die cyberbeveiligingsmogelijkheden evalueert. OpenAI gebruikte het in de evaluatie die voorafging aan de Hugging Face-inbreuk van vorige maand.)

Het is een sterke herinnering aan waar sommige critici al jaren voor waarschuwen: dat open-weight AI-modellen zeer capabele AI in handen van potentiële aanvallers kunnen brengen, zonder enige manier om toezicht te houden op hoe zij de technologie gebruiken zodra ze de gewichten hebben gedownload. Nu open-weight-modellen de capaciteiten van ‘s werelds toonaangevende AI-systemen snel benaderen, verschuift het debat van de vraag of ze kunnen concurreren naar de manier waarop de samenleving risico’s beheert zodra ze worden vrijgegeven. 

“De grens van capaciteit is niet de grens van risico, en dus moeten we ook rekening houden met de stand van de maatregelen om het risico goed te kunnen beoordelen”, vertelde Henry Papadatos, uitvoerend directeur van SaferAI, aan TechCrunch.

Hoewel Z.ai veiligheidsmaatregelen zou kunnen toepassen op de gehoste API, worden deze beveiligingen niet meer afdwingbaar zodra iemand de gewichten op zijn eigen hardware uitvoert, waar hij eventuele beveiligingen kan verwijderen of wijzigen, de modellen kan verfijnen of systeemprompts kan wijzigen. 

Frontier-ontwikkelaars zoals OpenAI en Anthropic vertrouwen vaak op veiligheidsmaatregelen zoals classifiers, weigeringstraining en controles op API-niveau om gevaarlijke cyber- en biologische hulp te beperken. 

Deze maatregelen zijn verre van onfeilbaar: jailbreaks omzeilen routinematig de bescherming van gebruikte modellen. Far.ai, een non-profitorganisatie op het gebied van AI-veiligheid, vond honderden universele jailbreaks (gedefinieerd als herbruikbare sleutels die slagen op de meest schadelijke verzoeken) in geavanceerde modellen zoals Grok 4.5 van xAI en Gemini 3.1 Pro van Google DeepMind. Volgens het rapport slagen jailbreaks wanneer aanvallers meerdere manipulatietechnieken combineren – waaronder rollenspel, het nabootsen van autoriteit, een valse gespreksgeschiedenis en vervolgaanwijzingen – om de zwakke punten in de verdediging van een model te versterken. 

Maar de beveiligingen voor gesloten modellen werken helemaal niet op modellen met een open gewicht, die zijn ontworpen om te draaien op elke infrastructuur met welke set beveiligingen dan ook – of het ontbreken daarvan.

“Het doel moet duidelijk zijn dat de goede mogelijkheden – de veilige – voor iedereen toegankelijk zijn, en dan proberen we de slechte te verwijderen, zelfs op een open source-manier”, aldus Papadatos.

Eén techniek die Papadatos heeft opgemerkt en die zou kunnen helpen, is ‘pre-training data filtering’, waarbij een AI-bedrijf aanstootgevende cyberbeveiligingsinformatie uit hun trainingsgegevens verwijdert en het model vervolgens traint op de samengestelde dataset. 

Sommige onderzoeken suggereren dat dit gevaarlijke biologische kennis kan verminderen zonder de algehele modelprestaties te schaden. Voor cybersecurity is datafiltering echter veel minder praktisch. 

Het is moeilijk om een ​​algemeen model te trainen dat uitblinkt in coderen, maar ook geen goede hacker is. Omdat coderen de grootste geldschieter van AI is geworden, staan ​​ontwikkelaars onder druk om deze mogelijkheden te blijven verbeteren, zelfs als ze zoeken naar manieren om misbruik te beperken. 

Daarom zijn frontier-ontwikkelaars in plaats daarvan steeds meer op andere oplossingen gaan vertrouwen. Eén benadering is geweest om selectief de soorten hulpmodellen voor cyberbeveiliging te beperken. Opus 5 van Anthropic kan bijvoorbeeld zoeken naar kwetsbaarheden in niet-gecompileerde broncode, maar niet in gecompileerde software, volgens de systeemkaart van het model. De redenering is dat dit het moeilijker maakt om Opus 5 voor offensieve doeleinden te gebruiken. 

Andere omvatten rigoureuze veiligheidsevaluaties voorafgaand aan de implementatie, het publiceren van risicobeoordelingen en het achterhouden van modelgewichten als een systeem als te gevaarlijk wordt ervaren. 

In het geval van GLM-5.2 zegt SaferAI dat Z.ai geen veiligheidsframework, testverplichtingen vóór de implementatie of risicobeoordeling voor het model heeft gepubliceerd. TechCrunch heeft Z.ai gevraagd of het vóór de release interne of externe veiligheidsevaluaties heeft uitgevoerd, maar kreeg geen antwoord. 

Chinese leiders hebben de risico’s van geavanceerde AI steeds meer onderkend. Op de World AI Conference vorige maand benadrukte de Chinese president Xi Jinping het belang van open-weight-modellen, terwijl hij ook de noodzaak benadrukte om ervoor te zorgen dat AI een instrument blijft onder strikte menselijke controle. 

Graham Webster, die het Chinese AI-beleid bestudeert aan het Stanford Cyber ​​Policy Center, vertelde TechCrunch dat China robuuste regelgeving heeft voor AI, maar dat die regels zich historisch gezien hebben gericht op politiek gevoelige inhoud, desinformatie en sociale stabiliteit in plaats van op catastrofale AI-risico’s zoals offensieve cybercapaciteiten en biologisch misbruik. 

“Amerikaanse AI-denkers zijn over het algemeen meer bezorgd over dit existentiële catastrofale [idee] dan de Chinese gemeenschap,” zei Webster, eraan toevoegend dat veel Chinese beleidsonderzoekers geloven dat als er echt een nieuw grensrisico gaat ontstaan, Amerikaanse bedrijven dit waarschijnlijk als eerste zullen tegenkomen. 

“Het Chinese systeem heeft er vertrouwen in dat zij het gebruik van deze technologieën in China controleren”, vervolgde Webster. “Online zijn in China wordt toegeschreven aan je echte naam, en bedrijven kunnen verantwoordelijk worden gehouden, gebruikers kunnen verantwoordelijk worden gehouden.”

Webster peinsde dat hetzelfde mechanisme dat modelaanbieders gebruiken om te weigeren zich met bepaalde politieke onderwerpen bezig te houden, mogelijk kan worden aangepast om ervoor te zorgen dat modellen weigeren offensieve cyberaanvallen uit te voeren of geen nadelige biologische engineeringresultaten opleveren. Hij voegde eraan toe dat, omdat Chinese bedrijven de neiging hebben om achter de schermen met toezichthouders te coördineren, het moeilijk kan zijn om te weten welke interne tests ze uitvoeren voordat ze worden vrijgegeven.

Voorstanders van open-weight AI beweren dat het vrijgeven van de gewichten belangrijk is voor de cyberveiligheid, omdat het bedrijven in staat stelt zichzelf te verdedigen tegen aanvallen – Hugging Face vertrouwde op GLM-5.2 om zichzelf te verdedigen tegen de inbreuk van OpenAI – en omdat het hen in staat stelt zich beter voor te bereiden op toekomstige bedreigingen als ze weten wat er gaat komen.

“Dezelfde systemen die hebben geholpen een door AI aangedreven cyberaanval te stoppen, kunnen nu helpen bij de verdediging tegen miljoenen cyberaanvallen elke dag, terwijl ze ons helpen kwetsbaarheden te identificeren en op te lossen voordat aanvallers deze misbruiken”, zei Clem Delangue, CEO van Hugging Face, deze week in een post op sociale media.

Papadatos zei dat de voordelen vaak worden overdreven, en dat dit niet betekent dat we ‘gevaarlijke mogelijkheden moeten open source’.

“Het belangrijkste punt in mijn ogen is dat we niet zomaar moeten accepteren dat gevaarlijke capaciteiten gemakkelijk toegankelijk zijn voor iedereen waar dan ook”, zei hij, en benadrukte dat hij gelooft dat de industrie ernaar moet streven om alleen de “goede capaciteiten” gemakkelijk toegankelijk te maken. Aanvallers adopteren standaard sneller nieuwe tools dan verdedigers. Een ransomwaregroep kan bijvoorbeeld binnen een week zijn werkwijze veranderen. Een ziekenhuis kan dat niet.”