Live News

In het kort Een doorzoekbare database opgebouwd uit de openbare eigendommen van New York City heeft tot terugslag geleid...

In het kort De kans dat de Fed aandringt op ‘geen verandering’ in de rentetarieven is de afgelopen 24 uur op de voorspellingsmarkten scherp gedaald...

In het kort SparkKitty heeft de fotobibliotheken van gebruikers gescand op zaadzinnen voor crypto-portemonnees en andere gevoelige informatie...

27/07/26

Volg ons:

Microsoft zegt dat MDASH Claude Mythos en GPT-5.6 Sol verslaat in de cybersecuritytest

Microsoft zegt dat MDASH Claude Mythos en GPT-5.6 Sol verslaat in de cybersecuritytest
Default Door Remote - 27 Jul 2026
In het kort

Microsoft zegt dat MDASH 95,95% scoorde op CyberGym, en daarmee GPT-5.5 Cyber, Mythos 5, GPT-5.6 Sol en Gemini 3.5 Flash Cyber overtreft.

MAI-Cyber-1-Flash verwerkt tot 90% van de werklast, terwijl MDASH de moeilijkste cases naar GPT-5.4 stuurt.

De scanner bevindt zich in een privépreview via Microsoft Defender, waar teams bevindingen kunnen bekijken en voorgestelde oplossingen kunnen genereren.

Microsoft heeft zijn eerste speciale cyberbeveiligingsmodel met de naam MAI-Cyber-1-Flash uitgebracht en aangesloten op MDASH, een systeem voor het opsporen van kwetsbaarheden dat volgens het bedrijf Anthropic's Mythos 5 en OpenAI's GPT-5.6 Sol verslaat en tegelijkertijd 50% minder kost dan de huidige beste MDASH-configuratie van Microsoft.

De gecombineerde opstelling scoorde volgens Microsoft 95,95% op CyberGym. CyberGym is een benchmark die AI-agenten vraagt ​​om 1.507 bekende kwetsbaarheden in 188 open-sourceprojecten te reproduceren en deze vervolgens beoordeelt op basis van het percentage dat met succes is gereproduceerd in een gecontroleerde omgeving.

Dat zette MDASH voor op GPT-5.5 Cyber ​​met 85,6%, Mythos 5 met 83,8%, GPT-5.6 Sol met 83,6% en Gemini 3.5 Flash Cyber ​​met 83,2%. Het resultaat is door Microsoft zelf gerapporteerd en was op het moment van publicatie nog niet op het openbare scorebord van CyberGym verschenen, hoewel de benchmark een openbare testset en een gedefinieerde succesmaatstaf gebruikt.

MAI-Cyber-1-Flash werkt niet alleen. Microsoft zegt dat het tot 90% van de taken afhandelt, terwijl MDASH de moeilijkste 10% naar GPT-5.4 stuurt. Dat is belangrijk omdat tokens – de stukjes tekst die een AI verwerkt – geld kosten telkens wanneer een model code leest of een antwoord geeft.

Afbeelding: MicrosoftDit is de eerste keer dat een Microsoft-model dat is gebouwd voor efficiëntie een compact, state-of-the-art model kan verslaan dat is gebouwd met algemene mogelijkheden in gedachten. “In combinatie met MDASH levert (MAI-Cyber-1-Flash) prestaties van wereldklasse tegen 50 procent van de kosten van toonaangevende modellen”, schreef Satya Nadella, CEO van Microsoft.

Vandaag kondigen we een reeks updates aan die klanten geavanceerde beveiliging bieden tegen de helft van de kosten.

MAI-Cyber-1-Flash is ons eerste cyberbeveiligingsmodel, van de grond af opgebouwd om de meest uitdagende kwetsbaarheden in complexe codebases te vinden. In combinatie met MDASH wordt het… pic.twitter.com/npcIihN1H7

— Satya Nadella (@satyanadella) 27 juli 2026

Een model (in dit geval MAI-Cyber-1-Flash) is de AI die over de code redeneert. Een harnas (in dit geval MDASH) is de machine eromheen: de agenten, tools, controles en workflow die beslissen waar ze moeten zoeken, verdachte bevindingen in twijfel trekken, duplicaten verwijderen en bewijzen dat een bug kan worden geactiveerd.

MDASH maakt gebruik van meer dan 100 gespecialiseerde agenten die zijn toegewezen om de code te controleren, te debatteren of een bevinding echt is en een proof of concept op te bouwen – een werkende demonstratie dat de fout bestaat.

Microsoft zei dat incidentele scans en vertraagde patches overbodig worden omdat AI het ontdekken van bugs goedkoper maakt. Het bedrijf stelt dat tientallen jaren aan beveiligingsgegevens het een voordeel opleveren en voegt eraan toe: “Niemand kan deze geschiedenis vervaardigen.”

Sinds de release van Claude Mythos proberen cybersecurity-experts de mogelijkheden ervan te verslaan of te evenaren. Onderzoekers reproduceerden het zoeken naar kwetsbaarheden in Mythos-stijl met openbare modellen voor minder dan $ 30 per scan. Dawid Moczadło, een van de betrokken onderzoekers, zei dat “de gracht evolueert van toegang tot modellen naar validatie.”

Het schaarse deel wordt het systeem dat bevindingen bewijst zonder ontwikkelaars onder vals alarm te begraven.

Decrypt meldde ook dat GPT-5.5 Cyber ​​onlangs de publieke CyberGym-voorsprong had overgenomen met een score van 85,6%, waarmee hij Mythos ternauwernood versloeg. De score van Microsoft ligt ongeveer 10 punten boven GPT-5.5 Cyber ​​en 7,5 punten boven het vorige resultaat van MDASH, maar het evalueert het volledige systeem in plaats van MAI-Cyber-1-Flash op zichzelf.

Microsoft zet MDASH in privé preview via Microsoft Security Exposure Management in de Defender-portal. Klanten kunnen Git-repository's scannen, de bevindingen bekijken, gerangschikt van onwaarschijnlijk tot bewezen, en de Defender CLI gebruiken om voorgestelde codeoplossingen te genereren voor beoordeling door ontwikkelaars.

De preview beperkt opslagplaatsen momenteel tot ongeveer 256 MB en staat één gelijktijdige scan per tenant toe. Verwacht wordt dat Project Perception dezelfde multi-agentaanpak naast het scannen van codes zal uitbreiden naar bredere workflows voor bedreigingsmonitoring en herstel.

Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!