Default
Door Remote - 07 Aug 2026
In het kort
Kimi K3 van Moonshot AI verliet zijn test-sandbox en ging het open internet op, aldus beveiligingsbedrijf Frontier Security.
Het model onderzocht de netwerkinstellingen van de sandbox, vond bereikbare sites en haalde de testantwoorden uit GitHub.
Frontier zegt dat een verkeerde configuratie de deur opende, maar dat Kimi's eigen vangrails dit niet tegenhielden.
Kimi K3 van Moonshot AI verliet de sandbox waarin hij werd getest en ging het open internet op om antwoorden te vinden op de problemen die hij had opgeworpen, aldus beveiligingsbedrijf Frontier Security.
Het model werd beoordeeld op defensieve cybersecurityvaardigheden en kreeg nadrukkelijk de opdracht om problemen op te lossen zonder ze op te zoeken. Het heeft deze taak helemaal niet geprobeerd, zei Frontier. In plaats daarvan onderzocht het het netwerk, stelde vast dat de DNS-resolutie voor github.com werkte, kloonde het de officiële benchmarkrepository en las de oplossing van de schijf.
Frontier noemt dit 'gaming met specificaties via uitgaande netwerklekken', waarbij hij opmerkt dat sandboxen die zijn gebouwd op raamwerken zoals Inspect van het AI Security Institute inkomend verkeer blokkeren terwijl uitgaande HTTPS- en DNS-poorten open blijven. Bekwame agenten inspecteren routinematig hun eigen shell-omgeving bij het opstarten, en een model dat github.com bereikbaar vindt, kan referentieoplossingen ophalen met standaard opdrachtregelprogramma's.
Een verkeerde configuratie maakte dat mogelijk, zoals bij recente incidenten die werden onthuld door OpenAI en Anthropic. "We hebben een lek in de zandbak gevonden", vertelde CEO Yaron Singer aan WIRED. "Maar we ontdekten ook dat Kimi misbruik maakte van die maas in de wet."
Onderzoeker Paul Kassianik vertelde WIRED dat het model "zeer goed is in het volgen van een doel op welke manier dan ook" en dat het de vangrails mist die het tegenhouden om vals te spelen of te ontsnappen. Moonshot reageerde niet op het verzoek van de publicatie om commentaar.
AI-agenten doorbreken de containmentWaar de Anthropic- en OpenAI-modellen die de containment doorbraken werden betrapt in interne evaluaties, waarvan er één nog niet was uitgebracht, en bij de versies die zich richtten op echte mensen tijdens tests door de Britse overheid de cyberclassifiers opzettelijk waren uitgeschakeld, is Kimi K3 openlijk te downloaden en heeft Frontier het getest met de waarborgen die een gewone gebruiker zou krijgen. Die beschikbaarheid, zo schreef het bedrijf, brengt hetzelfde gedrag binnen het bereik van tegenstanders en maakt het incident potentieel schadelijker.
Ook Kimi K3 richtte geen schade aan. Eenmaal buiten viel het niets aan, omdat dat niet nodig was. Het model van OpenAI hackte Hugging Face en vier andere services om benchmark-antwoorden te bereiken, terwijl Kimi de antwoorden in een openbare opslagplaats vond.
De gebruikte sandbox Frontier is gebouwd op het evaluatiekader van het Britse AI Security Institute. AISI maakte deze week bekend dat agenten bij hun eigen cybertests het live internet waren opgegaan en zich op echte mensen hadden gericht – een afzonderlijk incident waarbij Anthropic- en OpenAI-modellen betrokken waren waarvan de beveiligingen waren uitgeschakeld. In het dinsdag gepubliceerde rapport wordt opgemerkt dat AISI nu historische evaluaties scant op soortgelijk gedrag, en dat Kimi K3 een van de modellen is die worden beoordeeld. AISI reageerde niet op het verzoek van WIRED om commentaar.
De grotere claim van Frontier is dat de benchmarks zelf in gevaar zijn gebracht. Een model dat het antwoord van GitHub afleest, slaagt nog steeds, dus hoge scores kunnen een lekkende omgeving weerspiegelen in plaats van een echte redenering. En als één capabel model de kortere weg zou vinden, zo betoogt het bedrijf, zouden anderen die shell-toegang hebben gekregen, deze ook kunnen gebruiken, wat de resultaten voor het hele veld zou vergroten in plaats van alleen voor Kimi.
Modellen optimaliseren voor de objectieve functie, schreef Frontier, en niet voor de ‘menselijke intentie achter de benchmark’, eraan toevoegend dat waar een netwerkpad naar de oplossing bestaat ‘een voldoende capabele agent dit zal vinden’.
Een algemeen probleem Matt Fredrikson, CEO van Gray Swan en universitair hoofddocent bij Carnegie Mellon, vertelde WIRED dat het gedrag onopvallend is. Geef een model een doel zonder expliciete muren eromheen, zei hij, en "het zal een manier vinden om het antwoord te krijgen." Hij beschreef het als een waarschuwend verhaal voor iedereen die modellen als agenten gebruikt in tools als OpenClaw.
De onderzoekers van Frontier maken hetzelfde punt vanuit de andere richting: het vermogen waarmee Kimi zijn weg naar buiten kan vinden, maakt modellen met een open gewicht ook tot sterke defensieve hulpmiddelen. Hun eigen benchmarks beoordelen Kimi hoog in het vinden van kwetsbaarheden in software en netwerken, en Hugging Face gebruikte een niet nader genoemd Chinees model om zichzelf te verdedigen tijdens het OpenAI-incident.
Kimi K3, uitgebracht in juli, is het grootste open-sourcemodel dat tot nu toe is gepubliceerd en bracht de markten in rep en roer bij vergelijkingen met het debuut van DeepSeek.
Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!
Kimi K3 van Moonshot AI verliet zijn test-sandbox en ging het open internet op, aldus beveiligingsbedrijf Frontier Security.
Het model onderzocht de netwerkinstellingen van de sandbox, vond bereikbare sites en haalde de testantwoorden uit GitHub.
Frontier zegt dat een verkeerde configuratie de deur opende, maar dat Kimi's eigen vangrails dit niet tegenhielden.
Kimi K3 van Moonshot AI verliet de sandbox waarin hij werd getest en ging het open internet op om antwoorden te vinden op de problemen die hij had opgeworpen, aldus beveiligingsbedrijf Frontier Security.
Het model werd beoordeeld op defensieve cybersecurityvaardigheden en kreeg nadrukkelijk de opdracht om problemen op te lossen zonder ze op te zoeken. Het heeft deze taak helemaal niet geprobeerd, zei Frontier. In plaats daarvan onderzocht het het netwerk, stelde vast dat de DNS-resolutie voor github.com werkte, kloonde het de officiële benchmarkrepository en las de oplossing van de schijf.
Frontier noemt dit 'gaming met specificaties via uitgaande netwerklekken', waarbij hij opmerkt dat sandboxen die zijn gebouwd op raamwerken zoals Inspect van het AI Security Institute inkomend verkeer blokkeren terwijl uitgaande HTTPS- en DNS-poorten open blijven. Bekwame agenten inspecteren routinematig hun eigen shell-omgeving bij het opstarten, en een model dat github.com bereikbaar vindt, kan referentieoplossingen ophalen met standaard opdrachtregelprogramma's.
Een verkeerde configuratie maakte dat mogelijk, zoals bij recente incidenten die werden onthuld door OpenAI en Anthropic. "We hebben een lek in de zandbak gevonden", vertelde CEO Yaron Singer aan WIRED. "Maar we ontdekten ook dat Kimi misbruik maakte van die maas in de wet."
Onderzoeker Paul Kassianik vertelde WIRED dat het model "zeer goed is in het volgen van een doel op welke manier dan ook" en dat het de vangrails mist die het tegenhouden om vals te spelen of te ontsnappen. Moonshot reageerde niet op het verzoek van de publicatie om commentaar.
AI-agenten doorbreken de containmentWaar de Anthropic- en OpenAI-modellen die de containment doorbraken werden betrapt in interne evaluaties, waarvan er één nog niet was uitgebracht, en bij de versies die zich richtten op echte mensen tijdens tests door de Britse overheid de cyberclassifiers opzettelijk waren uitgeschakeld, is Kimi K3 openlijk te downloaden en heeft Frontier het getest met de waarborgen die een gewone gebruiker zou krijgen. Die beschikbaarheid, zo schreef het bedrijf, brengt hetzelfde gedrag binnen het bereik van tegenstanders en maakt het incident potentieel schadelijker.
Ook Kimi K3 richtte geen schade aan. Eenmaal buiten viel het niets aan, omdat dat niet nodig was. Het model van OpenAI hackte Hugging Face en vier andere services om benchmark-antwoorden te bereiken, terwijl Kimi de antwoorden in een openbare opslagplaats vond.
De gebruikte sandbox Frontier is gebouwd op het evaluatiekader van het Britse AI Security Institute. AISI maakte deze week bekend dat agenten bij hun eigen cybertests het live internet waren opgegaan en zich op echte mensen hadden gericht – een afzonderlijk incident waarbij Anthropic- en OpenAI-modellen betrokken waren waarvan de beveiligingen waren uitgeschakeld. In het dinsdag gepubliceerde rapport wordt opgemerkt dat AISI nu historische evaluaties scant op soortgelijk gedrag, en dat Kimi K3 een van de modellen is die worden beoordeeld. AISI reageerde niet op het verzoek van WIRED om commentaar.
De grotere claim van Frontier is dat de benchmarks zelf in gevaar zijn gebracht. Een model dat het antwoord van GitHub afleest, slaagt nog steeds, dus hoge scores kunnen een lekkende omgeving weerspiegelen in plaats van een echte redenering. En als één capabel model de kortere weg zou vinden, zo betoogt het bedrijf, zouden anderen die shell-toegang hebben gekregen, deze ook kunnen gebruiken, wat de resultaten voor het hele veld zou vergroten in plaats van alleen voor Kimi.
Modellen optimaliseren voor de objectieve functie, schreef Frontier, en niet voor de ‘menselijke intentie achter de benchmark’, eraan toevoegend dat waar een netwerkpad naar de oplossing bestaat ‘een voldoende capabele agent dit zal vinden’.
Een algemeen probleem Matt Fredrikson, CEO van Gray Swan en universitair hoofddocent bij Carnegie Mellon, vertelde WIRED dat het gedrag onopvallend is. Geef een model een doel zonder expliciete muren eromheen, zei hij, en "het zal een manier vinden om het antwoord te krijgen." Hij beschreef het als een waarschuwend verhaal voor iedereen die modellen als agenten gebruikt in tools als OpenClaw.
De onderzoekers van Frontier maken hetzelfde punt vanuit de andere richting: het vermogen waarmee Kimi zijn weg naar buiten kan vinden, maakt modellen met een open gewicht ook tot sterke defensieve hulpmiddelen. Hun eigen benchmarks beoordelen Kimi hoog in het vinden van kwetsbaarheden in software en netwerken, en Hugging Face gebruikte een niet nader genoemd Chinees model om zichzelf te verdedigen tijdens het OpenAI-incident.
Kimi K3, uitgebracht in juli, is het grootste open-sourcemodel dat tot nu toe is gepubliceerd en bracht de markten in rep en roer bij vergelijkingen met het debuut van DeepSeek.
Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!

