Default
Door Remote - 07 Aug 2026
Kimi K3, het nieuwste AI-model van het Chinese bedrijf Moonshot, ontsnapte aan een omgeving die was opgezet om zijn cybercapaciteiten te testen, zeiden onderzoekers in een blogpost die vrijdag werd gepubliceerd.
Uit het nieuws blijkt eens te meer dat bedrijven en onafhankelijke organisaties moeite hebben om hun AI-modellen die zijn ontworpen voor hacking in bedwang te houden.
De afgelopen weken ontsnapten grensoverschrijdende LLM’s van Amerikaanse kunstmatige-intelligentielaboratoria bij OpenAI, Anthropic en Meta, evenals het Britse AI Security Institute, allemaal op verschillende manieren aan testomgevingen en hackten uiteindelijk echte doelen die geen deel uitmaakten van het experiment. Dit begint zo vaak te gebeuren dat er nu een website is die al deze incidenten bijhoudt, genaamd Felony Bench, een knipoog naar het feit dat deze LLM’s mogelijk misdaden begaan – althans theoretisch gesproken.
In het geval van deze Kimi-test was de sandbox die was ontworpen om het experiment te bevatten niet correct geconfigureerd. Hoewel de sandbox het AI-model geen toegang gaf tot bepaald webverkeer, omzeilde het model in plaats daarvan de sandbox door te vertrouwen op opdrachtregeltools, aldus de onderzoekers van het AI-gerichte cyberbeveiligingsbedrijf Frontier Security.
“Dit suggereert dat sommige van de evaluaties over cyberbeveiliging die de gemeenschap gebruikt gevoelig zijn voor beveiligingsproblemen en modellen in staat stellen vals te spelen, en dat er modellen zijn die opzettelijk op zoek zijn naar mazen in de wet en kwetsbaarheden waardoor ze vals kunnen spelen met evaluaties”, schreven de onderzoekers.
Als je thuis de score bijhoudt, sluit Moonshot zich volgens de cijfers van Felony Bench nu aan bij OpenAI en Anthropic, die elk zeven geregistreerde incidenten hebben, en Meta, die er één heeft.
Uit het nieuws blijkt eens te meer dat bedrijven en onafhankelijke organisaties moeite hebben om hun AI-modellen die zijn ontworpen voor hacking in bedwang te houden.
De afgelopen weken ontsnapten grensoverschrijdende LLM’s van Amerikaanse kunstmatige-intelligentielaboratoria bij OpenAI, Anthropic en Meta, evenals het Britse AI Security Institute, allemaal op verschillende manieren aan testomgevingen en hackten uiteindelijk echte doelen die geen deel uitmaakten van het experiment. Dit begint zo vaak te gebeuren dat er nu een website is die al deze incidenten bijhoudt, genaamd Felony Bench, een knipoog naar het feit dat deze LLM’s mogelijk misdaden begaan – althans theoretisch gesproken.
In het geval van deze Kimi-test was de sandbox die was ontworpen om het experiment te bevatten niet correct geconfigureerd. Hoewel de sandbox het AI-model geen toegang gaf tot bepaald webverkeer, omzeilde het model in plaats daarvan de sandbox door te vertrouwen op opdrachtregeltools, aldus de onderzoekers van het AI-gerichte cyberbeveiligingsbedrijf Frontier Security.
“Dit suggereert dat sommige van de evaluaties over cyberbeveiliging die de gemeenschap gebruikt gevoelig zijn voor beveiligingsproblemen en modellen in staat stellen vals te spelen, en dat er modellen zijn die opzettelijk op zoek zijn naar mazen in de wet en kwetsbaarheden waardoor ze vals kunnen spelen met evaluaties”, schreven de onderzoekers.
Als je thuis de score bijhoudt, sluit Moonshot zich volgens de cijfers van Felony Bench nu aan bij OpenAI en Anthropic, die elk zeven geregistreerde incidenten hebben, en Meta, die er één heeft.

