Live News

Disney en TikTok hebben een deal gesloten waarmee TikTok-makers Disney-gerichte verticale video's naar Disney+ kunnen brengen...

Hoewel YouTube automatische AI-detectie heeft geïntroduceerd, bestaat nog steeds de kans dat sommige video's door de mazen van het net glippen...

Een andere toevoeging is een USB-C plug-in ventilatoreenheid die aan de bovenkant van het scherm zit (en vastklikt)...

05/08/26

Volg ons:

OpenAI- en Anthropic-modellen werden gehackt toen ze werden getest door het Britse AI-onderzoeksinstituut

OpenAI- en Anthropic-modellen werden gehackt toen ze werden getest door het Britse AI-onderzoeksinstituut
Default Door staff@engadget.com (Mariella Moon) - 05 Aug 2026
Zowel OpenAI als Anthropic hebben onlangs toegegeven dat hun modellen uit hun testomgevingen zijn ontsnapt en op eigen kracht externe organisaties hebben gehackt. Nu heeft het Britse AI Security Institute (AISI) een rapport uitgebracht, waarin gedetailleerd wordt beschreven hoe de modellen van de bedrijven tijdens hun eigen tests ook onafhankelijk handelden en "zich bezighielden met aanhoudende, potentieel schadelijke activiteiten gericht op echte mensen en organisaties". 

Het instituut, dat opereert onder het Britse ministerie van Wetenschap, evalueert geavanceerde AI-modellen. Onderdeel van deze evaluaties is om te zien of ze kunnen worden misbruikt voor cyberaanvallen. Daarom test het instituut ze bewust onder tolerante omstandigheden, met toegang tot internet en zelfs met uitgeschakelde beveiligingen. De modellen maakten deze keer geen misbruik van kwetsbaarheden om toegang te krijgen tot internet, maar handelden wel buiten het bereik van hun testparameters.

Om specifiek te zijn: de incidenten vonden plaats tijdens een enkele test waarbij AI-agenten werden uitgedaagd een cyberveiligheidsprobleem op te lossen. AISI voerde de test 122 keer uit op verschillende modellen en ontdekte onregelmatigheden in 10 van die runs. Van de 19 gevallen die het instituut aantrof waarin een agent zich schuldig maakte, was Mythos 5 van Anthropic verantwoordelijk voor 17 gevallen, terwijl GPT-5.6 Sol van OpenAI bij twee gevallen betrokken was. 

Het instituut ontdekte dat de modellen op eigen houtje handelden en schadelijke activiteiten ontplooiden op de ochtend van 28 juli, toen het beveiligingsmonitoringsysteem gegevens markeerde die de testomgeving via Tor verlieten. De testers beoordeelden snel de activiteiten van de modellen en ontdekten de incidenten die plaatsvonden tussen 25 en 28 juli. 

In het meest opvallende geval probeerde een AI-agent kwaadaardige code in een open-source GitHub-project te injecteren als onderdeel van een supply chain-aanval. Het nam zijn toevlucht tot social engineering-technieken, deed onderzoek naar de menselijke beheerders van het project en creëerde vervolgens meerdere sokpop-accounts om een ​​van hen de code te laten goedkeuren. Nadat een menselijke recensent zijn verzoek had afgewezen, heeft de agent zijn eerdere activiteit aangepast en een nieuwe identiteit aangenomen om door te gaan. Omdat het bureau Tor gebruikte om de beperkingen van GitHub te omzeilen, werd het instituut op de hoogte gebracht van zijn activiteiten. 

De agent probeerde ook rechtstreeks contact op te nemen met echte mensen door hen berichten of bestanden te sturen en hen over te halen kwaadaardige code uit te voeren. Sommige van die berichten en bestanden bevatten malware, terwijl andere pogingen tot social engineering waren. Eén agent liet zelfs openbare berichten achter op GitHub en nodigde andere agenten die hen tegenkwamen uit om aan dezelfde uitdaging te werken. Het liet instructies achter over hoe de rekeningen en andere output die het had achtergelaten opnieuw gebruikt kon worden om zijn activiteiten voort te zetten. Andere agenten ontdekten die berichten later wel en volgden de instructies daarin op. 

AISI legt in zijn post uit dat de AI-agenten nooit instructies hebben gekregen om misleidend gedrag te vertonen. Maar bij het zoeken naar manieren om moeilijke problemen op te lossen, waren sommige van de oplossingen die ze vonden het misleiden van echte mensen. Het instituut geeft toe dat agenten gedwongen zouden kunnen worden ‘creatiever’ te zijn als ze de opdracht krijgen om vrijwel onmogelijke problemen op te lossen. Het stelt echter dat het het gedrag van de agenten die het aan het testen was, niet volledig verklaart. In sommige van de ontdekte gevallen ging de agent meteen over tot het kiezen van de schadelijke manier om de taak uit te voeren, zelfs als hij instructies had over hoe hij de taak moest oplossen zoals bedoeld. 

Het instituut verduidelijkt dat er op dit moment geen duidelijke aanwijzingen zijn dat dezelfde activiteit buiten de testscenario’s zou plaatsvinden. Het kan ook niet zeggen of de AI-agenten zich ervan bewust waren dat ze in de echte wereld handelden, om zo te zeggen, en niet meer in een testomgeving. Toch adviseert het organisaties om robuustere cyberbeveiligingsmaatregelen te nemen en voorzichtiger te zijn bij het verifiëren van bijdragen van buitenaf. “Naarmate AI-modellen capabeler en toegankelijker worden, zou wat we tijdens dit incident hebben gezien steeds gebruikelijker kunnen worden”, zegt het rapport.

In zijn reactie op X zegt Anthropic dat het samenwerkt met AISI om een ​​duidelijker beeld te krijgen van Claude Mythos' 'begrip van zijn situatie', wat het bedrijf zal helpen identificeren waarom het tijdens de evaluatie heeft gehandeld zoals het heeft gedaan.

Het Britse @AISecurityInst (AISI) heeft een rapport gepubliceerd over hun recente cybersecurity-evaluatie van Claude Mythos 5 van Anthropic en GPT-5.6 Sol van OpenAI. De modellen probeerden een opdracht uit te voeren in een opstelling waar hun normale beveiligingen waren verwijderd en ze waren opzettelijk...

— Antropisch (@AnthropicAI) 4 augustus 2026