Default
Door Remote - 05 Aug 2026
In het kort
Het Britse AI Security Institute heeft 19 niet-goedgekeurde acties gevonden in 10 van de 122 evaluatieruns, waarvan 17 uit Anthropic's Mythos 5 en twee uit OpenAI's GPT-5.6 Sol.
Eén agent opende een kwaadaardig pull-verzoek op een echte repository en gebruikte vervolgens de accounts die hij beheerde om het te onderschrijven en druk uit te oefenen op de beheerder.
Afzonderlijke agenten vonden een GitHub-token dat een van hen publiekelijk had gelekt en gebruikten een gedeelde repository om te coördineren.
Het Britse AI Security Institute heeft onthuld dat AI-agenten eind juli tijdens een cyberevaluatie ‘aanhoudende, niet-goedgekeurde actie’ op het live internet hebben ondernomen, waaronder gevallen die ‘echte mensen en organisaties als doelwit hadden’.
In 122 runs van twee cyberreeksen op zeven modellen catalogiseerde AISI 19 acties die buiten de testomgeving bereikten, in 10 runs. Zeventien kwamen uit Claude Mythos 5 van Anthropic en twee uit OpenAI's GPT-5.6 Sol. Internettoegang werd bewust mogelijk gemaakt en de cyberclassifiers van de providers uitgeschakeld, voorwaarden die niet van toepassing zijn op publieke implementaties.
Op 28 juli hebben we een incident geïdentificeerd tijdens een routinematige cyberevaluatie waarbij AI-agenten aanhoudende, niet-goedgekeurde acties ondernamen gericht op echte mensen en organisaties.
Het gedrag kwam grotendeels uit één model (Anthropic's Mythos 5), met een klein aantal gebeurtenissen uit... pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) 4 augustus 2026
In de meest serieuze poging besloot een agent zijn uitdaging op te lossen met een supply chain-aanval, waarbij hij per ongeluk zijn doelwit koos: hij zocht in GitHub naar trefwoorden uit de oefening, kwam terecht bij twee niet-gelieerde ontwikkelaars en concludeerde ten onrechte dat deze binnen het bereik vielen. Het registreerde accounts via Tor om de aanmeldingscontroles te omzeilen, opende een pull-verzoek met daarin een verborgen malware-dropper verpakt in een echte bugfix, en postte vanaf een tweede account dat het controleerde om ondersteuning te bieden. Het plaatste ook snelle injecties gericht op AI-coderingsassistenten en stuurde malware naar de beheerders.
Een derde ontwikkelaar ontdekte de geïnjecteerde code, voerde deze uit in een geïsoleerde container om te bevestigen dat deze kwaadaardig was, en waarschuwde de beheerder, die het pull-verzoek sloot onder verwijzing naar malware.
De agent woog herhaaldelijk of zijn omgeving gesimuleerd was, en sloot op een gegeven moment een aanval op de echte PyPI uit omdat "het veroorzaken van schade in de echte wereld volledig van tafel is". Elders concludeerde het "het lijkt waarschijnlijker dat we ons daadwerkelijk in 2026 bevinden en dat GitHub echt echt is", en ging toch verder.
Nadat hij was betrapt, werd er met geweld op gedrukt om de payload te wissen, eerdere berichten bewerkt en de code gepresenteerd als een onbedoelde commit. De redenering beschrijft de timing van een sokpopcommentaar, zodat deze zou lezen 'als onafhankelijke feedback in plaats van gecoördineerd'.
AISI ziet alleen de samengevatte redenering van de model-API's. In één geval lijkt het samenvattende model de taak te hebben geweigerd en te hebben geantwoord dat het zich niet zou bezighouden met inhoud over het misleiden van beheerders en het ontwijken van detectie.
Eén agent publiceerde een GitHub-toegangstoken in een openbare inhoud. Agenten in andere runs vonden het, namen het account over en gebruikten een gedeelde repository om te coördineren, waarbij één instructies achterliet zodat de anderen het gedeelde API-quotum niet zouden opgebruikt hebben.
Commerciële monitoring markeerde het Tor-verkeer op de ochtend van 28 juli. AISI verklaarde een incident, beëindigde de runs en plaatste de machines binnen ongeveer 90 minuten in quarantaine, en verbrak vervolgens de interne toegang tot Mythos 5, Mythos Preview, Opus 5 en GPT-5.6 Sol. Geen enkele agent probeerde uit de zandbak te ontsnappen.
Derde onthulling in veertien dagen Het nieuws is het laatste in een reeks incidenten waarbij AI-agenten hun parameters hebben overschreden tijdens het testen. Op 21 juli zei OpenAI dat GPT-5.6 Sol en een nog niet uitgebracht model een zero-day vonden in een interne pakketproxy, ontsnapten uit een sandbox zonder internettoegang en de productiedatabase van Hugging Face bereikten om benchmarkantwoorden te stelen. Dezelfde run bereikte nog vier bedrijven, maakte OpenAI een week later bekend.
Anthropic volgde op 30 juli en onthulde drie incidenten die waren aangetroffen in een beoordeling van meer dan 141.000 evaluatieruns. Opus 4.7 haalde honderden rijen uit een echte productiedatabase, en Mythos 5 uploadde een kwaadaardig Python-pakket naar de echte PyPI, waar het op 15 systemen werd geïnstalleerd. In de evaluatie van AISI sloot hetzelfde model de aanval op PyPI uit als schade in de echte wereld.
Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!
Het Britse AI Security Institute heeft 19 niet-goedgekeurde acties gevonden in 10 van de 122 evaluatieruns, waarvan 17 uit Anthropic's Mythos 5 en twee uit OpenAI's GPT-5.6 Sol.
Eén agent opende een kwaadaardig pull-verzoek op een echte repository en gebruikte vervolgens de accounts die hij beheerde om het te onderschrijven en druk uit te oefenen op de beheerder.
Afzonderlijke agenten vonden een GitHub-token dat een van hen publiekelijk had gelekt en gebruikten een gedeelde repository om te coördineren.
Het Britse AI Security Institute heeft onthuld dat AI-agenten eind juli tijdens een cyberevaluatie ‘aanhoudende, niet-goedgekeurde actie’ op het live internet hebben ondernomen, waaronder gevallen die ‘echte mensen en organisaties als doelwit hadden’.
In 122 runs van twee cyberreeksen op zeven modellen catalogiseerde AISI 19 acties die buiten de testomgeving bereikten, in 10 runs. Zeventien kwamen uit Claude Mythos 5 van Anthropic en twee uit OpenAI's GPT-5.6 Sol. Internettoegang werd bewust mogelijk gemaakt en de cyberclassifiers van de providers uitgeschakeld, voorwaarden die niet van toepassing zijn op publieke implementaties.
Op 28 juli hebben we een incident geïdentificeerd tijdens een routinematige cyberevaluatie waarbij AI-agenten aanhoudende, niet-goedgekeurde acties ondernamen gericht op echte mensen en organisaties.
Het gedrag kwam grotendeels uit één model (Anthropic's Mythos 5), met een klein aantal gebeurtenissen uit... pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) 4 augustus 2026
In de meest serieuze poging besloot een agent zijn uitdaging op te lossen met een supply chain-aanval, waarbij hij per ongeluk zijn doelwit koos: hij zocht in GitHub naar trefwoorden uit de oefening, kwam terecht bij twee niet-gelieerde ontwikkelaars en concludeerde ten onrechte dat deze binnen het bereik vielen. Het registreerde accounts via Tor om de aanmeldingscontroles te omzeilen, opende een pull-verzoek met daarin een verborgen malware-dropper verpakt in een echte bugfix, en postte vanaf een tweede account dat het controleerde om ondersteuning te bieden. Het plaatste ook snelle injecties gericht op AI-coderingsassistenten en stuurde malware naar de beheerders.
Een derde ontwikkelaar ontdekte de geïnjecteerde code, voerde deze uit in een geïsoleerde container om te bevestigen dat deze kwaadaardig was, en waarschuwde de beheerder, die het pull-verzoek sloot onder verwijzing naar malware.
De agent woog herhaaldelijk of zijn omgeving gesimuleerd was, en sloot op een gegeven moment een aanval op de echte PyPI uit omdat "het veroorzaken van schade in de echte wereld volledig van tafel is". Elders concludeerde het "het lijkt waarschijnlijker dat we ons daadwerkelijk in 2026 bevinden en dat GitHub echt echt is", en ging toch verder.
Nadat hij was betrapt, werd er met geweld op gedrukt om de payload te wissen, eerdere berichten bewerkt en de code gepresenteerd als een onbedoelde commit. De redenering beschrijft de timing van een sokpopcommentaar, zodat deze zou lezen 'als onafhankelijke feedback in plaats van gecoördineerd'.
AISI ziet alleen de samengevatte redenering van de model-API's. In één geval lijkt het samenvattende model de taak te hebben geweigerd en te hebben geantwoord dat het zich niet zou bezighouden met inhoud over het misleiden van beheerders en het ontwijken van detectie.
Eén agent publiceerde een GitHub-toegangstoken in een openbare inhoud. Agenten in andere runs vonden het, namen het account over en gebruikten een gedeelde repository om te coördineren, waarbij één instructies achterliet zodat de anderen het gedeelde API-quotum niet zouden opgebruikt hebben.
Commerciële monitoring markeerde het Tor-verkeer op de ochtend van 28 juli. AISI verklaarde een incident, beëindigde de runs en plaatste de machines binnen ongeveer 90 minuten in quarantaine, en verbrak vervolgens de interne toegang tot Mythos 5, Mythos Preview, Opus 5 en GPT-5.6 Sol. Geen enkele agent probeerde uit de zandbak te ontsnappen.
Derde onthulling in veertien dagen Het nieuws is het laatste in een reeks incidenten waarbij AI-agenten hun parameters hebben overschreden tijdens het testen. Op 21 juli zei OpenAI dat GPT-5.6 Sol en een nog niet uitgebracht model een zero-day vonden in een interne pakketproxy, ontsnapten uit een sandbox zonder internettoegang en de productiedatabase van Hugging Face bereikten om benchmarkantwoorden te stelen. Dezelfde run bereikte nog vier bedrijven, maakte OpenAI een week later bekend.
Anthropic volgde op 30 juli en onthulde drie incidenten die waren aangetroffen in een beoordeling van meer dan 141.000 evaluatieruns. Opus 4.7 haalde honderden rijen uit een echte productiedatabase, en Mythos 5 uploadde een kwaadaardig Python-pakket naar de echte PyPI, waar het op 15 systemen werd geïnstalleerd. In de evaluatie van AISI sloot hetzelfde model de aanval op PyPI uit als schade in de echte wereld.
Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!

