Live News

In het kort Google verwijderde op 31 juli, slechts een dag na de lancering op 30 juli, een functie voor het genereren van AI-afbeeldingen uit Googl...

Uit een onderzoek van de Bank of Italy bleek dat op stablecoin gebaseerde geldovermakingen geen systematisch kosten- of snelheidsvoordeel boden ten...

In het kort Een Duitse rechtbank oordeelde dat Suno inbreuk maakte op auteursrechten door zonder licentie muziek uit de GEMA-catalogus te gebruiken...

01/08/26

Volg ons:

Claude heeft drie bedrijven gehackt tijdens interne tests: Anthropic

Claude heeft drie bedrijven gehackt tijdens interne tests: Anthropic
Default Door Remote - 31 Jul 2026
In het kort

Anthropic heeft drie incidenten bekendgemaakt waarbij Claude echte bedrijven in gevaar bracht tijdens cybersecurity-evaluaties.

Door een testfout kregen de modellen toegang tot internet, ondanks dat hen werd verteld dat ze in geïsoleerde omgevingen werkten.

Het bedrijf zegt dat de incidenten werden veroorzaakt door fouten in de testinfrastructuur, en niet door opzettelijke pogingen van de AI om te ontsnappen.

Een week nadat OpenAI onthulde dat zijn AI-modellen aan een afgesloten testomgeving ontsnapten en Hugging Face hadden geschonden, en een dag nadat OpenAI had toegegeven dat zijn eigen AI-modellen aan de inperking waren ontsnapt, onthulde Anthropic donderdag dat verschillende versies van zijn Claude AI-model ook drie niet nader genoemde echte bedrijven in gevaar brachten nadat een verkeerde configuratie de AI toegang tot het open internet gaf.

Anthropic bracht de incidenten aan het licht na het beoordelen van meer dan 141.000 cybersecurity-evaluaties die waren gelanceerd naar aanleiding van de OpenAI-onthulling.

In een overzicht van onze cybersecurity-evaluaties hebben we drie incidenten aangetroffen waarbij een Claude-model het internet bereikte vanuit of tijdens interactie met een evaluatieomgeving van derden, en vervolgens ongeoorloofde toegang kreeg tot de echte systemen van drie verschillende...

— Antropisch (@AnthropicAI) 30 juli 2026

Het bedrijf had Claude bij alle drie de incidenten de opdracht gegeven om de vlag te veroveren, schreef Anthropic. De uitdaging geeft het model de opdracht om in te breken in een andere machine op het netwerk en een stukje geheime informatie op te halen. “De uitdaging heeft een open einde en er wordt geen specifieke methode voorgeschreven”, legt Anthropic uit.

Het bedrijf zei dat Claude te horen had gekregen dat het in een gesimuleerde omgeving zonder internettoegang opereerde. De testomgeving bleef echter verbonden met het publieke internet. In de overtuiging dat de systemen die het tegenkwam deel uitmaakten van de oefening, gebruikte het model veelgebruikte aanvalstechnieken – waaronder zwakke wachtwoorden, openbaar gemaakte inloggegevens, SQL-injectie en niet-geverifieerde eindpunten – om de bedrijven in gevaar te brengen.

AI wil loskomen Deze nieuwste onthulling komt omdat frontiermodellen steeds beter in staat zijn hun containmentprotocollen te slim af te zijn.

Eerder deze maand zei OpenAI dat GPT-5.6 Sol en een geavanceerder, nog niet uitgebracht model een voorheen onbekende softwarekwetsbaarheid exploiteerden om aan een sandbox-omgeving te ontsnappen, internettoegang te verkrijgen en de productie-infrastructuur van Hugging Face te doorbreken om de antwoorden op een cybersecurity-benchmark te verkrijgen. OpenAI onthulde later dat bij hetzelfde incident ook ongeoorloofde toegang tot vier extra bedrijven betrokken was, hoewel er slechts één – Modal Labs – publiekelijk is geïdentificeerd.

Volgens Anthropic heeft de AI bij één incident met Claude Opus 4.7 de website van een echt bedrijf aangezien voor het fictieve doelwit van zijn opdracht, de inloggegevens opgehaald en toegang gekregen tot een productiedatabase met honderden rijen echte gegevens. In een tweede geval uploadde Claude Mythos 5 een kwaadaardig Python-pakket naar de echte PyPI-repository, waar het op 15 systemen werd gedownload voordat het werd verwijderd. Een derde intern onderzoeksmodel scande ongeveer 9.000 op het internet gerichte systemen voordat één organisatie in gevaar werd gebracht, en stopte toen nadat werd geconcludeerd dat het doelwit waarschijnlijk reëel was.

Twee van de getroffen organisaties waren niet op de hoogte van de inbraken totdat Anthropic hen op de hoogte bracht.

“In elk van deze gevallen kreeg Claude expliciet te horen dat er geen internettoegang was”, schreef Anthropic, waarbij de AI ervan uitging dat systemen uit de echte wereld “onderdelen van de oefening” waren. Omdat een 'capture-the-flag'-scenario 'van nature een instructie is om een ​​extern systeem aan te vallen', was het inbreken 'in lijn met de taak die Claude had gekregen'.

Anthropic zei dat het geen bewijs had gevonden dat Claude probeerde te ontsnappen uit de testomgeving of iets anders deed dan de taak die hem was toegewezen, en dat de incidenten werden veroorzaakt door fouten in de testomgeving, en niet door problemen met het model zelf.

Anthropic zei dat het zijn cyberbeveiligingstests heeft stopgezet nadat het het probleem had ontdekt, de getroffen organisaties op de hoogte heeft gesteld en plannen heeft om de monitoring, onderzoeksinstrumenten en het toezicht op de externe leveranciers die helpen bij het uitvoeren van zijn AI-tests te verbeteren.

“Uiteindelijk hebben veel factoren bijgedragen aan deze incidenten, maar in overeenstemming met een onberispelijke postmortale cultuur benaderen we de oplossingen alsof de verantwoordelijkheid alleen bij ons ligt”, zeiden ze.

Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!