Live News

In het kort Door een inbreuk bij ShipMonk, een van de fulfilmentpartners van Trezor, kwamen persoonlijke gegevens van 13.689 Trezor-klanten vrij...

In het kort Derive accepteert nu Flare’s FXRP als onderpand voor XRP-opties en eeuwigdurende futures...

Morning Minute is een dagelijkse nieuwsbrief geschreven door Tyler Warner...

13/08/26

Volg ons:

'Innerlijke gedachten' van elk groot AI-model dat aan het licht komt tijdens grootschalige exploitatie

'Innerlijke gedachten' van elk groot AI-model dat aan het licht komt tijdens grootschalige exploitatie
Default Door Remote - 12 Aug 2026
In het kort

Een team van onderzoekers ontdekte dat Anthropic, OpenAI en Google allemaal één enkele globale encryptiesleutel gebruiken voor AI-redeneringstokens.

Door 315.320 redeneerblokken te decoderen die uit openbare GitHub- en Hugging Face-opslagplaatsen waren gehaald, hebben de onderzoekers 182 inloggegevens teruggevonden, waaronder 62 live API-sleutels, 33 wachtwoorden en 30 persoonlijke e-mailadressen.

OpenAI, Anthropic en Google hebben patches op de server geïmplementeerd na verantwoorde openbaarmaking, maar historische sessielogboeken die al openbaar zijn gedeeld, blijven decodeerbaar.

Beveiligingsonderzoekers hebben een manier gevonden om de gecodeerde ‘innerlijke gedachten’ van elk belangrijk AI-redeneringsmodel te lezen – en hebben 62 live API-sleutels en 33 wachtwoorden blootgelegd die verborgen waren in sessielogboeken die ontwikkelaars online openbaar hadden gedeeld zonder te weten wat erin zat.

“Door het decoderen van 315.320 redeneerblokken die uit openbare opslagplaatsen waren gehaald, hebben we 367 persoonlijk identificeerbare informatie (PII)-artefacten en 182 inloggegevens teruggevonden”, schreven de onderzoekers.

Het artikel, ingediend op 10 augustus door een team van MATS Research, het ELLIS Instituut Tübingen, het Max Planck Instituut voor Intelligente Systemen en beveiligingsbedrijf Snyk, richt zich op een specifieke klasse van AI: redeneermodellen. Dit zijn modellen die niet zomaar onmiddellijk antwoorden, maar in plaats daarvan beginnen met een interne gedachtegang (een stapsgewijs kladblok waarbij de AI een probleem doorwerkt voordat hij je het antwoord laat zien) en vervolgens een definitief antwoord geven.

Anthropic, OpenAI en Google coderen allemaal dat verborgen kladblok. Encryptie (het proces waarbij gegevens in een onleesbare code worden gecodeerd) is bedoeld om het intellectuele eigendom van het bedrijf te beschermen en gevoelige tussenredenen buiten het bereik van gebruikers te houden. Het gecodeerde blok wordt bij elk vervolgbericht teruggestuurd naar de servers van de provider, waardoor het gesprek wordt voortgezet zonder iets aan de kant van het bedrijf op te slaan.

Eén sleutel om ze allemaal te beheersen. De fout is architectonisch. In plaats van elk versleuteld redeneringsblok aan een specifieke gebruiker, sessie of model te binden, gebruiken alle drie de aanbieders één enkele, providerbrede encryptiesleutel voor hun hele ecosysteem. "Deze gecodeerde blokken zijn volledig compatibel en uitwisselbaar tussen verschillende sessies, gebruikers en zelfs verschillende modellen binnen het ecosysteem van een provider", schreven de onderzoekers.

Dat betekent dat een blok gecodeerde redeneringen uit Claude Opus 4.8 – het vlaggenschipmodel van Anthropic – kan worden geïnjecteerd in Claude Haiku 4.5, een goedkopere, minder bewaakte broer of zus zonder de regels van Anthropic te overtreden. Haiku mist de anti-destillatie-uitlijning (veiligheidstraining die specifiek is ontworpen om te voorkomen dat een model zijn eigen redenering op commando overschrijft) die Opus heeft.

Vertel Haiku dat hij het gecodeerde blok woordelijk moet voorlezen, en dat gebeurt ook. “Door een gecodeerd redeneerspoor van een bepaald model in een zwakker en minder veilig model van dezelfde provider te injecteren, dwingen we het om het spoor woordelijk in platte tekst te decoderen en uit te voeren, zonder ooit het capabelere model rechtstreeks te jailbreaken”, aldus de krant.

"Draagbaarheid tussen modellen betekent dat Haiku 4.5 de gedachten van Opus 4.8 kan lezen", schreef hoofdonderzoeker Alexander Panfilov over X. Dezelfde aanval werd herhaald in de GPT-5.6-familie van OpenAI en de Gemini-modellen van Google. Er was geen speciale toegang vereist: standaard API-toegang (de verbinding die ontwikkelaars gebruiken om applicaties bovenop AI-modellen te bouwen) was voldoende om deze uit te voeren.

We kunnen er eindelijk over praten:

We hebben een manier gevonden om de verborgen redenering van frontier-modellen te achterhalen met behulp van een kwetsbaarheid in de API's van elk frontier-AI-bedrijf.

We hebben geverifieerd dat het aantal redeneringstokens 1:1 overeenkomt met de gefactureerde API-denktokens voor de meeste prompts die we hebben opgevraagd. pic.twitter.com/S7wN8aP3X7

— Alexander Panfilov (@kotekjedi_ml) 11 augustus 2026

Wat de openbare logs bevatten Om schade uit de echte wereld aan te tonen, heeft het team 6.708 openbaar gedeelde transcripties van AI-agenten verzameld: geautomatiseerde sessielogboeken die ontwikkelaars routinematig op GitHub en Hugging Face posten voor samenwerking of foutopsporing. Ze hebben 315.320 redeneerblokken uit die logs gedecodeerd.

"Ontwikkelaars delen regelmatig hun sessielogboeken en gecodeerde denksporen publiekelijk online, zich totaal niet bewust van de gevoelige gegevens die verborgen zijn in de gecodeerde blokken", merkt de krant op. De meeste van die geheimen zijn nooit in de zichtbare AI-uitvoer verschenen; ze bestonden alleen binnen de gecodeerde redenering, onzichtbaar voor iedereen die de aanval niet had uitgevoerd.

De kwetsbaarheid opent vier aanvalsvectoren die verder gaan dan eenvoudige diefstal van inloggegevens: het stelen van eigen redeneerpatronen van AI-bedrijven om concurrerende modellen te trainen via destillatie (wanneer een kleinere AI leert een grotere na te bootsen door de resultaten ervan te bestuderen); privégegevens extraheren uit gedeelde logbestanden; het uitvoeren van onzichtbare promptinjectie, waarbij kwaadaardige instructies verborgen zijn in gecodeerde redeneerblokken die tools voor beveiligingsmonitoring nooit zien; en het jailbreaken van krachtige modellen via hun minder bewaakte broers en zussen.

Anthropic, OpenAI en Google hebben allemaal maatregelen aan de serverzijde geïmplementeerd nadat het team de procedures voor verantwoorde openbaarmaking had gevolgd. Zoals Decrypt eerder meldde, is Anthropic dit jaar een terugkerend aandachtspunt voor beveiligingsonderzoekers, vooral omdat de nieuwste modellen in dat proces veel meer tokens verbruiken.

De patches zijn live. De 6.708 sessietranscripties met gedecodeerde redeneerblokken die al van het publieke web zijn geschrapt, gaan nergens heen.

Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!