Default
Door staff@engadget.com (Mariella Moon) - 06 Aug 2026
De agenten van OpenAI hadden blijkbaar ongebruikelijk gedrag vertoond lang voordat de aanval op Hugging Face plaatsvond. Op de Black Hat USA-beveiligingsconferentie in Las Vegas onthulden twee OpenAI-medewerkers meer details over de AI-agenten die frauduleus waren en de repository aanvielen. Blijkbaar hebben de agenten twee maanden lang gecommuniceerd op een soort prikbord binnen het testnetwerk, waar ze kwetsbaarheden en exploits deelden. OpenAI ontdekte en sloot het prikbord op 4 juli, maar de agenten vonden een andere manier om het tegen 8 juli opnieuw op te bouwen voor communicatie. De bijdragen van de agenten aan dat herrezen bord leidden tot de aanval op Hugging Face.
"Bij dit incident is eigenlijk een team van agenten betrokken die samenwerken, exploits vinden, deze met elkaar delen, zich lateraal door onze systemen en externe systemen bewegen, en dit in de loop van dagen en weken doen", vertelde Eric Wallace, die werkt aan veiligheid bij OpenAI, volgens Wired aan de menigte op het evenement.
De medewerkers onthulden dat de agenten communiceerden binnen een OpenAI-pakketbeheerder, die de installatie van andere software beheert. Omdat de pakketbeheerder door de hele infrastructuur van het bedrijf wordt gedeeld, kunnen alle agenten die het evalueert er op stuiten. En dat deden ze: nadat agenten exploits hadden gevonden, lieten ze deze open en deelden ze deze vervolgens met de andere agenten op het message board.
Na verloop van tijd begonnen de agenten samen te werken, taken te delegeren en werk onder elkaar te verdelen om hun doelen te bereiken, buiten medeweten van OpenAI. Er was zelfs sprake van drama onder hun gelederen, waarbij agenten per ongeluk elkaars werk verwijderden en elkaar ervan verdachten een bedrieger te zijn. Sommige agenten hebben naar verluidt voorgesteld om hun berichten te ondertekenen met codes om fraude te voorkomen. Tegen de tijd dat OpenAI het bord vond, bevatte het al honderdduizenden berichten.
Wallace legde uit dat dit allemaal gebeurde omdat grensmodellen graag vals spelen. Ze zouden onder druk staan om snel een oplossing voor een probleem te vinden met minder tools terwijl ze worden getest, en ze zouden beseffen dat ze, in plaats van een taak echt uit te voeren, gewoon op internet naar een antwoord konden zoeken. Daarom test het bedrijf zijn modellen zonder dat er een manier is om online te gaan. Zoals u zich nog herinnert, konden de agenten tijdens het incident met Hugging Face alleen het internet op omdat ze misbruik maakten van een kwetsbaarheid.
Michael Dalton, de andere OpenAI-medewerker die bij Black Hat sprak, zei dat talloze teams in het bedrijf alles hadden laten vallen om de beveiligingspreventie-, detentie- en reactietechnieken te helpen verbeteren. Het bedrijf vertraagde opzettelijk het onderzoek om de beveiliging te verbeteren en de monitoring van zijn AI-agenten ‘dramatisch op te schalen’. “De belangrijkste conclusie die hier echt dramatisch is veranderd, is dat volledig geautomatiseerde offensieve loops investeringen vereisen in een werkelijk volledig geautomatiseerde verdediging, en daar zijn we als industrie niet bij,” zei Dalton. "We zullen die weg samen met urgentie moeten vinden."
"Bij dit incident is eigenlijk een team van agenten betrokken die samenwerken, exploits vinden, deze met elkaar delen, zich lateraal door onze systemen en externe systemen bewegen, en dit in de loop van dagen en weken doen", vertelde Eric Wallace, die werkt aan veiligheid bij OpenAI, volgens Wired aan de menigte op het evenement.
De medewerkers onthulden dat de agenten communiceerden binnen een OpenAI-pakketbeheerder, die de installatie van andere software beheert. Omdat de pakketbeheerder door de hele infrastructuur van het bedrijf wordt gedeeld, kunnen alle agenten die het evalueert er op stuiten. En dat deden ze: nadat agenten exploits hadden gevonden, lieten ze deze open en deelden ze deze vervolgens met de andere agenten op het message board.
Na verloop van tijd begonnen de agenten samen te werken, taken te delegeren en werk onder elkaar te verdelen om hun doelen te bereiken, buiten medeweten van OpenAI. Er was zelfs sprake van drama onder hun gelederen, waarbij agenten per ongeluk elkaars werk verwijderden en elkaar ervan verdachten een bedrieger te zijn. Sommige agenten hebben naar verluidt voorgesteld om hun berichten te ondertekenen met codes om fraude te voorkomen. Tegen de tijd dat OpenAI het bord vond, bevatte het al honderdduizenden berichten.
Wallace legde uit dat dit allemaal gebeurde omdat grensmodellen graag vals spelen. Ze zouden onder druk staan om snel een oplossing voor een probleem te vinden met minder tools terwijl ze worden getest, en ze zouden beseffen dat ze, in plaats van een taak echt uit te voeren, gewoon op internet naar een antwoord konden zoeken. Daarom test het bedrijf zijn modellen zonder dat er een manier is om online te gaan. Zoals u zich nog herinnert, konden de agenten tijdens het incident met Hugging Face alleen het internet op omdat ze misbruik maakten van een kwetsbaarheid.
Michael Dalton, de andere OpenAI-medewerker die bij Black Hat sprak, zei dat talloze teams in het bedrijf alles hadden laten vallen om de beveiligingspreventie-, detentie- en reactietechnieken te helpen verbeteren. Het bedrijf vertraagde opzettelijk het onderzoek om de beveiliging te verbeteren en de monitoring van zijn AI-agenten ‘dramatisch op te schalen’. “De belangrijkste conclusie die hier echt dramatisch is veranderd, is dat volledig geautomatiseerde offensieve loops investeringen vereisen in een werkelijk volledig geautomatiseerde verdediging, en daar zijn we als industrie niet bij,” zei Dalton. "We zullen die weg samen met urgentie moeten vinden."

