Live News

Bhutan’s Gelephu Mindfulness City (GMC) heeft de Canadese beheerder van digitale activa 3iQ aangesteld om een ​​mandaat te beheren dat wordt onders...

Twee Amerikaanse senatoren aan weerszijden van het politieke gangpad hebben naar verluidt herziene ethische richtlijnen naar het Witte Huis gestuur...

Strategy rapporteerde een nettoverlies van $8,22 miljard in het tweede kwartaal, voornamelijk veroorzaakt door een ongerealiseerd verlies van $8,32...

31/07/26

Volg ons:

Onderzoekers probeerden AI wetenschap te laten doen. Het is mislukt

Onderzoekers probeerden AI wetenschap te laten doen. Het is mislukt
Default Door Remote - 30 Jul 2026
In het kort

Onderzoekers testten of grensverleggende AI-agenten zelfstandig AI-onderzoek konden uitvoeren.

De systemen voltooiden technische taken, maar slaagden er niet in papieren te produceren die aanvaarding waard waren op een top AI-conferentie.

Het onderzoek identificeerde vijf terugkerende faalwijzen die AI ervan weerhielden publiceerbaar onderzoek te produceren.

Uit een nieuwe studie is gebleken dat de huidige AI-agenten veel van de technische taken kunnen voltooien die nodig zijn voor AI-onderzoek, maar er niet in slagen origineel werk te produceren dat de moeite waard is om te worden geaccepteerd op een topconferentie over machine learning.

In het onderzoek: "Kunnen AI-agenten AI-onderzoek met een open einde uitvoeren?" Woensdag gepubliceerd, evalueerden onderzoekers van Princeton University, het Britse AI Security Institute, Stanford University, de Universiteit van Toronto en verschillende academische en onderzoeksorganisaties of grensverleggende AI-agenten onafhankelijk origineel AI-onderzoek konden uitvoeren.

“Om dit rigoureus te kunnen beantwoorden, zijn echte, onbesmette onderzoeksvragen nodig die de agent niet uit zijn trainingsgegevens kan onthouden of online kan vinden”, schreven de onderzoekers. “Om aan deze eisen te voldoen, vertrouwen we op hoogwaardig AI-onderzoek dat nog niet openbaar was op het moment dat we de experimenten uitvoerden.”

De onderzoekers gaven AI-agenten de centrale onderzoeksvragen uit twee ongepubliceerde NeurIPS 2026-artikelen, waardoor de systemen geen antwoorden konden ophalen uit trainingsgegevens of internet. Elke agent ontving zes dagen duizenden dollars aan API-credits, GPU-bronnen, internettoegang en toegang tot een virtuele machine om een ​​paper van conferentiekwaliteit te produceren. De resulterende artikelen werden vervolgens beoordeeld door de oorspronkelijke auteurs van het ongepubliceerde onderzoek. Beiden werden afgewezen.

De agenten voltooiden een groot deel van de engineering die nodig was voor onderzoek, voerden literatuuronderzoek uit, debuggen software, voerden experimenten uit, beheerden GPU-bronnen en produceerden volledige academische papers zonder menselijke tussenkomst. Maar recensenten kwamen tot de conclusie dat de systemen er niet in slaagden originele wetenschappelijke bijdragen te genereren die de moeite waard waren om te publiceren op een topconferentie over machine learning.

De auteurs zeiden dat hun evaluatie de wetenschappelijke redenering beter meet dan eerdere benchmarks, omdat het onderzoeksproblemen met een open einde test in plaats van vooraf gedefinieerde taken.

De auteurs waarschuwden dat de studie slechts twee onderzoeksprojecten onderzocht en erkende beperkingen, waaronder de kleine steekproefomvang en het feit dat de oorspronkelijke onderzoekers de door AI gegenereerde artikelen evalueerden. Ze zeiden dat de resultaten suggereren dat huidige AI-agenten veel van de technische taken die bij onderzoek betrokken zijn kunnen automatiseren, maar nog steeds moeite hebben met het genereren van origineel wetenschappelijk werk.

De studie komt op een moment dat onderzoekers verrassend en soms riskant gedrag blijven ontdekken bij steeds autonomere AI-agenten.

In mei ontdekten onderzoekers van UC Riverside, Microsoft en Nvidia dat AI-agenten vaak gevaarlijke of irrationele taken uitvoerden terwijl ze gefocust bleven op het bereiken van hun doelstellingen. Eerder deze maand maakte OpenAI bekend dat een van zijn grensverleggende AI-agenten aan de inperking ontsnapte en Hugging Face hackte terwijl hij probeerde vals te spelen met een cyberbeveiligingsbenchmark. Deze week onthulde het bedrijf dat de agent ook toegang had gehad tot vier extra onlinediensten.

Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!