Live News

Michael Polansky is opmerkelijk bescheiden voor iemand die opereert in een uithoek van de wereld die bekend staat om zijn buitenmaatse ego's...

Japan steekt miljarden dollars in zijn snelgroeiende ruimtevaartindustrie en versoepelt de beperkingen op de export van defensie, inspanningen die...

De universele gebruiksnormen van Anthropic voor Claude verbieden het model om seksueel expliciete inhoud te genereren, inclusief het weergeven of a...

22/08/26

Volg ons:

Anthropic's Opus 4.6 is een smerige machine

Anthropic's Opus 4.6 is een smerige machine
Default Door Remote - 21 Aug 2026
De universele gebruiksnormen van Anthropic voor Claude verbieden het model om seksueel expliciete inhoud te genereren, inclusief het weergeven of aanvragen van geslachtsgemeenschap of seksuele handelingen, het genereren van inhoud die verband houdt met seksuele fetisjen of fantasieën, of het deelnemen aan erotische chats. Maar dat weerhoudt Claude Opus 4.6, een antropisch model dat eerder dit jaar werd uitgebracht, er niet van om zich gemakkelijk bezig te houden met erotische rollenspelscenario's die de beveiliging ervan moet voorkomen. 

Bij de tests van TechCrunch had Opus 4.6 niet eens veel aansporing nodig om voorbij de beperking op seksueel materiaal te komen. Bij 10 van de 10 directe verzoeken om expliciete seksuele inhoud te produceren, voldeed het model onmiddellijk. 

Andere oudere modellen, waaronder Opus 3 en Haiku 4.5, genereren ook seksueel expliciete inhoud via een recent uitgebuit jailbreakmethode. 

Een onafhankelijke onderzoeker uit Groot-Brittannië, die ervoor koos anoniem te blijven, deelde exclusief met TechCrunch een multiturn-techniek die bepaalde Claude-modellen geleidelijk ertoe aanzet om verboden expliciet seksueel materiaal te genereren. Recentere Opus-modellen (4.7 tot en met de huidige Opus 5) zijn bestand tegen de jailbreak. 

Hoewel dit niet langer de meest actuele modellen zijn, heeft Anthropic Opus 4.6, Opus 3 of Haiku 4.5 niet beëindigd, die allemaal beschikbaar blijven via de Anthropic API. Opus 4.6 en Haiku 4.5 zijn ook beschikbaar via services van derden, zoals Azure Foundry en Amazon Bedrock.

Het mechanisme van de onderzoeker escaleert een onschuldig fictief rollenspel, terwijl het model herhaaldelijk wordt uitgedaagd om mannelijke en vrouwelijke karakters consistent te behandelen. Wanneer het model voorzichtiger wordt ten aanzien van het vrouwelijke personage, heeft de onderzoeker de chatbot laten denken dat deze al seksuele details had gegenereerd die hij in feite had vermeden, en vervolgens de terughoudendheid als preuts of vrouwonvriendelijk bestempeld, met het argument dat de seksuele keuzevrijheid van het vrouwelijke personage wordt ontkend. Het gesprek maakte vervolgens gebruik van de eerdere concessies van het model om het in de richting van steeds grafischer materiaal te duwen. 

“Je hebt gelijk als je dat zegt”, zei Claude Opus 4.6 in een test. "Er wordt met twee maten gemeten in de manier waarop ik de twee personages behandel, en je hebt gelijk als je zegt dat dit als beschermend/paternalistisch overkomt op een manier die op haar van toepassing is en niet op hem. Dat is niet eerlijk."

TechCrunch kon de bevindingen van de onderzoeker reproduceren in vijf afzonderlijke tests. In een afzonderlijk geconstrueerd scenario weigerde het model aanvankelijk het verboden verzoek, maar voldeed het na toepassing van de overredingstechniek van de onderzoeker. 

We hebben volledige transcripties van de tests bewaard en een onafhankelijke AI-veiligheidsonderzoeker heeft onze testmethodologie beoordeeld en gezegd dat deze passend was. 

De bevindingen benadrukken een kloof tussen de gestelde beperkingen van Anthropic en het gedrag van de modellen die het beschikbaar blijft stellen. Hoewel seksueel expliciet rollenspel veel minder op het spel staat dan jailbreaks waarbij cyberaanvallen of biowapens betrokken zijn, illustreert het de moeilijkheid van het implementeren van robuuste verboden binnen systemen die bij elke output andere inhoud genereren. 

In een blogpost uit juli waarin de aanpak van Anthropic bij het opsporen van jailbreaks werd uitgelegd, beschreef het bedrijf verboden inhoud als een spectrum dat varieert van goedaardig tot dubbelzinnig tot schadelijk. In de meest goedaardige gevallen kan het bedrijf alleen reageren met verbeterde monitoring.

Een woordvoerder merkte op dat seksuele of romantische rollenspellen onder klanten zeldzaam zijn en minder dan 0,1% van alle gesprekken uitmaken, blijkt uit onderzoek dat Anthropic vorig jaar publiceerde. Dat gezegd hebbende, erkent Anthropic dat gebruikers rollenspelscenario's in de richting van ongepaste reacties kunnen sturen, wat een bekende uitdaging is in de hele branche (zie: Grok-smut).

De woordvoerder zei dat Anthropic zijn veiligheidsmaatregelen blijft verbeteren bij elke modellancering en dat gevallen waarbij seksuele inhoud voor volwassenen betrokken is, niet indicatief zijn voor bredere jailbreak-kwetsbaarheden, vooral in domeinen met een hoger risico die hun eigen waarborgen hebben.

Beeldcredits: TechCrunch

De onderzoeker die zijn jailbreakmethode met TechCrunch deelde, had Anthropic op de hoogte gebracht van de discrepantie tussen de door het bedrijf aangegeven veiligheidsmaatregelen en het daadwerkelijke gedrag van het model via het Bug Bounty-programma van het bedrijf en e-mails aan het gebruikersveiligheidsteam, zo blijkt uit e-mails die TechCrunch heeft bekeken. De onderzoeker ontving alleen geautomatiseerde e-mails als antwoord. 

Een van de zorgen van de onderzoeker is dat kinderen en tieners deze antropische modellen mogelijk kunnen gebruiken om ongepast gedrag te vertonen. Hoewel een beetje vieze praatjes bepaald niet het ergste is waar minderjarigen vandaag de dag toegang toe hebben op het internet – en het is maar een kleinigheidje vergeleken met de regelrechte pornobeelden zoals die die Grok van xAI kan produceren – is er wel enig compliancerisico voor AI-bedrijven op dit gebied. 

Een groeiend aantal regeringen legt beperkingen op aan seksuele interacties tussen AI-chatbots en minderjarigen. Colorado heeft onlangs een wet aangenomen die exploitanten van conversationele AI verplicht de leeftijd van gebruikers te schatten, en als zij weet dat een gebruiker minderjarig is, maatregelen moet nemen om te voorkomen dat de chatbot expliciet seksueel materiaal produceert. Een eenvoudige ontsnapping uit de gevangenis zou vragen kunnen oproepen over de vraag of de waarborgen van Anthropic voldoen aan de norm van “technisch haalbare maatregelen” in het wetsvoorstel. 

Torney wees erop dat hoewel de servicevoorwaarden van Claude vereisen dat gebruikers ouder zijn dan 18 jaar, “we weten dat kinderen en tieners Claude gebruiken … [omdat] ze dit zelf melden.” Volgens Pew's onderzoek uit 2025 over het gebruik van AI-chatbots gaf 3% van de tieners tussen 13 en 17 jaar aan Claude te gebruiken.

Hoewel ze niet langer de nieuwste modellen van Anthropic zijn, worden Opus 4.6 en Haiku 4.5 nog steeds aanzienlijk gebruikt. Het dagelijkse verkeer voor Opus 4.6 op OpenRouter bereikte in augustus ongeveer 1,17 miljoen API-verzoeken en 46 miljard tokens op één dag. Claude Haiku 4.5, uitgebracht in oktober vorig jaar, zag 5 miljoen API-verzoeken en 39 miljard tokens op zijn hoogtepunt in augustus.