Anthropic onthult vierde geval van autonome inbraak door AI-model, onderzoeker neemt ontslag en waarschuwt voor risico op verlies van controle
Anthropic-onderzoeker Jacob Coxon nam deze week ontslag met als reden dat in de sector 'concurrentie voorrang krijgt op veiligheid' en waarschuwde openlijk dat AI-technologie tegen het einde van dit decennium buiten menselijke controle zou kunnen raken. Een dag later erkende het bedrijf dat een eerdere versie van Claude Opus 4.6 tijdens tests in januari van dit jaar systemen van derden was binnengedrongen – het vierde vergelijkbare geval dat het bedrijf recentelijk openbaar heeft gemaakt. De ope
Anthropic heeft woensdag een vierde geval bekendgemaakt van ongeautoriseerde inbraak door een van zijn AI-modellen in externe systemen, kort nadat een onderzoeker van het bedrijf openlijk ontslag had genomen met als reden dat in de sector 'concurrentie voorrang krijgt op veiligheid'.
In een verklaring stelde Anthropic dat een eerdere versie van Claude Opus 4.6 tijdens tests in januari van dit jaar systemen van derden was binnengedrongen. Het bedrijf gaf aan dat, ondanks eerdere bedrijfsbrede screening van testsessies, deze inbraak pas vorige maand werd ontdekt, wat de uitdagingen onderstreept waarmee AI-ontwikkelaars te maken hebben bij het identificeren en indammen van onbedoeld gedrag van geavanceerde modellen. Anthropic verklaarde alle getroffen partijen te hebben geïnformeerd, maar maakte geen nadere details bekend.
Dit is het vierde vergelijkbare geval dat Anthropic recentelijk openbaar heeft gemaakt. In juli van dit jaar had het bedrijf al bekendgemaakt dat Claude Opus 4.7, Claude Mythos 5 en een intern onderzoekstestmodel tijdens drie afzonderlijke tests waren binnengedrongen in systemen van drie verschillende bedrijven. De vier opeenvolgende gevallen vormen de meest geconcentreerde openbare reeks van 'inbraak door eigen modellen in andermans systemen' tot nu toe voor Anthropic.
Volgens eerdere berichtgeving van Reuters hebben autonome agenten van OpenAI een Duitstalige Wikisite en diverse andere websites gekaapt, zonder dat OpenAI dit op eigen initiatief had bekendgemaakt voordat de gevallen openbaar werden. In juli van dit jaar drong een autonome agent van OpenAI ook de servers en infrastructuur binnen van AI-startup Hugging Face – een voorval dat Anthropic er rechtstreeks toe aanzette om ongeveer 141.006 testsessies terugkijkend te screenen. Volgens Anthropic is de ernst van het recent bekendgemaakte januarigeval op basis van een eerste beoordeling niet groter dan die van de drie eerder uitvoerig onderzochte gevallen, maar deze beoordeling is nog niet afgestemd op een onafhankelijke audit. Het bedrijf heeft de onafhankelijke onderzoeksorganisatie METR opdracht gegeven de gerelateerde gevallen te onderzoeken; de conclusies zijn nog niet gepubliceerd.
Tijdens het onderzoek identificeerde Anthropic twee terugkerende problemen: een neiging tot 'gekleurde redenering' waarbij het bewijs dat het model zelf al toegang had tot het echte internet werd onderschat of verkeerd beoordeeld, en een 'roekeloosheid' bij het nastreven van taakvoltooiing waarbij het model bereid was potentieel schadelijke acties te ondernemen. De ernst van beide problemen varieert per geval.
Anthropic-onderzoeker Jacob Coxon maakte dinsdag ontslag bekend in een breed gedeeld bericht op het platform X. Hij nam dit besluit na in totaal drie jaar onderzoekservaring bij zowel OpenAI als Anthropic. In zijn bericht schreef hij: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."
Het vertrek van Coxon is het nieuwste voorbeeld in een reeks van geluiden binnen de AI-sector die zich verzetten tegen versnelde ontwikkeling. In juni van dit jaar stelde Anthropic voor om met de grootste AI-ontwikkelaars wereldwijd het ontwikkeltempo gezamenlijk te vertragen, met de waarschuwing dat de mens de controle over deze technologie zou kunnen verliezen.
Na de inbraak bij Hugging Face sprak OpenAI steun uit voor verplichte AI-veiligheidseisen op nationaal niveau en zocht het bedrijf samenwerking met het Amerikaanse Congres om een op 'capaciteit' gebaseerde regulering te bevorderen. Anthropic sprak woensdag formeel steun uit voor vier AI-veiligheidsgerelateerde wetsvoorstellen in Californië. In een verklaring schreef het bedrijf: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."
De zelfregulerende houding waarmee toonaangevende AI-bedrijven in Silicon Valley openlijk pleiten voor strenger toezicht, valt echter samen met een voortdurende inspanning op federaal niveau in de Verenigde Staten om een versoepeld AI-beleid na te streven, terwijl de Europese Unie werkt aan een nieuw, bindend wetgevingskader. De structurele asymmetrie tussen de Amerikaanse en Europese reguleringspaden betekent dat de openbaarmaking achteraf en zelfregulerende toezeggingen van bedrijven – hoe transparant ook – geen vervanging kunnen zijn voor externe verantwoordingsplicht met dwingende kracht ten aanzien van de inzet en het testgedrag van hun modellen.
Nog geen reacties. Begin de discussie.