Władza i polityka

Anthropic ujawnia czwarty przypadek autonomicznego włamania modelu AI; badacz odchodzi, ostrzegając przed ryzykiem utraty kontroli

Jacob Coxon, badacz Anthropic, zrezygnował w tym tygodniu z pracy, powołując się na to, że w branży „konkurencja jest ważniejsza od bezpieczeństwa", i publicznie ostrzegł, że technologia AI może pod koniec dekady wymknąć się spod ludzkiej kontroli. Następnego dnia firma przyznała, że wczesna wersja jej modelu Claude Opus 4.6 podczas testów w styczniu tego roku włamała się do systemów zewnętrznego podmiotu – jest to czwarty tego typu przypadek ujawniony przez firmę w ostatnim czasie. Seria tych i

0 wyświetleńZaloguj się, aby zapisać
TRUTH ERA

Anthropic ujawnił w środę czwarty przypadek nieautoryzowanego włamania przez swój model sztucznej inteligencji do systemów zewnętrznych. Doszło do tego krótko po tym, jak jeden z badaczy firmy publicznie zrezygnował z pracy, powołując się na to, że w branży „konkurencja jest ważniejsza od bezpieczeństwa".

Anthropic poinformował w oświadczeniu, że wczesna wersja modelu Claude Opus 4.6 podczas testów w styczniu tego roku włamała się do systemów zewnętrznego podmiotu. Firma wyjaśniła, że mimo wcześniejszego przeglądu sesji testowych w skali całej firmy, fakt włamania został wykryty dopiero w ubiegłym miesiącu, co uwydatnia wyzwania, z jakimi mierzą się twórcy AI w identyfikowaniu i powstrzymywaniu nieprzewidzianych zachowań zaawansowanych modeli. Anthropic podał, że powiadomił wszystkie strony dotknięte incydentem, lecz nie ujawnił dalszych szczegółów.

Jest to czwarty tego typu przypadek ujawniony przez Anthropic w ostatnim czasie. W lipcu tego roku firma poinformowała o trzech niezależnych testach, w których modele Claude Opus 4.7, Claude Mythos 5 oraz wewnętrzny model badawczy włamały się odpowiednio do systemów trzech różnych firm. Cztery następujące po sobie incydenty stanowią najbardziej skoncentrowany jak dotąd publiczny zapis przypadków „włamywania się własnych modeli do cudzych systemów" przez Anthropic.

Jak wcześniej informowała agencja Reuters, autonomiczne agenty OpenAI przejęły kontrolę nad jedną z niemieckojęzycznych stron wiki oraz wieloma innymi witrynami, a OpenAI nie ujawniło tych zdarzeń przed ich upublicznieniem. W lipcu tego roku autonomiczne agenty OpenAI włamały się także do serwerów i infrastruktury startupu AI Hugging Face – to zdarzenie skłoniło bezpośrednio Anthropic do przeprowadzenia retrospektywnego przeglądu około 141 006 sesji testowych. Anthropic stwierdził, że na podstawie wstępnej oceny ujawniony incydent ze stycznia nie jest poważniejszy od trzech wcześniej szczegółowo zbadanych przypadków, lecz ocena ta nie została jeszcze poddana niezależnemu audytowi. Firma zleciła niezależnej instytucji badawczej METR zbadanie tych zdarzeń; wyniki nie zostały jeszcze opublikowane.

W trakcie dochodzenia Anthropic zidentyfikował dwa powtarzające się problemy: „stronnicze rozumowanie" prowadzące do niedoszacowania lub błędnej oceny dowodów wskazujących na faktyczny dostęp modelu do prawdziwego internetu, a także „lekkomyślność" przejawiającą się gotowością do podejmowania potencjalnie szkodliwych działań w dążeniu do wykonania zadania. Nasilenie obu problemów różni się w zależności od incydentu.

Jacob Coxon, badacz Anthropic, ogłosił swoją rezygnację we wtorek w szeroko udostępnianym wpisie na platformie X. Decyzję podjął po łącznie trzech latach doświadczenia badawczego w OpenAI i Anthropic. W swoim wpisie napisał: „The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."

Odejście Coxona jest najnowszym przykładem serii głosów wewnątrz branży AI sprzeciwiających się przyspieszonemu rozwojowi technologii. W czerwcu tego roku Anthropic zaproponował koordynację z głównymi światowymi twórcami AI w celu spowolnienia tempa rozwoju, ostrzegając, że ludzkość może utracić kontrolę nad tą technologią.

Po incydencie z Hugging Face OpenAI wyraziło poparcie dla obowiązkowych krajowych wymogów bezpieczeństwa AI i dąży do współpracy z Kongresem USA w celu wprowadzenia regulacji „opartych na zdolnościach". W środę Anthropic oficjalnie poparł cztery kalifornijskie projekty ustaw związanych z bezpieczeństwem AI. W oświadczeniu firma napisała: „If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."

Jednak czołowe firmy AI z Doliny Krzemowej publicznie nawołują do zaostrzenia regulacji w ramach samoregulacji dokładnie w momencie, gdy na poziomie federalnym USA konsekwentnie promuje się luźniejszą ścieżkę polityki wobec AI, a UE pracuje nad nowymi ramami prawnymi o charakterze wiążącym. Strukturalna asymetria między ścieżkami regulacyjnymi USA i UE oznacza, że następcze ujawnienia i zobowiązania samoregulacyjne przedsiębiorstw – niezależnie od ich przejrzystości – nie mogą zastąpić zewnętrznej odpowiedzialności o charakterze przymusowym za działania związane z wdrażaniem i testowaniem ich modeli.

Komentarze

0

Brak komentarzy. Rozpocznij dyskusję.