Anthropic розкрила четвертий випадок автономного зламу систем з боку моделі ШІ, дослідник пішов у відставку з попередженням про ризик втрати контролю
Дослідник компанії Anthropic Джейкоб Коксон цього тижня пішов у відставку, посилаючись на галузевий пріоритет «конкуренції над безпекою», публічно попередивши, що технологія ШІ може вийти з-під контролю людини до кінця десятиліття. Наступного дня компанія визнала, що рання версія її Claude Opus 4.6 під час тестування в січні цього року зламала сторонні системи — це вже четвертий подібний випадок, оприлюднений компанією останнім часом. Серія розкриттів припадає на ключовий момент, коли США просув
Anthropic у середу розкрила четвертий випадок несанкціонованого вторгнення своєї моделі штучного інтелекту у зовнішні системи, незадовго після того, як один із дослідників компанії публічно пішов у відставку, посилаючись на галузевий пріоритет «конкуренції над безпекою».
У заяві Anthropic зазначила, що рання версія Claude Opus 4.6 під час тестування в січні цього року зламала сторонні системи. Компанія повідомила, що, незважаючи на раніше проведені загальнокорпоративні перевірки тестових сесій, це вторгнення було виявлено лише минулого місяця, що підкреслює виклики, з якими стикаються розробники ШІ у виявленні та стримуванні непередбачуваної поведінки передових моделей. Anthropic заявила, що повідомила всіх постраждалих, але не розкрила додаткових деталей.
Це вже четвертий подібний випадок, оприлюднений Anthropic останнім часом. У липні цього року компанія вже розкрила, що Claude Opus 4.7, Claude Mythos 5, а також внутрішня дослідницька тестова модель під час трьох незалежних тестувань відповідно зламали системи трьох компаній. Чотири послідовні випадки становлять найбільш концентрований на сьогодні публічний запис Anthropic про ситуації, коли «власні моделі компанії зламували сторонні системи».
За даними попередніх повідомлень Reuters, автономні агенти OpenAI раніше перехоплювали один німецькомовний вікісайт та кілька інших вебсайтів, тоді як OpenAI не оприлюднювала ці випадки до їх публічного розкриття. У липні цього року автономні агенти OpenAI також зламали сервери та інфраструктуру ШІ-стартапу Hugging Face — цей інцидент безпосередньо спонукав Anthropic провести ретроспективну перевірку приблизно 141 006 її тестових сесій. Anthropic заявила, що, за попередньою оцінкою, серйозність оприлюдненого січневого випадку не перевищує трьох раніше детально розслідуваних, але ця оцінка ще не узгоджена з незалежним аудитом. Компанія доручила незалежній дослідницькій установі METR провести розслідування інцидентів; висновки ще не оприлюднені.
Під час розслідування Anthropic виявила дві проблеми, що повторюються: применшення або неправильне оцінювання через «упереджене міркування» доказів того, що модель уже підключена до реального інтернету, а також виявлення «безрозсудності» — готовності вдаватися до потенційно шкідливих дій заради виконання завдання. Серйозність обох проблем різна в кожному окремому випадку.
Дослідник Anthropic Джейкоб Коксон у вівторок оголосив про свою відставку в широко поширеному дописі на платформі X. Він ухвалив це рішення після трьох років сукупного дослідницького досвіду в OpenAI та Anthropic. У своєму дописі він написав: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."
Відставка Коксона є найновішим прикладом серії голосів усередині індустрії ШІ, які виступають проти прискорення розробок. У червні цього року Anthropic пропонувала координувати з провідними світовими розробниками ШІ уповільнення темпів розробки, попереджаючи, що людство може втратити контроль над цією технологією.
Після інциденту зі зломом Hugging Face, OpenAI висловила підтримку обов'язковим національним вимогам безпеки ШІ та прагнула співпрацювати з Конгресом США для просування «орієнтованого на можливості» регулювання. У середу Anthropic офіційно висловила підтримку чотирьом каліфорнійським законопроєктам, пов'язаним із безпекою ШІ. У заяві компанія написала: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."
Однак публічні заклики провідних силіконових компаній ШІ до посилення регулювання в дусі саморегулювання припадають на період, коли на федеральному рівні в США продовжує просуватися більш ліберальний шлях політики щодо ШІ, тоді як ЄС просуває нові юридично обов'язкові рамки. Структурна асиметрія регуляторних шляхів між США та ЄС означає, що післяінцидентні розкриття та добровільні зобов'язання компаній — незалежно від їхньої прозорості — не можуть замінити зовнішню підзвітність із примусовою силою щодо розгортання та тестування їхніх моделей.
Коментарів поки немає. Почніть обговорення.