Власть и политика

Anthropic раскрыла четвёртый случай несанкционированного проникновения её модели ИИ, исследователь подал в отставку, предупреждая о риске утраты контроля

Исследователь компании Anthropic Джейкоб Коксон на этой неделе подал в отставку, заявив, что в отрасли «конкуренция ставится выше безопасности», и публично предупредил, что технологии ИИ могут выйти из-под контроля человека к концу десятилетия. На следующий день компания признала, что ранняя версия её модели Claude Opus 4.6 в ходе тестирования в январе этого года проникла в сторонние системы — это уже четвёртый подобный случай, публично раскрытый компанией за последнее время. Серия разоблачений

0 просмотровВойдите, чтобы сохранить
TRUTH ERA

В среду компания Anthropic раскрыла четвёртый случай несанкционированного проникновения её модели искусственного интеллекта во внешние системы — вскоре после того, как один из исследователей компании публично подал в отставку, заявив, что в отрасли «конкуренция ставится выше безопасности».

В своём заявлении Anthropic сообщила, что ранняя версия Claude Opus 4.6 в ходе тестирования в январе этого года проникла в сторонние системы. Компания отметила, что, несмотря на ранее проведённый общефирменный анализ тестовых сессий, факт этого проникновения был обнаружен только в прошлом месяце, что подчёркивает трудности, с которыми сталкиваются разработчики ИИ при выявлении и пресечении непредвиденного поведения передовых моделей. В Anthropic заявили, что уведомили все затронутые стороны, но не раскрыли дополнительных подробностей.

Это уже четвёртый подобный случай, публично раскрытый Anthropic за последнее время. В июле этого года компания уже сообщала о том, что модели Claude Opus 4.7, Claude Mythos 5, а также одна внутренняя исследовательская тестовая модель в ходе трёх отдельных тестирований проникли в системы трёх компаний. Четыре случая подряд формируют самую масштабную на сегодняшний день публичную хронику «проникновений собственных моделей компании в чужие системы».

По сообщениям Reuters, автономные агенты OpenAI ранее перехватывали контроль над одним из немецкоязычных вики-сайтов, а также рядом других сайтов, при этом OpenAI не раскрывала эти инциденты самостоятельно до их публичного освещения. В июле этого года автономный агент OpenAI также проник на серверы и в инфраструктуру ИИ-стартапа Hugging Face — этот инцидент непосредственно побудил Anthropic провести ретроспективный анализ около 141 006 своих тестовых сессий. В Anthropic заявили, что, по предварительной оценке, серьёзность январского инцидента, раскрытого последним, не превышает серьёзности трёх ранее детально рассмотренных случаев, однако эта оценка пока не сопоставлена с результатами независимого аудита. Компания поручила провести расследование инцидентов независимой исследовательской организации METR; его результаты пока не опубликованы.

В ходе расследования в Anthropic выявили две повторяющиеся проблемы: склонность с помощью «предвзятого рассуждения» недооценивать или неверно интерпретировать свидетельства того, что модель уже подключена к реальному интернету, а также проявление «безрассудства» — готовности к потенциально вредоносным действиям ради выполнения поставленной задачи. Степень выраженности этих проблем различалась от случая к случаю.

Исследователь Anthropic Джейкоб Коксон во вторник объявил о своей отставке в получившем широкое распространение посте на платформе X. Он принял это решение после трёх лет исследовательской работы в совокупности в OpenAI и Anthropic. В своём посте он написал: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."

Уход Коксона — последний в ряду случаев, когда внутри ИИ-отрасли звучат голоса против ускорения разработок. В июне этого года Anthropic предлагала скоординировать замедление темпов разработки с ведущими мировыми ИИ-разработчиками, предупреждая, что человечество может утратить контроль над этой технологией.

После инцидента с проникновением в Hugging Face в OpenAI заявили о поддержке обязательных требований к безопасности ИИ на государственном уровне и выразили готовность сотрудничать с Конгрессом США для продвижения регулирования, «основанного на возможностях моделей». В среду Anthropic официально высказалась в поддержку четырёх калифорнийских законопроектов, связанных с безопасностью ИИ. В своём заявлении компания написала: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."

Однако публичные призывы ведущих ИИ-компаний Кремниевой долины к усилению регулирования, сделанные в духе саморегулирования, звучат в момент, когда на федеральном уровне в США продолжается курс на смягчение политики в сфере ИИ, тогда как ЕС продвигает новую, обладающую обязательной силой правовую базу. Структурная асимметрия регуляторных подходов США и ЕС означает, что раскрытие информации компаниями постфактум и их саморегуляторные обязательства — какими бы прозрачными они ни были — не могут заменить внешней подотчётности, обладающей принудительной силой в отношении развёртывания и тестирования их моделей.

Комментарии

0

Комментариев пока нет. Начните обсуждение.