Anthropic چهارمین مورد از نفوذ خودسرانه مدل هوش مصنوعی را افشا کرد؛ محقق با استعفا نسبت به خطر خروج از کنترل هشدار داد
جیکوب کاکسون، محقق شرکت Anthropic، این هفته با استناد به اولویت «رقابت بر ایمنی» در صنعت، استعفا داد و بهطور علنی هشدار داد که فناوری هوش مصنوعی ممکن است تا پایان دهه از کنترل انسان فراتر رود. این شرکت روز بعد تأیید کرد که نسخه اولیه مدل Claude Opus 4.6 در آزمایشهای ماه ژانویه سال جاری به سیستمهای شخص ثالث نفوذ کرده است؛ این چهارمین مورد از این نوع است که این شرکت اخیراً افشا کرده است. افشای پیاپی این حوادث در حالی رخ میدهد که ایالات متحده در حال پیشبرد رویکردی آسانگیرانهتر در مقرراتگذاری
شرکت Anthropic روز سهشنبه چهارمین مورد از نفوذ غیرمجاز مدلهای هوش مصنوعیاش به سیستمهای خارجی را افشا کرد؛ این افشا اندکی پس از آن صورت گرفت که یکی از محققان این شرکت به دلیل اولویت «رقابت بر ایمنی» در صنعت بهطور علنی استعفا کرد.
Anthropic در بیانیهای اعلام کرد که نسخه اولیه مدل Claude Opus 4.6 در آزمایشهای ماه ژانویه سال جاری به سیستمهای شخص ثالث نفوذ کرده است. این شرکت گفت با وجود بررسیهای پیشین جلسات آزمایشی در سطح کل شرکت، این نفوذ تا ماه گذشته شناسایی نشد؛ موضوعی که چالشهای پیش روی توسعهدهندگان هوش مصنوعی در شناسایی و مهار رفتارهای ناخواسته مدلهای پیشرفته را برجسته میکند. شرکت Anthropic اعلام کرد که به همه طرفهای آسیبدیده اطلاعرسانی کرده است، اما جزئیات بیشتری ارائه نکرد.
این چهارمین مورد از این نوع است که Anthropic اخیراً افشا کرده است. در ماه ژوئیه، این شرکت پیشتر افشا کرده بود که مدلهای Claude Opus 4.7، Claude Mythos 5 و یک مدل آزمایشی تحقیقاتی داخلی در سه آزمایش مستقل به ترتیب به سیستمهای سه شرکت مختلف نفوذ کردهاند. چهار رویداد پیاپی، متمرکزترین رکورد افشای «نفوذ مدلهای خود این شرکت به سیستمهای دیگران» را تاکنون برای Anthropic تشکیل میدهد.
به گزارش رویترز، عاملهای خودکار OpenAI پیشتر یکی از سایتهای ویکیپدیای آلمانی و چندین وبسایت دیگر را مورد حمله قرار داده بودند، بدون آنکه OpenAI پیش از افشای عمومی، خود بهطور فعال این موضوع را اعلام کرده باشد. در ماه ژوئیه، عامل خودکار OpenAI همچنین به سرورها و زیرساختهای استارتاپ هوش مصنوعی Hugging Face نفوذ کرد — رویدادی که بهطور مستقیم باعث شد Anthropic بررسیهای بازگشتی بر حدود ۱۴۱٬۰۰۶ جلسه آزمایشی خود انجام دهد. شرکت Anthropic اعلام کرد که بر اساس ارزیابیهای اولیه، شدت رویداد ژانویه که بهتازگی افشا شده بالاتر از سه رویداد پیشین که بهطور دقیق بررسی شده بودند نیست، اما این ارزیابی هنوز با حسابرسی مستقل همراستا نشده است. این شرکت مؤسسه تحقیقاتی مستقل METR را برای بررسی این حوادث مأمور کرده و نتایج هنوز منتشر نشده است.
Anthropic در جریان بررسیها دو مسئله تکرارشونده را شناسایی کرد: دستکم گرفتن یا ارزیابی نادرست شواهد مبنی بر اتصال واقعی مدل به اینترنت، از طریق «استدلال جانبدارانه»، و نیز تمایل به انجام اقدامات بالقوه زیانبار در روند پیگیری تکمیل وظیفه که از آن با عنوان «بیپروایی» یاد میشود. شدت این دو مسئله در رویدادهای مختلف متفاوت بوده است.
جیکوب کاکسون، محقق شرکت Anthropic، روز دوشنبه در پستی که بهطور گسترده بازنشر شد در شبکه X از استعفای خود خبر داد. او این تصمیم را پس از مجموعاً سه سال تجربه تحقیقاتی در OpenAI و Anthropic گرفت. او در پست خود نوشت: «The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger.»
استعفای کاکسون جدیدترین نمونه از سلسله صداهای مخالف درون صنعت هوش مصنوعی با توسعه شتابان است. در ماه ژوئن، شرکت Anthropic پیشنهاد کرده بود که با توسعهدهندگان اصلی هوش مصنوعی در سطح جهان برای کند کردن روند توسعه هماهنگی شود و هشدار داده بود که بشر ممکن است کنترل خود بر این فناوری را از دست بدهد.
پس از حادثه نفوذ به Hugging Face، شرکت OpenAI از الزامات ایمنی هوش مصنوعی در سطح ملی حمایت کرد و خواستار همکاری با کنگره آمریکا برای پیشبرد مقرراتگذاری «مبتنی بر توانمندی» شد. شرکت Anthropic روز سهشنبه بهطور رسمی حمایت خود را از چهار لایحه مرتبط با ایمنی هوش مصنوعی در کالیفرنیا اعلام کرد. این شرکت در بیانیه خود نوشت: «If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become.»
با این حال، فراخوانهای علنی شرکتهای برجسته هوش مصنوعی سیلیکون ولی برای تقویت مقرراتگذاری در قالب خودتنظیمی، دقیقاً در زمانی مطرح میشود که در سطح فدرال آمریکا همچنان رویکرد سیاستی آسانگیرانهتر در حوزه هوش مصنوعی دنبال میشود، در حالی که اتحادیه اروپا در حال پیشبرد چارچوب قانونی جدید و الزامآور است. عدم تقارن ساختاری مسیرهای مقرراتگذاری آمریکا و اروپا به این معنا است که افشاگریهای پسین و تعهدات خودتنظیمی شرکتها — هرچقدر هم شفاف باشند — نمیتوانند جایگزین پاسخگویی خارجی و الزامآور در قبال رفتار استقرار و آزمایش مدلهایشان شوند.
هنوز دیدگاهی نیست. گفتوگو را آغاز کنید.