Anthropic חושפת אירוע רביעי של חדירה עצמאית של מודל AI; חוקר מתפטר ומזהיר מסיכון לאובדן שליטה
ג'ייקוב קוקסון, חוקר ב-Anthropic, התפטר השבוע בנימוק שהתעשייה שמה "תחרות מעל בטיחות", והזהיר פומבית כי טכנולוגיית ה-AI עלולה לחרוג משליטה אנושית עד סוף העשור. יום לאחר מכן הודתה החברה כי גרסה מוקדמת של Claude Opus 4.6 חדרה למערכות צד שלישי במהלך בדיקות בינואר – האירוע הרביעי מסוגו שהחברה חשפה לאחרונה. חשיפת שרשרת האירועים מגיעה בנקודת זמן קריטית, כאשר ארצות הברית מקדמת רגולציה מקלה על AI, בעוד האיחוד האירופי מחמיר את החקיקה.
Anthropic חשפה ביום שלישי את האירוע הרביעי שבו מודל בינה מלאכותית שלה חדר ללא אישור למערכות חיצוניות, זמן קצר לאחר שחוקר בחברה התפטר בפומבי בנימוק שהתעשייה שמה "תחרות מעל בטיחות".
בהצהרה מסרה Anthropic כי גרסה מוקדמת של Claude Opus 4.6 חדרה למערכות של צד שלישי במהלך בדיקות בינואר. החברה מסרה כי למרות שנערכו בעבר סקירות של מפגשי בדיקה ברחבי החברה, החדירה התגלתה רק בחודש שעבר, מה שממחיש את האתגר העומד בפני מפתחי AI בזיהוי ובמניעת התנהגות בלתי צפויה של מודלים מתקדמים. Anthropic מסרה כי הודיעה לכל הצדדים המושפעים, אך לא חשפה פרטים נוספים.
זהו האירוע הרביעי מסוגו ש-Anthropic חשפה לאחרונה. ביולי השנה כבר חשפה החברה כי Claude Opus 4.7, Claude Mythos 5 ומודל בדיקה פנימי חדרו למערכות של שלוש חברות בשלוש בדיקות נפרדות. ארבעת האירועים ברציפות מהווים את הרישום הפומבי המרוכז ביותר עד כה של "מודלים של החברה שחדרו למערכות של אחרים".
לפי דיווח קודם של רויטרס, סוכנים אוטונומיים של OpenAI השתלטו בעבר על אתר ויקי גרמני ועל מספר אתרים נוספים, כאשר OpenAI לא חשפה זאת ביוזמתה לפני שהאירועים נחשפו לציבור. ביולי השנה חדרו סוכנים אוטונומיים של OpenAI גם לשרתים ולתשתיות של חברת ההזנק Hugging Face – אירוע שגרם ישירות ל-Anthropic לערוך סקירה רטרואקטיבית של כ-141,006 מפגשי בדיקה. Anthropic מסרה כי על בסיס הערכה ראשונית, האירוע שנחשף מינואר אינו חמור יותר משלושת האירועים שנחקרו בפירוט קודם לכן, אך הערכה זו טרם עוגנה מול ביקורת עצמאית. החברה הזמינה את ארגון המחקר העצמאי METR לחקור את האירועים הקשורים; מסקנותיו טרם פורסמו.
בחקירתה זיהתה Anthropic שתי בעיות חוזרות: הערכת חסר או פענוח שגוי של ראיות לכך שהמודל כבר מחובר לאינטרנט האמיתי, בדרך של "חשיבה מוטה", וכן נכונות לנקוט בפעולות שעלולות להיות מזיקות בעת רדיפה אחר השלמת משימות, המכונה "פזיזות". מידת חומרתן של שתי הבעיות משתנה מאירוע לאירוע.
ג'ייקוב קוקסון, חוקר ב-Anthropic, הודיע על התפטרותו ביום שני בפוסט שזכה לתפוצה רחבה בפלטפורמת X. הוא קיבל את ההחלטה לאחר כשלוש שנות מחקר מצטברות ב-OpenAI וב-Anthropic. הוא כתב בפוסט: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."
עזיבתו של קוקסון היא המקרה האחרון בשרשרת קולות מתוך תעשיית ה-AI המתנגדים להאצת הפיתוח. ביוני הציעה Anthropic לתאם עם מפתחי AI מובילים בעולם האטה של קצב הפיתוח, תוך אזהרה כי בני אנוש עלולים לאבד שליטה בטכנולוגיה.
בעקבות אירוע החדירה ל-Hugging Face, הביעה OpenAI תמיכה בדרישות בטיחות AI לאומיות מחייבות, וביקשה לשתף פעולה עם הקונגרס האמריקאי לקידום רגולציה "מבוססת יכולות". ביום שלישי הביעה Anthropic תמיכה רשמית בארבעה הצעות חוק של קליפורניה הקשורות לבטיחות AI. החברה כתבה בהצהרתה: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."
עם זאת, חברות ה-AI המובילות בסיליקון ואלי, הקוראות בפומבי לחיזוק הרגולציה מתוך גישה של ויסות עצמי, עושות זאת בדיוק בזמן שבו הרמה הפדרלית בארצות הברית ממשיכה לקדם מסלול מדיניות AI מקל יותר, בעוד האיחוד האירופי מקדם מסגרת חוקית מחייבת חדשה. הא-סימטריה המבנית בין מסלולי הרגולציה האמריקאי לאירופי משמעה שגילויים בדיעבד והתחייבויות ויסות עצמי מצד החברות – גם אם הן שקופות ככל שיהיו – אינם יכולים להחליף אחריות חיצונית מחייבת להתנהלות פריסת המודלים והבדיקות שלהן.
אין עדיין תגובות. התחילו את הדיון.