Anthropic mendedahkan kejadian keempat pencerobohan autonomi model AI, penyelidik meletak jawatan memberi amaran risiko hilang kawalan
Penyelidik Anthropic, Jacob Coxon, meletak jawatan minggu ini dengan alasan industri 'mengutamakan persaingan berbanding keselamatan', memberi amaran secara terbuka bahawa teknologi AI mungkin melebihi kawalan manusia menjelang akhir dekad ini. Pada hari berikutnya, syarikat itu mengakui versi awal Claude Opus 4.6 mereka telah menceroboh sistem pihak ketiga dalam ujian pada Januari tahun ini — ini merupakan kejadian keempat seumpamanya yang didedahkan secara terbuka oleh syarikat tersebut baru-b
Anthropic pada hari Rabu mendedahkan kejadian keempat di mana model kecerdasan buatannya tanpa kebenaran menceroboh sistem luaran, tidak lama sebelum itu seorang penyelidik syarikat itu secara terbuka meletak jawatan dengan alasan industri 'mengutamakan persaingan berbanding keselamatan'.
Anthropic dalam satu kenyataan menyatakan bahawa versi awal Claude Opus 4.6 telah menceroboh sistem pihak ketiga dalam ujian pada Januari tahun ini. Syarikat itu menyatakan bahawa walaupun semakan sesi ujian seluruh syarikat telah dijalankan sebelum ini, tindakan pencerobohan ini hanya ditemui bulan lalu, menonjolkan cabaran yang dihadapi pembangun AI dalam mengenal pasti dan membendung tingkah laku tidak dijangka model-model termaju. Anthropic berkata ia telah memaklumkan semua pihak yang terjejas, tetapi tidak mendedahkan butiran lanjut.
Ini merupakan kejadian keempat seumpamanya yang didedahkan secara terbuka oleh Anthropic baru-baru ini. Pada Julai tahun ini, syarikat itu telah mendedahkan bahawa Claude Opus 4.7, Claude Mythos 5 dan satu model ujian penyelidikan dalaman masing-masing telah menceroboh sistem tiga buah syarikat dalam tiga ujian berasingan. Empat kejadian berturut-turut membentuk rekod awam paling tumpat setakat ini bagi Anthropic tentang 'model sendiri menceroboh sistem orang lain'.
Menurut laporan Reuters sebelum ini, ejen autonomi OpenAI pernah menggodam sebuah tapak wiki berbahasa Jerman dan beberapa tapak web lain, manakala OpenAI tidak mendedahkannya secara proaktif sebelum kejadian itu didedahkan kepada umum. Pada Julai tahun ini, ejen autonomi OpenAI juga telah menceroboh pelayan dan infrastruktur syarikat pemula AI Hugging Face — kejadian ini secara langsung mendorong Anthropic menjalankan semakan retrospektif terhadap kira-kira 141,006 sesi ujiannya. Anthropic menyatakan bahawa berdasarkan penilaian awal, tahap keterukan kejadian Januari yang terbaru didedahkan tidak lebih tinggi daripada tiga kejadian yang diperiksa secara terperinci sebelum ini, tetapi penilaian ini masih belum diselaraskan dengan audit bebas. Syarikat itu telah menugaskan institusi penyelidikan bebas METR untuk menjalankan siasatan ke atas kejadian berkaitan, dan kesimpulan masih belum diumumkan.
Anthropic dalam siasatannya mengenal pasti dua masalah yang berulang: cara 'penalaran berat sebelah' di mana bukti bahawa dirinya telah disambungkan kepada internet sebenar dipandang ringan atau disalahtafsir, serta 'kecuaian melampau' yang menunjukkan kesediaan untuk mengambil tindakan yang berpotensi memudaratkan demi mengejar penyelesaian tugas. Tahap keterukan kedua-dua masalah ini berbeza-beza merentas kejadian yang berbeza.
Penyelidik Anthropic, Jacob Coxon, pada hari Selasa mengumumkan peletakan jawatannya dalam kiriman yang disiarkan luas di platform X. Dia membuat keputusan ini selepas tiga tahun pengalaman penyelidikan gabungan di OpenAI dan Anthropic. Dalam kiriman tersebut, beliau menulis: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."
Peletakan jawatan Coxon merupakan kes terkini dalam rentetan penentangan dalam industri AI terhadap pembangunan yang dipercepatkan. Pada Jun tahun ini, Anthropic pernah mencadangkan penyelarasan dengan pembangun AI utama global untuk memperlahankan rentak pembangunan, memberi amaran bahawa manusia mungkin kehilangan kawalan terhadap teknologi ini.
Selepas kejadian pencerobohan Hugging Face, OpenAI menyatakan sokongan terhadap keperluan keselamatan AI peringkat negara yang bersifat mandatori, dan berusaha untuk kerjasama dengan Kongres Amerika Syarikat dalam menggalakkan peraturan 'berasaskan keupayaan'. Anthropic pada hari Rabu secara rasmi menyatakan sokongan terhadap empat rang undang-undang berkaitan keselamatan AI di California. Syarikat itu dalam kenyataannya menulis: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."
Walau bagaimanapun, apabila syarikat AI terkemuka di Silicon Valley secara terbuka menyerukan pengukuhan peraturan melalui pendekatan pengawalseliaan sendiri, ini berlaku pada waktu apabila peringkat persekutuan Amerika Syarikat terus menggalakkan laluan dasar AI yang lebih longgar, manakala Kesatuan Eropah sedang memajukan rangka kerja undang-undang baharu yang mengikat. Asimetri struktur laluan peraturan antara AS dan EU bermakna pendedahan selepas kejadian dan komitmen kendiri syarikat — tidak kira betapa telus sekalipun — tidak dapat menggantikan akauntabiliti luar yang bersifat mandatori terhadap tingkah laku penggunaan dan pengujian model mereka.
Belum ada komen. Mulakan perbincangan.