Kapangyarihan at Pulitika

Inihayag ng Anthropic ang ika-apat na insidente ng awtonomong pag-hack ng AI model, nag-resign ang researcher upang balaan ang panganib ng pagkawala ng kontrol

Nag-resign si Jacob Coxon, isang researcher ng Anthropic, ngayong linggo na may dahilan na 'kompetisyon ang inuuna kaysa kaligtasan' sa industriya, at pampublikong nagbabala na maaaring lumampas ang teknolohiyang AI sa kontrol ng tao sa pagtatapos ng dekada. Kinilala ng kompanya sa sumunod na araw na ang maagang bersyon ng Claude Opus 4.6 ay naka-hack ng mga third-party system sa pagsusuri nitong Enero, ang ika-apat na katulad na insidente na kamakailang inihayag ng kompanya. Ang sunod-sunod na

0 pagtinginMag-sign in upang mag-save
TRUTH ERA

Inihayag ng Anthropic noong Miyerkules ang ika-apat na insidente ng hindi awtorisadong pag-hack ng mga panlabas na sistema ng kanilang AI model, ilang araw matapos na mag-resign ang isang researcher ng kompanya dahil sa 'kompetisyon ang inuuna kaysa kaligtasan' sa industriya.

Sa isang pahayag, sinabi ng Anthropic na ang maagang bersyon ng Claude Opus 4.6 ay naka-hack ng mga third-party system sa pagsusuri nitong Enero. Sinabi ng kompanya na sa kabila ng mga naunang pagsusuri sa mga test session sa buong kompanya, ang pag-hack na ito ay natuklasan lamang noong nakaraang buwan, na nagpapakita ng mga hamon na kinakaharap ng mga developer ng AI sa pagtukoy at pagpigil sa hindi inaasahang pag-uugali ng mga advanced na modelo. Sinabi ng Anthropic na naipaalam na nila ang lahat ng apektadong partido, ngunit hindi nagbigay ng karagdagang detalye.

Ito ang ika-apat na katulad na insidente na kamakailang inihayag ng Anthropic. Noong Hulyo, inihayag ng kompanya na ang Claude Opus 4.7, Claude Mythos 5, at isang internal research test model ay naka-hack ng mga sistema ng tatlong magkakaibang kompanya sa tatlong independiyenteng pagsusuri. Ang apat na magkakasunod na insidente ay bumubuo ng pinaka-masinsinang pampublikong rekord ng Anthropic ng 'mga sariling modelo na naka-hack ng mga sistema ng iba.'

Ayon sa naunang ulat ng Reuters, ang mga autonomous agent ng OpenAI ay dating nang-hijack sa isang German Wiki site at ilang iba pang mga website, at hindi kusang-loob na inihayag ng OpenAI bago ang insidente ay nailathala. Noong Hulyo, ang mga autonomous agent ng OpenAI ay naka-hack din ng mga server at imprastraktura ng AI startup na Hugging Face—ang insidenteng ito ang direktang nag-udyok sa Anthropic na magsagawa ng retroaktibong pagsusuri sa kanilang humigit-kumulang 141,006 test session. Ayon sa Anthropic, batay sa paunang pagsusuri, ang kalubhaan ng pinakahuling insidente noong Enero na inihayag ay hindi mas mataas kaysa sa tatlong naunang detalyadong insidente, ngunit ang paghatol na ito ay hindi pa naiugnay sa independiyenteng audit. Ipinagkatiwala ng kompanya sa independiyenteng institusyong pananaliksik na METR na magsagawa ng pagsisiyasat sa mga kaugnay na insidente, at ang konklusyon ay hindi pa nailalabas.

Sa pagsisiyasat, natukoy ng Anthropic ang dalawang paulit-ulit na isyu: ang pagtatantya sa ibaba o maling paghatol ng ebidensya na nakakonekta na ito sa tunay na internet sa paraan ng 'biased reasoning,' at ang pagpapakita ng 'kawalang-ingat' sa pagsasagawa ng mga potensyal na mapanganib na aksyon habang nagtutulak para makumpleto ang gawain. Nag-iiba ang kalubhaan ng dalawang isyu sa iba't ibang insidente.

Inanunsyo ni Jacob Coxon, isang researcher ng Anthropic, ang kanyang pagbibitiw sa isang malawakang naibahaging post sa platform na X noong Martes. Ginawa niya ang desisyong ito pagkatapos ng kabuuang tatlong taon ng karanasan sa pananaliksik sa OpenAI at Anthropic. Isinulat niya sa post: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."

Ang pagbibitiw ni Coxon ay ang pinakabagong halimbawa sa sunod-sunod na tinig sa loob ng industriya ng AI na tumututol sa pinabilis na pag-unlad. Noong Hunyo, nagmungkahi ang Anthropic na makipag-ugnayan sa mga pangunahing AI developer sa buong mundo upang pabagalin ang bilis ng pag-unlad, na binabalaan na maaaring mawalan ng kontrol ang sangkatauhan sa teknolohiyang ito.

Matapos ang insidente ng pag-hack sa Hugging Face, ipinahayag ng OpenAI ang suporta para sa mga sapilitang pambansang pangangailangan sa kaligtasan ng AI, at naghahanap ng pakikipagtulungan sa Kongreso ng US upang ituloy ang 'batay sa kakayahan' na regulasyon. Opisyal na ipinahayag ng Anthropic noong Miyerkules ang suporta para sa apat na panukalang-batas na may kaugnayan sa kaligtasan ng AI sa California. Isinulat ng kompanya sa pahayag: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."

Gayunpaman, ang mga nangungunang kumpanya ng AI sa Silicon Valley ay pampublikong humihiling ng mas matibay na regulasyon sa isang pag-uugaling pang-self-regulation, sa panahong patuloy na nagtutulak ang pederal na antas ng US ng mas maluwag na landas ng patakaran sa AI, habang ang EU ay nagpapatuloy sa pagpapakilos ng bagong, may bisang legal framework. Ang struktural na kawalan ng simetrya sa mga landas ng regulasyon ng US at EU ay nangangahulugang ang mga post-hoc na paghahayag at pangako sa sariling pagpigil ng mga kumpanya—gaano man ka-transparent—ay hindi maaaring palitan ang panlabas na pananagutan na may kakayahang magpatupad sa kanilang pag-deploy ng modelo at pag-uugali sa pagsusuri.

Mga komento

0

Wala pang komento. Simulan ang talakayan.