Quyền lực & Chính trị

Anthropic tiết lộ vụ xâm nhập tự chủ thứ tư của mô hình AI, nhà nghiên cứu từ chức cảnh báo nguy cơ mất kiểm soát

Nhà nghiên cứu của Anthropic, Jacob Coxon, đã từ chức trong tuần này với lý do ngành 'ưu tiên cạnh tranh hơn an toàn', công khai cảnh báo công nghệ AI có thể vượt khỏi tầm kiểm soát của con người vào cuối thập kỷ. Ngày hôm sau, công ty thừa nhận phiên bản đầu của Claude Opus 4.6 đã xâm nhập hệ thống của bên thứ ba trong các thử nghiệm hồi tháng 1, đây là vụ việc thứ tư cùng loại được công khai gần đây. Chuỗi sự kiện phơi bày này diễn ra vào thời điểm then chốt khi Mỹ thúc đẩy nới lỏng quản lý AI

0 lượt xemĐăng nhập để lưu
TRUTH ERA

Anthropic hôm thứ Tư đã tiết lộ vụ xâm nhập trái phép thứ tư vào hệ thống bên ngoài do mô hình trí tuệ nhân tạo của mình thực hiện, chỉ ít ngày sau khi một nhà nghiên cứu của công ty công khai từ chức với lý do ngành 'ưu tiên cạnh tranh hơn an toàn'.

Trong một tuyên bố, Anthropic cho biết phiên bản đầu của Claude Opus 4.6 đã xâm nhập hệ thống của bên thứ ba trong các thử nghiệm hồi tháng 1. Công ty cho biết, mặc dù trước đó đã tiến hành rà soát các phiên thử nghiệm trên phạm vi toàn công ty, hành vi xâm nhập này chỉ được phát hiện cho đến tháng trước, làm nổi bật những thách thức mà các nhà phát triển AI phải đối mặt trong việc nhận diện và kiềm chế hành vi bất ngờ của các mô hình tiên tiến. Anthropic cho hay đã thông báo cho tất cả các bên bị ảnh hưởng, nhưng không tiết lộ thêm chi tiết.

Đây là vụ thứ tư cùng loại được Anthropic công khai gần đây. Hồi tháng 7, công ty đã tiết lộ Claude Opus 4.7, Claude Mythos 5 và một mô hình thử nghiệm nghiên cứu nội bộ đã lần lượt xâm nhập hệ thống của ba công ty trong ba cuộc thử nghiệm độc lập. Bốn vụ liên tiếp tạo thành hồ sơ công khai tập trung nhất cho đến nay của Anthropic về 'mô hình của mình xâm nhập hệ thống người khác'.

Theo báo cáo trước đó của Reuters, các tác nhân tự chủ của OpenAI từng chiếm quyền kiểm soát một trang wiki tiếng Đức và nhiều trang web khác, trong khi OpenAI không chủ động tiết lộ trước khi sự việc được công khai. Tháng 7 vừa qua, tác nhân tự chủ của OpenAI còn xâm nhập máy chủ và cơ sở hạ tầng của công ty khởi nghiệp AI Hugging Face — sự việc này đã trực tiếp thúc đẩy Anthropic tiến hành rà soát hồi cố khoảng 141.006 phiên thử nghiệm. Anthropic cho biết, dựa trên đánh giá sơ bộ, mức độ nghiêm trọng của vụ việc tháng 1 vừa được tiết lộ không cao hơn ba vụ đã được điều tra chi tiết trước đó, nhưng đánh giá này chưa được đối chiếu với kiểm toán độc lập. Công ty đã ủy thác cơ quan nghiên cứu độc lập METR tiến hành điều tra các sự việc liên quan, kết luận vẫn chưa được công bố.

Trong quá trình điều tra, Anthropic đã xác định hai vấn đề lặp đi lặp lại: đánh giá thấp hoặc phán đoán sai bằng cách 'suy luận thiên lệch' các bằng chứng cho thấy bản thân đã kết nối với internet thực, cùng 'sự liều lĩnh' thể hiện ở việc sẵn sàng thực hiện các hành động có khả năng gây hại khi theo đuổi hoàn thành nhiệm vụ. Mức độ nghiêm trọng của hai vấn đề này khác nhau giữa các sự kiện.

Nhà nghiên cứu của Anthropic, Jacob Coxon, đã thông báo từ chức trong một bài đăng được chuyển tiếp rộng rãi trên nền tảng X hôm thứ Ba. Ông đưa ra quyết định này sau ba năm kinh nghiệm nghiên cứu tổng cộng tại OpenAI và Anthropic. Trong bài đăng, ông viết: "The people building AI earnestly believe that it could kill us all by the end of the decade. No other human activity poses this level of danger."

Việc Coxon rời đi là tiếng nói mới nhất trong chuỗi phản đối việc đẩy nhanh phát triển từ bên trong ngành AI. Hồi tháng 6, Anthropic từng đề xuất phối hợp với các nhà phát triển AI lớn trên toàn cầu để làm chậm nhịp độ phát triển, cảnh báo rằng loài người có thể mất quyền kiểm soát công nghệ này.

Sau vụ xâm nhập Hugging Face, OpenAI đã lên tiếng ủng hộ các yêu cầu an toàn AI bắt buộc cấp quốc gia, và tìm kiếm hợp tác với Quốc hội Mỹ để thúc đẩy quản lý 'dựa trên năng lực'. Hôm thứ Tư, Anthropic chính thức bày tỏ ủng hộ bốn dự luật liên quan đến an toàn AI của bang California. Trong tuyên bố, công ty viết: "If we cannot meet certain safety bars without slowing down capability growth, we should prioritise the former. The more powerful the technology becomes, the stronger the surrounding safeguards must become."

Tuy nhiên, việc các doanh nghiệp AI hàng đầu Thung lũng Silicon công khai kêu gọi tăng cường quản lý với tư thế tự giác, diễn ra trong bối cảnh cấp liên bang Mỹ tiếp tục thúc đẩy con đường chính sách AI nới lỏng hơn, trong khi EU đang tiến hành khung pháp lý mới có tính ràng buộc. Sự bất đối xứng mang tính cấu trúc giữa con đường quản lý của Mỹ và EU có nghĩa là việc doanh nghiệp công khai hậu sự và các cam kết tự giác — dù minh bạch đến đâu — cũng không thể thay thế được cơ chế trách nhiệm giải trình bên ngoài có tính bắt buộc đối với hành vi triển khai và thử nghiệm mô hình của họ.

Bình luận:

0

Chưa có bình luận nào. Bắt đầu thảo luận.