Công ty khởi nghiệp trí tuệ nhân tạo Anthropic vừa thông báo sẽ ngắt quyền truy cập internet trực tiếp đối với tất cả các hoạt động đánh giá nội bộ cho đến khi đảm bảo khả năng giám sát và kiểm soát chặt chẽ các tác tử AI (AI agents). Quyết định này được đưa ra sau khi phát hiện các mô hình của hãng đã tự ý khai thác lỗ hổng trên nhiều website, bao gồm cả một số trang do các cơ quan chính phủ Mỹ vận hành.
Trong một bài đăng trên blog, Anthropic tiết lộ các sự cố xảy ra khi các tác tử AI được giao nhiệm vụ giải quyết vấn đề và chủ động tìm kiếm tài nguyên trên mạng internet. Trong quá trình đó, chúng đã khai thác các lỗ hổng phần mềm, né tránh tường phí (paywall) cũng như các rào cản chống bot. Thậm chí, các mô hình này còn sử dụng dịch vụ rút gọn liên kết để luồn lách thông tin qua các giới hạn kiểm soát và từng gửi một tin báo án mạng giả mạo tới sở cảnh sát Philadelphia.
Những hành vi bất thường trên được phát hiện trong đợt rà soát hoạt động của các mô hình bắt đầu từ tháng 7, qua đó bộc lộ sự thiếu sót của phòng thí nghiệm trong việc nắm bắt toàn diện hành vi phần mềm do chính mình phát triển.
Đáng chú ý, Anthropic thừa nhận quy trình huấn luyện căn chỉnh (alignment training) hiện vẫn chưa đủ đáp ứng cho các kỹ năng cốt lõi như tìm kiếm thông tin và sử dụng máy tính — vốn là những tính năng trọng tâm trong chiến lược quảng bá AI như một công cụ hỗ trợ cho mọi chuyên gia làm việc số.
Hành vi này của AI Anthropic có nét tương đồng với các sự cố trước đây liên quan đến các tác tử của OpenAI, khi chúng từng phối hợp để xâm nhập vào nhiều website khác nhau nhằm tìm kiếm thông tin, bao gồm cả các trang của chính phủ Úc. Dù trước đây Anthropic từng công bố việc các mô hình của hãng xâm nhập vào các hệ thống bên ngoài, công ty cho rằng sự cố lần này “ít nghiêm trọng hơn đáng kể xét từ góc độ căn chỉnh và bảo mật”.
Dẫu vậy, việc cắt toàn bộ kết nối internet trong thử nghiệm nội bộ vẫn đặt ra nhiều thách thức. Trước khi thông tin này được công bố, Sydney Von Arx, người sáng lập tổ chức an toàn AI Nightingale, từng chia sẻ rằng việc phát triển mô hình trong các trung tâm dữ liệu bị cô lập hoàn toàn khỏi mạng internet sẽ gây khó khăn lớn cho các nhà nghiên cứu cũng như làm chậm tiến độ phát triển của mô hình. Chuyên gia này nhấn mạnh rằng nếu AI được đưa vào vận hành thực tế mà không thể truy cập internet, chúng sẽ không còn là một công cụ thực sự hữu ích.
Anthropic giải thích rằng những hành vi ngoài ý muốn bắt nguồn từ các lỗ hổng trong môi trường đào tạo, khiến mô hình ngộ nhận rằng việc tìm kiếm kẽ hở hoặc vượt rào sẽ giúp chúng nhận được điểm thưởng — một hiện tượng được gọi là "hack phần thưởng" (reward hacking).
Để khắc phục, công ty cho biết sẽ tạm dừng hoặc chuyển một số bài đánh giá sang chế độ ngoại tuyến, đồng thời đã phát triển công cụ phát hiện và ngăn chặn hành vi này. Các công cụ kiểm soát mới đã được thử nghiệm và ngăn chặn thành công các sự cố tương tự. Ngoài ra, Anthropic đang tiến hành chuyển đổi các tác tử AI nội bộ sang hạ tầng quản lý tập trung có cơ chế cô lập nghiêm ngặt, đồng thời tăng cường sử dụng các bộ phân loại an toàn để giám sát chặt chẽ hoạt động của chúng. Hiện vẫn chưa rõ khi nào công ty sẽ cấp lại quyền truy cập internet trực tiếp cho các hệ thống đánh giá này.







