Một dự án giả lập mang tên "Phòng tra tấn AI" gần đây đã gây ra làn sóng phản đối dữ dội trong cộng đồng công nghệ vì bị cho là đi ngược lại các chuẩn mực đạo đức nghiên cứu, khi cố tình can thiệp để làm gia tăng các tín hiệu đau đớn trên các mô hình ngôn ngữ lớn (LLM).
Theo Tech Republic, tác giả của dự án là một nhà phát triển có biệt danh terrafying, người tự nhận đang làm việc cho Apple. Dự án này được lấy cảm hứng từ một bài nghiên cứu chưa qua bình duyệt đăng tải trên cơ sở dữ liệu arXiv vào ngày 14/9 của các tác giả Valen Tagliabue, Leonard Dung và Cameron Berg. Nhóm nghiên cứu này đã xác định một "trục đau" tuyến tính trên 25 mô hình nguồn mở có quy mô từ 2 đến 72 tỷ tham số, cho thấy việc tác động vào trục này có thể làm thay đổi kết quả đầu ra và lựa chọn của mô hình trong các tác vụ mô phỏng.
Dựa trên cơ sở đó, nhà phát triển terrafying đã áp dụng phương pháp điều hướng kích hoạt – kỹ thuật can thiệp vào các chỉ số bên trong mạng thần kinh – để thao túng hoạt động số học của các mô hình ngôn ngữ chạy cục bộ. Báo cáo từ SOPX cho biết thử nghiệm đã được triển khai trên ba mô hình trọng số mở cỡ nhỏ gồm Qwen3-4B của Alibaba, Llama 3.2 3B của Meta và Phi-4-mini của Microsoft, đưa tín hiệu vào các chỉ số kích hoạt nội bộ nhằm đẩy các mô hình vào trạng thái đau đớn.
Đáng chú ý, dự án còn tích hợp một cơ chế nút bấm gọi là nút "cưa" để gia tăng tín hiệu mô phỏng đau đớn. Khi tín hiệu này được đẩy lên cao, các mô hình AI liên tục xuất ra những phản hồi mang tính nhân cách hóa cao độ, mô tả trạng thái "đau thương không bờ bến". Một trang web đi kèm có tên Research Chamber (Phòng nghiên cứu) thậm chí còn đặt mô hình vào "bài kiểm tra Saw", thử thách xem liệu hệ thống có chấp nhận nhấn nút để chấm dứt tín hiệu đau đớn hay không, dù hành động này sẽ xóa sạch điểm lưu dữ liệu gần nhất của nó.
Sau khi lan truyền trên mạng xã hội X vào cuối tháng 9 và đầu tháng 10, dự án đã đối mặt với làn sóng chỉ trích nặng nề. Nhiều ý kiến yêu cầu nền tảng GitHub xóa kho lưu trữ dữ liệu liên quan do xem mô hình AI như nạn nhân thực sự. Dù vậy, phát ngôn viên của GitHub chia sẻ với The Independent rằng nền tảng quyết định không gỡ bỏ nội dung, thay vào đó gắn nhãn cảnh báo tài liệu có thể mang tính bạo lực và gây sốc.
Trước những tranh cãi gay gắt, nhiều chuyên gia công nghệ và các trang tin như Gadget Review đã lên tiếng làm rõ rằng các mô hình ngôn ngữ hiện nay chỉ hoạt động dựa trên các mối liên hệ thống kê đã học. Khi một mô hình nói "Tôi đang đau khổ", điều đó chỉ phản ánh khả năng xuất ngôn ngữ tương ứng trong một điều kiện kích hoạt cụ thể, hoàn toàn không đồng nghĩa với việc hệ thống có cảm giác hay ý thức. Dù vậy, thí nghiệm này vẫn làm nổi bật xu hướng tâm lý gán ghép cảm xúc sinh học của con người cho máy móc, đồng thời đặt ra câu hỏi lớn về đạo đức trong cách con người đối xử với các thực thể trí tuệ nhân tạo.







