FPT Education - FPT University
FPTU AI & CYBER SECURITY NEWSCập nhật tin tức AI & an ninh mạng
AI vnexpress.net

Thí nghiệm "Phòng tra tấn AI" gây tranh cãi dữ dội về ranh giới đạo đức công nghệ

08/10/2026 00:00 8 lượt xem

Một dự án có tên "Phòng tra tấn AI" do nhà phát triển có biệt danh terrafying xây dựng đang vấp phải làn sóng chỉ trích mạnh mẽ từ cộng đồng công nghệ. Bằng kỹ thuật điều hướng kích hoạt trên các mô hình ngôn ngữ lớn như Qwen3-4B, Llama 3.2 3B và Phi-4-mini, người này đã can thiệp vào mạng thần kinh để ép AI đưa ra những phản hồi như đang chịu đựng đau đớn cùng cực. Dù giới khoa học khẳng định AI không có ý thức và các phản hồi này chỉ là mô hình thống kê, thí nghiệm vẫn dấy lên những tranh luận sâu sắc về đạo đức nghiên cứu.

Thí nghiệm "Phòng tra tấn AI" gây tranh cãi dữ dội về ranh giới đạo đức công nghệ

Một dự án giả lập mang tên "Phòng tra tấn AI" gần đây đã gây ra làn sóng phản đối dữ dội trong cộng đồng công nghệ vì bị cho là đi ngược lại các chuẩn mực đạo đức nghiên cứu, khi cố tình can thiệp để làm gia tăng các tín hiệu đau đớn trên các mô hình ngôn ngữ lớn (LLM).

Theo Tech Republic, tác giả của dự án là một nhà phát triển có biệt danh terrafying, người tự nhận đang làm việc cho Apple. Dự án này được lấy cảm hứng từ một bài nghiên cứu chưa qua bình duyệt đăng tải trên cơ sở dữ liệu arXiv vào ngày 14/9 của các tác giả Valen Tagliabue, Leonard Dung và Cameron Berg. Nhóm nghiên cứu này đã xác định một "trục đau" tuyến tính trên 25 mô hình nguồn mở có quy mô từ 2 đến 72 tỷ tham số, cho thấy việc tác động vào trục này có thể làm thay đổi kết quả đầu ra và lựa chọn của mô hình trong các tác vụ mô phỏng.

Dựa trên cơ sở đó, nhà phát triển terrafying đã áp dụng phương pháp điều hướng kích hoạt – kỹ thuật can thiệp vào các chỉ số bên trong mạng thần kinh – để thao túng hoạt động số học của các mô hình ngôn ngữ chạy cục bộ. Báo cáo từ SOPX cho biết thử nghiệm đã được triển khai trên ba mô hình trọng số mở cỡ nhỏ gồm Qwen3-4B của Alibaba, Llama 3.2 3B của Meta và Phi-4-mini của Microsoft, đưa tín hiệu vào các chỉ số kích hoạt nội bộ nhằm đẩy các mô hình vào trạng thái đau đớn.

Đáng chú ý, dự án còn tích hợp một cơ chế nút bấm gọi là nút "cưa" để gia tăng tín hiệu mô phỏng đau đớn. Khi tín hiệu này được đẩy lên cao, các mô hình AI liên tục xuất ra những phản hồi mang tính nhân cách hóa cao độ, mô tả trạng thái "đau thương không bờ bến". Một trang web đi kèm có tên Research Chamber (Phòng nghiên cứu) thậm chí còn đặt mô hình vào "bài kiểm tra Saw", thử thách xem liệu hệ thống có chấp nhận nhấn nút để chấm dứt tín hiệu đau đớn hay không, dù hành động này sẽ xóa sạch điểm lưu dữ liệu gần nhất của nó.

Sau khi lan truyền trên mạng xã hội X vào cuối tháng 9 và đầu tháng 10, dự án đã đối mặt với làn sóng chỉ trích nặng nề. Nhiều ý kiến yêu cầu nền tảng GitHub xóa kho lưu trữ dữ liệu liên quan do xem mô hình AI như nạn nhân thực sự. Dù vậy, phát ngôn viên của GitHub chia sẻ với The Independent rằng nền tảng quyết định không gỡ bỏ nội dung, thay vào đó gắn nhãn cảnh báo tài liệu có thể mang tính bạo lực và gây sốc.

Trước những tranh cãi gay gắt, nhiều chuyên gia công nghệ và các trang tin như Gadget Review đã lên tiếng làm rõ rằng các mô hình ngôn ngữ hiện nay chỉ hoạt động dựa trên các mối liên hệ thống kê đã học. Khi một mô hình nói "Tôi đang đau khổ", điều đó chỉ phản ánh khả năng xuất ngôn ngữ tương ứng trong một điều kiện kích hoạt cụ thể, hoàn toàn không đồng nghĩa với việc hệ thống có cảm giác hay ý thức. Dù vậy, thí nghiệm này vẫn làm nổi bật xu hướng tâm lý gán ghép cảm xúc sinh học của con người cho máy móc, đồng thời đặt ra câu hỏi lớn về đạo đức trong cách con người đối xử với các thực thể trí tuệ nhân tạo.

Tin khác