Trong suốt lịch sử phát triển của học sâu, thuật toán lan truyền ngược (backpropagation) luôn đóng vai trò là nền tảng cốt lõi và là thuật toán phân bổ độ tin cậy duy nhất đủ khả năng huấn luyện các mạng thần kinh hiện đại, bao gồm cả các mô hình ngôn ngữ lớn dựa trên kiến trúc Transformer. Tuy nhiên, lan truyền ngược đòi hỏi tính khả vi và tạo ra các đạo hàm bậc một, khiến các kiến trúc, bộ tối ưu hóa và phần cứng của học sâu bị ràng buộc chặt chẽ vào giới hạn này.
Khi nguồn lực tính toán toàn cầu ngày càng mạnh mẽ, giới công nghệ bắt đầu hướng tới các thuật toán học tập tổng quát và thô bạo (brute-force) hơn dựa trên cơ chế tìm kiếm. "Bài học cay đắng" (The Bitter Lesson) của Richard Sutton đã chỉ ra rằng các phương pháp tổng quát có khả năng mở rộng quy mô theo sức mạnh tính toán cuối cùng sẽ giành chiến thắng, với AlphaGo Zero là minh chứng rõ ràng nhất. Trong khi tính khả vi và lan truyền ngược hoạt động hiệu quả trong điều kiện tài nguyên tính toán hạn chế, chúng lại vô tình thu hẹp không gian kiến trúc có thể hoạt động trong kỷ nguyên siêu tính toán, đồng thời hạn chế khả năng khám phá tối ưu hóa của mô hình.
Nhằm giải quyết bài toán này, các nhà nghiên cứu Samip Dahal, Bishwas Mandal, Serdar Gülbahar và Akshay Vegesna đã phát triển Dust – một thuật toán tối ưu hóa bậc không (zeroth-order optimization) hoạt động dựa trên cơ chế tìm kiếm thô bạo thay cho cấu trúc giải tích truyền thống.
Khác với các phương pháp Chiến lược Tiến hóa (ES) truyền thống thường làm nhiễu loạn trọng số (gây tốn kém chi phí do phải cụ thể hóa và đánh giá từng thành viên trong quần thể), Dust giới thiệu khái niệm "quần thể ảo" (virtual population). Thuật toán này bỏ qua không gian trọng số và trực tiếp làm nhiễu loạn các giá trị kích hoạt (activations) một cách độc lập tại mỗi token. Theo cơ chế này, mỗi token đóng vai trò như một thành viên của quần thể, cho phép một lượt truyền xuôi duy nhất có thể đánh giá song song tất cả các thành viên. Dust sẽ chấm điểm cho từng sự nhiễu loạn dựa trên mức độ giảm thiểu tổn thất (loss) mà nó mang lại, sau đó tính trung bình trọng số phần thưởng của các nhiễu loạn trên toàn bộ quần thể để ước tính gradient.
Các nghiên cứu về khả năng diễn giải cơ chế (mechanistic interpretability) cho thấy quá trình suy luận của mô hình thực chất nằm ở các giá trị kích hoạt. Do đó, việc tìm kiếm trên không gian kích hoạt của Dust có thể chuyển đổi quá trình huấn luyện thành một hoạt động tìm kiếm trực tiếp trên các suy luận ẩn (latent reasoning). Thuật toán này kết hợp cơ chế nhiễu loạn không gian kích hoạt với một quy tắc phân bổ độ tin cậy tổng quát, gán các phần thưởng cấp độ token khác nhau cho từng loại lớp khác nhau trong khối Transformer.
Mục tiêu hiện tại của nghiên cứu là đặt nền móng cho một thuật toán phân bổ độ tin cậy dựa trên tìm kiếm có khả năng cạnh tranh sòng phẳng với lan truyền ngược trên tác vụ thách thức nhất: tiền huấn luyện (pretraining) các mô hình Transformer. Nhóm tác giả cho biết họ chưa đặt mục tiêu tối ưu hóa hiệu năng tính toán của Dust để thay thế hoàn toàn lan truyền ngược ở thời điểm hiện tại, cũng như chưa thử nghiệm trên các loại mạng thần kinh mới mà thuật toán này có thể mở đường khai phá, chẳng hạn như các hệ thống tích hợp chương trình bên ngoài hoặc các mô hình Transformer lặp qua nhiều bước.







