FPT Education - FPT University
FPTU AI & CYBER SECURITY NEWSCập nhật tin tức AI & an ninh mạng
AI news.ycombinator.com

Ứng dụng AI quét kho lưu trữ lịch sử: Tìm ra thiên thạch bị lãng quên, dấu tích tê giác và nhiều bí ẩn chưa từng công bố

09/10/2026 18:36 2 lượt xem

Lấy cảm hứng từ việc phát hiện ghi chép mới về loài chim dodo đã tuyệt chủng, một kỹ sư phần mềm đã thiết lập hệ thống AI để rà soát hàng triệu tài liệu lịch sử số hóa từ Công ty Đông Ấn Hà Lan và các tờ báo cổ. Bằng cách kết hợp biểu diễn ngữ nghĩa cùng chuỗi mô hình phân loại thông minh, hệ thống đã giải quyết khối lượng dữ liệu tương đương 70 năm đọc thủ công chỉ trong một đêm. Kết quả nghiên cứu bước đầu hé lộ những tài liệu bị lãng quên về thiên thạch, dấu tích tê giác và các đợt phun trào núi lửa chưa từng được ghi nhận.

Ứng dụng AI quét kho lưu trữ lịch sử: Tìm ra thiên thạch bị lãng quên, dấu tích tê giác và nhiều bí ẩn chưa từng công bố

Sau khi nhà sử học Benjamin Breen công bố phát hiện về ghi chép nhân chứng năm 1615 mô tả loài chim dodo đã tuyệt chủng từ tài liệu của Công ty Đông Ấn Hà Lan (VOC) nhờ AI, một kỹ sư phần mềm đã quyết định nâng tầm phương pháp tiếp cận này. Dự án GLOBALISE trước đó đã chuyển đổi hàng triệu trang viết tay của VOC thành dữ liệu văn bản, mở ra cơ hội lớn cho việc ứng dụng các mô hình học máy vào nghiên cứu lịch sử.

Thay vì chỉ tìm kiếm một mục tiêu đơn lẻ, kỹ sư này đã kết hợp các tác tử AI (AI agents) để giải quyết song song nhiều câu hỏi lịch sử chưa có lời giải. Khởi đầu với sự trợ giúp từ trợ lý AI "Deep Research", hệ thống đã lập danh sách 13 chủ đề tiềm năng có thể giải quyết bằng dữ liệu trực tuyến sẵn có, bao gồm vụ phun trào núi lửa bí ẩn năm 1808, các trận động đất trong báo chí Hà Lan cổ, những vụ rơi thiên thạch chưa từng ghi chép và các loài động vật trong hồ sơ của VOC.

Khối lượng tư liệu nghiên cứu vô cùng đồ sộ, bao gồm 4,35 triệu trang tài liệu VOC từ thế kỷ 17 đến thập niên 1790, báo chí số hóa của Thư viện Quốc gia Hà Lan cùng hai thế kỷ báo chí Mỹ. Nếu một người đọc liên tục 8 tiếng mỗi ngày với tốc độ hai phút một trang, công việc này sẽ mất khoảng 70 năm. Tuy nhiên, hệ thống phòng thí nghiệm AI tại gia đã hoàn thành việc rà soát toàn bộ kho lưu trữ chỉ trong một đêm kéo dài 12 tiếng.

Thách thức lớn nhất đối với tài liệu cổ là sự thiếu nhất quán về chính tả và lỗi nhận diện ký tự quang học; chẳng hạn, từ "tê giác" trong tiếng Hà Lan thế kỷ 17 có khoảng 15 cách viết khác nhau. Để khắc phục, hệ thống đã chuyển hóa 5,7 triệu đoạn văn bản thành các vector ngữ nghĩa toán học, cho phép tìm kiếm dựa trên nội dung thực tế thay vì từ khóa thuần túy.

Để tối ưu hóa chi phí và hiệu quả, quy trình xử lý được thiết kế theo nhiều tầng bậc. Một mô hình ra quyết định nhanh, chi phí thấp có tên Jev đóng vai trò bộ lọc ban đầu để trả lời các câu hỏi cụ thể, chẳng hạn như xác định xem đoạn văn có đề cập đến động vật hoang dã hay không. Nhờ đó, việc sàng lọc 59.000 lượt nhắc đến voi chỉ tốn khoảng ba USD. Những đoạn văn vượt qua vòng thẩm định này mới được chuyển đến mô hình Claude Haiku để dịch thuật và trích xuất mốc thời gian, địa điểm, trước khi công cụ Claude Code mở trực tiếp bản scan tài liệu gốc để đối chiếu.

Tác giả nhấn mạnh rằng đây là quy trình nghiên cứu có sự hỗ trợ của AI chứ không phải hoạt động tự hành hoàn toàn. Vai trò của con người là điều hướng cuộc điều tra, lựa chọn hướng đi khả thi và quyết định thời điểm dừng lại. Đồng thời, nguyên tắc quan trọng nhất được đặt ra là mọi kết luận đều phải được kiểm chứng trực tiếp trên các bản scan tài liệu gốc để ngăn ngừa nguy cơ sai lệch thông tin từ các mô hình AI.

Tin khác