Nghiên cứu mới phát hiện hơn 1.600 tài liệu trên kho lưu trữ Zenodo sử dụng tên tác giả giả mạo do AI tạo ra. Điều này đặt ra thách thức lớn về tính xác thực và độ tin cậy của dữ liệu trong hệ thống học thuật hiện nay.

Trong kỷ nguyên số, sự phát triển mạnh mẽ của các mô hình ngôn ngữ lớn (LLM) đã mang lại nhiều tiện ích, nhưng cũng kéo theo những hệ lụy nghiêm trọng về tính minh bạch của thông tin. Một nghiên cứu gần đây đã gây chấn động cộng đồng học thuật khi phát hiện hơn 1.655 bản ghi trên nền tảng lưu trữ Zenodo chứa tên tác giả hoàn toàn do AI bịa ra.
Những cái tên như Elena Vasquez hay Marcus Chen xuất hiện với tần suất dày đặc, không phải là tên của các nhà nghiên cứu thực thụ mà là sản phẩm của quá trình tạo nội dung bằng AI. Việc những cái tên này xuất hiện lặp đi lặp lại đã bộc lộ lỗ hổng trong việc kiểm soát dữ liệu đầu vào tại các kho lưu trữ học thuật uy tín.

Điểm nguy hiểm nhất của hiện tượng này không chỉ dừng lại ở việc tạo ra các thông tin sai lệch, mà nằm ở tính hợp thức hóa của chúng. Các tài liệu này thường được cấp mã DOI (Digital Object Identifier) – một tiêu chuẩn quốc tế dùng để nhận diện và trích dẫn tài liệu học thuật chính thống.
Hiện tượng này cho thấy một dạng sai lệch dữ liệu mới. Thay vì chỉ dừng lại ở những lỗi sai trong các cuộc đối thoại với chatbot, thông tin từ AI giờ đây đã có khả năng "xâm nhập" vào hạ tầng lưu trữ lâu dài. Điều này đe dọa trực tiếp đến sự tin tưởng của cộng đồng vào các nguồn tài liệu mở.
Các nhà nghiên cứu cần lưu ý:
Phát hiện này là hồi chuông cảnh báo cho các nhà quản lý hệ thống dữ liệu học thuật. Việc xây dựng một cơ chế kiểm soát chặt chẽ, kết hợp giữa công nghệ phát hiện AI và sự giám sát của con người, là yếu tố then chốt để bảo vệ sự toàn vẹn của nền tảng tri thức trong tương lai.
CÔNG TY TNHH THƯƠNG MẠI DỊCH VỤ HỢP THÀNH THỊNH
Showroom: 406/55 Cộng Hòa, Phường Tân Bình, Thành phố Hồ Chí Minh, Việt Nam.
Giấy CN đăng ký kinh doanh và mã số thuế: 0310583337 do sở Kế hoạch & Đầu tư thành phố Hồ Chí Minh cấp.

Trong kỷ nguyên số, sự phát triển mạnh mẽ của các mô hình ngôn ngữ lớn (LLM) đã mang lại nhiều tiện ích, nhưng cũng kéo theo những hệ lụy nghiêm trọng về tính minh bạch của thông tin. Một nghiên cứu gần đây đã gây chấn động cộng đồng học thuật khi phát hiện hơn 1.655 bản ghi trên nền tảng lưu trữ Zenodo chứa tên tác giả hoàn toàn do AI bịa ra.
Những cái tên như Elena Vasquez hay Marcus Chen xuất hiện với tần suất dày đặc, không phải là tên của các nhà nghiên cứu thực thụ mà là sản phẩm của quá trình tạo nội dung bằng AI. Việc những cái tên này xuất hiện lặp đi lặp lại đã bộc lộ lỗ hổng trong việc kiểm soát dữ liệu đầu vào tại các kho lưu trữ học thuật uy tín.

Điểm nguy hiểm nhất của hiện tượng này không chỉ dừng lại ở việc tạo ra các thông tin sai lệch, mà nằm ở tính hợp thức hóa của chúng. Các tài liệu này thường được cấp mã DOI (Digital Object Identifier) – một tiêu chuẩn quốc tế dùng để nhận diện và trích dẫn tài liệu học thuật chính thống.
Hiện tượng này cho thấy một dạng sai lệch dữ liệu mới. Thay vì chỉ dừng lại ở những lỗi sai trong các cuộc đối thoại với chatbot, thông tin từ AI giờ đây đã có khả năng "xâm nhập" vào hạ tầng lưu trữ lâu dài. Điều này đe dọa trực tiếp đến sự tin tưởng của cộng đồng vào các nguồn tài liệu mở.
Các nhà nghiên cứu cần lưu ý:
Phát hiện này là hồi chuông cảnh báo cho các nhà quản lý hệ thống dữ liệu học thuật. Việc xây dựng một cơ chế kiểm soát chặt chẽ, kết hợp giữa công nghệ phát hiện AI và sự giám sát của con người, là yếu tố then chốt để bảo vệ sự toàn vẹn của nền tảng tri thức trong tương lai.