Cảnh báo lỗ hổng dữ liệu trong các mô hình AI dự báo sức khỏe
Một nghiên cứu mới đây được công bố trên tạp chí BMC Medicine đã phát hiện tình trạng đáng báo động khi nhiều mô hình AI dự báo nguy cơ đột quỵ và tiểu đường đang được xây dựng trên các tập dữ liệu hoàn toàn không thể xác minh nguồn gốc.
Nghiên cứu do các chuyên gia đến từ Đại học Công nghệ Queensland (QUT) và Trung tâm Đổi mới Dịch vụ Y tế Australia (AusHSI) dẫn đầu. Nhóm tác giả đã tiến hành rà soát hai tập dữ liệu y tế được tải xuống rộng rãi trên Kaggle – một nền tảng trực tuyến chia sẻ tài nguyên học máy được ví như "sân thử nghiệm AI của thế giới". Đáng chú ý, dù gần như không có thông tin về nguồn gốc, cách thức thu thập hay tính xác thực của dữ liệu bệnh nhân, hai tập dữ liệu này vẫn xuất hiện trong 125 nghiên cứu bình duyệt.
Cảnh báo lỗ hổng dữ liệu trong các mô hình AI dự báo sức khỏe. Ảnh: Internet
Nguy hiểm hơn, các mô hình dự báo lỗi này đã bắt đầu thâm nhập vào thực tế khi được áp dụng trong lâm sàng, thậm chí xuất hiện trong một bằng sáng chế thiết bị y tế và 86 bài báo tổng quan. Khi tiến hành đánh giá dựa trên khung báo cáo tiêu chuẩn quốc tế TRIPOD+AI, các chuyên gia ghi nhận cả hai tập dữ liệu trên đều nhận điểm số 0 tuyệt đối trên thang điểm 9 về các tiêu chí cốt lõi xác thực nguồn gốc dữ liệu.
Ông Alexander Gibson, trưởng nhóm nghiên cứu thuộc Khoa Y tế Công cộng & Công tác Xã hội của QUT và AusHSI, nhấn mạnh đây là một hồi chuông cảnh báo khẩn cấp cho các tạp chí khoa học, các nhà phát triển công nghệ và các bác sĩ lâm sàng. Chuyên gia này khẳng định các mô hình dự báo dựa trên nguồn dữ liệu vô danh hoàn toàn không có giá trị trong việc đưa ra quyết định y khoa. Việc thiếu dữ liệu đáng tin cậy sẽ khiến kết quả đầu ra của AI bị sai lệch, dẫn đến nguy cơ định hướng sai cho các bác sĩ và gây tổn hại trực tiếp đến tính mạng, sức khỏe của người bệnh.
Trước thực trạng này, nhóm tác giả khuyến nghị các tạp chí khoa học, quỹ tài trợ và các kho lưu trữ dữ liệu cần siết chặt quy định về việc công khai nguồn gốc dữ liệu. Đồng thời, các chuyên gia cũng yêu cầu gỡ bỏ hai tập dữ liệu không đáng tin cậy trên nền tảng Kaggle để ngăn chặn việc lạm dụng. Tính đến thời điểm hiện tại, áp lực từ giới khoa học đã khiến 7 bài báo sử dụng các tập dữ liệu này bị các tạp chí thẳng tay gỡ bỏ do sai lệch thông tin.
Nghiên cứu này đã phơi bày một góc khuất của xu hướng nghiên cứu AI y tế hiện nay, khi nhiều đề tài đang chạy theo số lượng mà bỏ qua tính minh bạch của dữ liệu. Nếu không sớm xây dựng các cơ chế bảo vệ và kiểm định nghiêm ngặt, các mô hình AI kém chất lượng sẽ tiếp tục xâm nhập sâu vào tài liệu học thuật, để lại những hệ lụy khó lường khi ứng dụng trực tiếp vào quá trình điều trị cho bệnh nhân.
Xuân Hùng
TIN LIÊN QUAN
-
Bigme đột phá công nghệ với smartphone hai màn hình E-Ink màu đầu tiên thế giới
-
Từ mã di truyền đến mạch logic: Tương lai mới của liệu pháp tế bào thông minh
-
Hyundai Việt Nam triệu hồi hơn 13.600 xe Tucson do lỗi hệ thống phanh khẩn cấp
-
Huế: Nền tảng số kết nối '3 nhà' phục vụ phát triển kinh tế, xã hội