Rủi Ro Khi Lạm Dụng Số Liệu — Khi Google Flu Trends Sai Đến 140%

Tóm tắt nhanh: Google Flu Trends từng được ca ngợi là ví dụ kinh điển của ‘big data’ — dự đoán dịch cúm nhanh hơn CDC. Nhưng dự án này đã sai liên tục trong hơn 100/108 tuần, và bị dừng hoạt động. Đây là bài học tổng kết về giới hạn thật của việc lạm dụng số liệu.
Case thật: Google Flu TrendsSai lệch 140% ở mùa cúm 2013Kết nối lại: overfitting đã học Module 1

4 case study trước cho thấy số liệu thắng trực giác trong nhiều lĩnh vực. Nhưng để kết thúc Module 3 một cách trung thực, cần 1 case study ngược lại: khi 1 dự án “big data” được ca ngợi rộng rãi lại thất bại nặng — để bạn không rơi vào cực đoan “số liệu luôn đúng”.

Câu chuyện: dự đoán dịch cúm nhanh hơn cả CDC

Năm 2008, Google ra mắt Google Flu Trends (GFT): dự đoán mức độ lan rộng của dịch cúm dựa trên các từ khóa tìm kiếm liên quan đến cúm — nhanh hơn báo cáo chính thức của CDC (Trung tâm Kiểm soát Bệnh tật Mỹ) tới 2 tuần. Đây được ca ngợi là ví dụ kinh điển cho sức mạnh của “big data”.

Google Flu Trends dự đoánSố ca thật (CDC)Lệch đến 140% ở mùa cúm 2013
Mùa cúm 2012-2013, GFT dự đoán số ca cao hơn thực tế đến 140% — và đây không phải lần đầu: trong 108 tuần theo dõi, GFT đã dự đoán sai ở 100 tuần.

Vì sao thất bại — kết nối lại với “overfitting” đã học

Vì sao 1 dự án “big data” nổi tiếng lại thất bại?Tìm từ khóa tương quan“bóng rổ học sinh” tương quanvới cúm — vì cùng mùa,không phải nhân quả (overfitting)Không cập nhật lại mô hìnhHành vi tìm kiếm con ngườithay đổi theo thời gian,mô hình cũ không còn đúngKhông đối chiếu dữ liệu thậtKhông kiểm tra định kỳ vớisố liệu CDC — sai kéo dài100/108 tuần không ai phát hiệnDữ liệu lớn KHÔNG đồng nghĩa dữ liệu đúng“N=All” không phải lý do để bỏ qua kiểm định
3 nguyên nhân chính: chọn từ khóa dựa trên tương quan giả (không phải nhân quả thật), không cập nhật mô hình theo thời gian, và không đối chiếu định kỳ với dữ liệu thật.

Nguyên nhân đầu tiên chính xác là overfitting — khái niệm đã học ở Module 1: mô hình GFT được xây bằng cách thử hàng chục triệu cụm từ khóa để tìm ra 45 từ “tương quan” tốt nhất với dữ liệu lịch sử. Nhưng 1 số từ khóa (như “bóng rổ học sinh”) tương quan với cúm chỉ vì cùng xảy ra vào mùa đông — không có quan hệ nhân quả thật. Khi mô hình gặp dữ liệu mới, tương quan giả này không còn đúng, và dự đoán sai lệch nặng.

Bài học tổng kết cho cả Module 3: số liệu là công cụ RẤT mạnh (4 case study trước đã cho thấy), nhưng không miễn nhiễm với các lỗi cơ bản đã học (overfitting, tương quan giả, thiếu kiểm định định kỳ). Sức mạnh của số liệu đến từ việc áp dụng ĐÚNG PHƯƠNG PHÁP, không phải từ việc có “nhiều dữ liệu” hay dùng công nghệ hiện đại.

Xem thêm

Video này (tiếng Anh) phân tích sâu hơn về trường hợp Google Flu Trends — đúng câu chuyện vừa học ở trên.

Checklist tự kiểm tra sau bài này
  • Bạn kể lại được câu chuyện Google Flu Trends bằng lời của mình, gồm cả lúc thành công và lúc thất bại.
  • Bạn giải thích được lỗi “bóng rổ học sinh tương quan với cúm” bằng khái niệm overfitting đã học.
  • Bạn nêu được ít nhất 2/3 nguyên nhân khiến GFT thất bại.
Cần nhớ

“Dữ liệu lớn” không tự động đồng nghĩa với “dữ liệu đúng” hay “phương pháp đúng”. Trước khi tin tưởng hoàn toàn vào 1 mô hình — dù nổi tiếng, dù công ty lớn đứng sau — luôn hỏi: mô hình này có được đối chiếu định kỳ với dữ liệu thật không? Các biến số dùng có quan hệ nhân quả thật, hay chỉ tương quan giả?

Câu hỏi thường gặp

Google Flu Trends có hoàn toàn vô giá trị không?

Không — ý tưởng dùng tìm kiếm để giám sát sức khỏe cộng đồng vẫn có giá trị, chỉ là cách thực hiện ban đầu có lỗi. Các dự án sau này đã học từ thất bại này để làm tốt hơn, thường kết hợp nhiều nguồn dữ liệu, không chỉ dựa vào 1 nguồn duy nhất.

Làm sao tránh lỗi tương tự trong dự án của mình?

Luôn dành 1 phần dữ liệu để kiểm định độc lập (đã học ở Module 1 – overfitting), và LUÔN đối chiếu định kỳ với dữ liệu thật/kết quả thực tế, không chỉ tin vào độ chính xác lúc mới xây mô hình.

Case study này có mâu thuẫn với 4 case study trước (số liệu thắng chuyên gia) không?

Không mâu thuẫn — thông điệp chung của Module 3 là: số liệu THƯỜNG thắng khi áp dụng đúng phương pháp (như 4 case trước), nhưng vẫn cần kiểm định nghiêm túc, không phải “cứ có dữ liệu là đúng”.

Nguồn: tổng hợp từ nhiều bài phân tích uy tín về trường hợp Google Flu Trends, dẫn theo nghiên cứu của David Lazer và đồng nghiệp (Đại học Harvard/Northeastern), công bố trên tạp chí Science (2014), “The Parable of Google Flu: Traps in Big Data Analysis”. Nội dung tổng hợp lại bằng lời riêng.