4 case study trước cho thấy số liệu thắng trực giác trong nhiều lĩnh vực. Nhưng để kết thúc Module 3 một cách trung thực, cần 1 case study ngược lại: khi 1 dự án “big data” được ca ngợi rộng rãi lại thất bại nặng — để bạn không rơi vào cực đoan “số liệu luôn đúng”.
Câu chuyện: dự đoán dịch cúm nhanh hơn cả CDC
Năm 2008, Google ra mắt Google Flu Trends (GFT): dự đoán mức độ lan rộng của dịch cúm dựa trên các từ khóa tìm kiếm liên quan đến cúm — nhanh hơn báo cáo chính thức của CDC (Trung tâm Kiểm soát Bệnh tật Mỹ) tới 2 tuần. Đây được ca ngợi là ví dụ kinh điển cho sức mạnh của “big data”.
Vì sao thất bại — kết nối lại với “overfitting” đã học
Nguyên nhân đầu tiên chính xác là overfitting — khái niệm đã học ở Module 1: mô hình GFT được xây bằng cách thử hàng chục triệu cụm từ khóa để tìm ra 45 từ “tương quan” tốt nhất với dữ liệu lịch sử. Nhưng 1 số từ khóa (như “bóng rổ học sinh”) tương quan với cúm chỉ vì cùng xảy ra vào mùa đông — không có quan hệ nhân quả thật. Khi mô hình gặp dữ liệu mới, tương quan giả này không còn đúng, và dự đoán sai lệch nặng.
Bài học tổng kết cho cả Module 3: số liệu là công cụ RẤT mạnh (4 case study trước đã cho thấy), nhưng không miễn nhiễm với các lỗi cơ bản đã học (overfitting, tương quan giả, thiếu kiểm định định kỳ). Sức mạnh của số liệu đến từ việc áp dụng ĐÚNG PHƯƠNG PHÁP, không phải từ việc có “nhiều dữ liệu” hay dùng công nghệ hiện đại.
Xem thêm
Video này (tiếng Anh) phân tích sâu hơn về trường hợp Google Flu Trends — đúng câu chuyện vừa học ở trên.
- Bạn kể lại được câu chuyện Google Flu Trends bằng lời của mình, gồm cả lúc thành công và lúc thất bại.
- Bạn giải thích được lỗi “bóng rổ học sinh tương quan với cúm” bằng khái niệm overfitting đã học.
- Bạn nêu được ít nhất 2/3 nguyên nhân khiến GFT thất bại.
“Dữ liệu lớn” không tự động đồng nghĩa với “dữ liệu đúng” hay “phương pháp đúng”. Trước khi tin tưởng hoàn toàn vào 1 mô hình — dù nổi tiếng, dù công ty lớn đứng sau — luôn hỏi: mô hình này có được đối chiếu định kỳ với dữ liệu thật không? Các biến số dùng có quan hệ nhân quả thật, hay chỉ tương quan giả?
Câu hỏi thường gặp
Google Flu Trends có hoàn toàn vô giá trị không?
Không — ý tưởng dùng tìm kiếm để giám sát sức khỏe cộng đồng vẫn có giá trị, chỉ là cách thực hiện ban đầu có lỗi. Các dự án sau này đã học từ thất bại này để làm tốt hơn, thường kết hợp nhiều nguồn dữ liệu, không chỉ dựa vào 1 nguồn duy nhất.
Làm sao tránh lỗi tương tự trong dự án của mình?
Luôn dành 1 phần dữ liệu để kiểm định độc lập (đã học ở Module 1 – overfitting), và LUÔN đối chiếu định kỳ với dữ liệu thật/kết quả thực tế, không chỉ tin vào độ chính xác lúc mới xây mô hình.
Case study này có mâu thuẫn với 4 case study trước (số liệu thắng chuyên gia) không?
Không mâu thuẫn — thông điệp chung của Module 3 là: số liệu THƯỜNG thắng khi áp dụng đúng phương pháp (như 4 case trước), nhưng vẫn cần kiểm định nghiêm túc, không phải “cứ có dữ liệu là đúng”.
