Bạn đã biết data mining/data science là gì (Module 0, bài trước). Nhưng làm 1 dự án thật theo trình tự nào? Đây là lúc cần 1 quy trình chuẩn — không phải để làm cứng nhắc, mà để không bỏ sót bước quan trọng.
CRISP-DM: 6 bước, luôn lặp lại
Điểm quan trọng nhất không phải là nhớ tên 6 bước, mà là hiểu: đi qua 1 vòng chưa giải quyết được vấn đề không phải là thất bại — phần lớn giá trị của vòng đầu tiên là để hiểu dữ liệu rõ hơn, giúp vòng sau làm tốt hơn nhiều.
Ví dụ về “Hiểu bài toán” quan trọng thế nào: phát hiện gian lận thẻ tín dụng có dữ liệu nhãn đáng tin (khách hàng thật và người gian lận là 2 người khác nhau, mục tiêu đối lập, nên nhãn “gian lận/hợp lệ” rất rõ ràng). Nhưng phát hiện gian lận Medicare (bảo hiểm y tế) lại KHÁC HẲN — người gian lận thường chính là nhà cung cấp dịch vụ y tế hợp pháp, không có ai độc lập để xác nhận “đâu là đúng”. Cùng gọi là “phát hiện gian lận” nhưng 2 bài toán cần cách tiếp cận hoàn toàn khác.
Cái bẫy kỹ thuật hay gặp nhất: dữ liệu “leak”
Ở bước “Chuẩn bị dữ liệu”, có 1 lỗi rất dễ mắc mà khó phát hiện: dùng 1 biến chứa thông tin từ tương lai — thông tin chỉ có được SAU KHI đã biết kết quả cần dự đoán.
Vấn đề với leak: khi test trên dữ liệu lịch sử, mô hình có vẻ “chính xác cực cao” — vì nó đang gian lận, nhìn thấy trước câu trả lời. Nhưng khi đưa vào dùng thật (dự đoán cho dữ liệu MỚI, chưa xảy ra), biến đó không hề có sẵn — mô hình sụp đổ hoàn toàn. Đây là lý do phần “Đánh giá” trong CRISP-DM luôn cần rất cẩn trọng, không chỉ tin vào 1 con số chính xác đẹp.
Xem thêm
Video ngắn (tiếng Anh, ~5 phút) tổng quan lại đúng 6 bước CRISP-DM vừa học, kèm ví dụ minh họa riêng.
- Bạn nêu được đủ 6 bước của CRISP-DM theo đúng thứ tự logic.
- Bạn giải thích được vì sao “lặp lại” là bình thường, không phải thất bại.
- Bạn nhận diện được 1 ví dụ leak tự nghĩ ra (biến chỉ có sau khi đã biết kết quả).
Trước khi tin vào độ chính xác cao của 1 mô hình, luôn tự hỏi: có biến nào trong dữ liệu huấn luyện mà thực tế KHÔNG THỂ có sẵn tại thời điểm cần dự đoán không? Đây là câu hỏi rẻ nhất nhưng cứu được nhiều dự án khỏi thất bại khi đưa vào dùng thật.
Câu hỏi thường gặp
CRISP-DM có phải là quy trình duy nhất được dùng không?
Không, có vài quy trình khác (như SEMMA), nhưng CRISP-DM vẫn là tiêu chuẩn được dùng rộng rãi nhất và là nền tảng tốt để hiểu các quy trình khác.
Làm sao phát hiện leak nếu nó khó nhận ra?
Câu hỏi hữu ích nhất: “Tại đúng thời điểm tôi cần dự đoán, dữ liệu này có thực sự đã tồn tại chưa?” Nếu câu trả lời là “chỉ có sau” — đó là leak.
Bước nào trong CRISP-DM quan trọng nhất?
Sách nhấn mạnh “Hiểu bài toán” (Business Understanding) — vì sai từ bước đầu (như nhầm bài toán gian lận thẻ tín dụng với Medicare) sẽ khiến mọi bước sau đều lệch hướng, dù kỹ thuật có tốt đến đâu.
