Các kỹ thuật đã học ở Module 1 (phân loại, hồi quy, phân cụm, Bayes, text mining) đều nhằm dự đoán 1 thứ gì đó. Nhưng có 1 kỹ thuật phổ biến khác không dự đoán — nó chỉ đi tìm liên kết giữa các thứ hay xuất hiện cùng nhau trong dữ liệu giao dịch.
Ví dụ thật: “khách mua eWatch cũng thường mua eBracelet”
Đây là kỹ thuật đứng sau câu gợi ý quen thuộc trên các sàn thương mại điện tử. Ý tưởng: quét qua toàn bộ giao dịch, tìm các cặp/nhóm sản phẩm xuất hiện cùng nhau nhiều hơn mức ngẫu nhiên. Ngoài việc gợi ý bán thêm, kỹ thuật này còn dùng để quyết định: nên trữ những mặt hàng ít phổ biến nào ở kho khu vực (gần khách hàng) để giảm chi phí giao hàng, dựa trên việc chúng thường được mua kèm với mặt hàng phổ biến.
Chỉ số quan trọng nhất: Lift — đo độ “bất ngờ”
Không phải liên kết nào cũng đáng chú ý. “Bánh mì và sữa thường được mua cùng nhau” — ai cũng đoán được, vì cả 2 đều là mặt hàng phổ biến, ngẫu nhiên cũng dễ xuất hiện cùng nhau. Cái đáng chú ý là liên kết bất ngờ hơn mức ngẫu nhiên.
Đây chính là công cụ giúp phân biệt “liên kết hiển nhiên, ai cũng biết” và “liên kết ẩn, mang lại giá trị kinh doanh thật” — nguyên lý này áp dụng được không chỉ cho sản phẩm mua sắm, mà cả phân tích hành vi người dùng, hoặc tìm mối liên hệ giữa các chỉ số tài chính của 1 công ty.
Xem thêm
Video này (tiếng Anh) minh họa cụ thể cách tính support, confidence, lift trên ví dụ dữ liệu giao dịch thật.
- Bạn giải thích được sự khác nhau giữa support, confidence, và lift.
- Bạn hiểu vì sao lift ≈ 1 (như bánh mì & sữa) lại KHÔNG đáng chú ý, dù rất phổ biến.
- Bạn nêu được 1 ứng dụng khác của association rules ngoài gợi ý mua sắm.
Association rules không dự đoán gì cả — nó chỉ tìm ra những gì THƯỜNG đi cùng nhau. Giá trị thật nằm ở việc lọc ra liên kết “bất ngờ” (lift cao) khỏi những liên kết hiển nhiên — vì chỉ những liên kết bất ngờ mới thực sự mang lại insight mới, có thể hành động được.
Câu hỏi thường gặp
Association rules có cần dữ liệu có nhãn không?
Không — giống phân cụm, đây cũng là kỹ thuật học không giám sát, chỉ cần dữ liệu giao dịch thô, không cần biết trước “đúng” hay “sai”.
Làm sao biết ngưỡng support/confidence nào là hợp lý?
Không có con số chuẩn chung — phụ thuộc vào quy mô dữ liệu và mục đích. Với dữ liệu lớn, ngưỡng support rất nhỏ (như 0.01%) vẫn có thể đại diện cho hàng nghìn giao dịch thật.
Kỹ thuật này có áp dụng cho phân tích tài chính không?
Có — ví dụ tìm ra các chỉ số tài chính thường “đi cùng nhau” ở các công ty tăng trưởng tốt, hoặc các sự kiện thường xảy ra cùng lúc trước khi giá cổ phiếu biến động mạnh.
