Tất cả các mô hình bạn đã học từ đầu Module này đều cần dữ liệu dạng số hoặc phân loại rõ ràng. Nhưng rất nhiều dữ liệu quan trọng trong thực tế lại là văn bản: tin tức, báo cáo, đánh giá khách hàng, bài đăng mạng xã hội. Khai thác dữ liệu văn bản (text mining) là cầu nối giữa 2 thế giới này.
Bài toán thật: dự đoán giá cổ phiếu từ tin tức
Ý tưởng: mỗi ngày giao dịch, có rất nhiều tin tức về các công ty (sáp nhập, lợi nhuận, thay đổi quy định…). Nhà đầu tư đọc tin, thay đổi niềm tin, và giao dịch theo — dẫn đến giá cổ phiếu thay đổi. Câu hỏi: có thể dùng chính văn bản của tin tức để dự đoán trước biến động giá không?
Bài toán này rất khó nếu làm chính xác tuyệt đối, nên cần đơn giản hoá bằng vài giả định thực dụng:
- Chỉ dự đoán biến động trong cùng ngày tin tức xuất hiện (không dự đoán xa hơn).
- Không dự đoán giá cụ thể, chỉ dự đoán hướng biến động: tăng mạnh, giảm mạnh, hoặc ổn định.
- Chỉ quan tâm biến động đủ lớn để có ý nghĩa thực tế — đặt ngưỡng 5%.
Biến chữ thành số: bag-of-words
Máy không đọc hiểu tiếng Việt hay tiếng Anh như con người. Cách đơn giản và phổ biến nhất để biến văn bản thành dữ liệu số là bag-of-words (túi từ): đếm số lần mỗi từ xuất hiện trong văn bản, bỏ qua thứ tự và ngữ pháp. Ví dụ “lợi nhuận vượt dự báo” và “dự báo lợi nhuận vượt” sẽ được xem là giống nhau về mặt túi từ, dù thứ tự khác.
Kỹ thuật cải tiến hơn gọi là TF-IDF: không chỉ đếm số lần xuất hiện, mà còn giảm trọng số cho các từ xuất hiện ở hầu hết văn bản (như “công ty”, “hôm nay” — ít mang thông tin phân biệt), và tăng trọng số cho từ hiếm nhưng đặc trưng (như tên 1 sản phẩm cụ thể, hoặc từ “sáp nhập”). Sau khi có vector số này, bạn có thể áp dụng bất kỳ mô hình đã học ở các bài trước (cây quyết định, hồi quy logistic, Naive Bayes) để dự đoán.
Xem thêm
Video này (tiếng Anh) minh họa cụ thể cách tính bag-of-words và TF-IDF trên ví dụ văn bản đơn giản, giúp bạn thấy rõ 2 kỹ thuật này khác nhau ở đâu.
- Bạn giải thích được vì sao cần đơn giản hoá bài toán dự đoán giá cổ phiếu (đặt ngưỡng, chỉ dự đoán cùng ngày).
- Bạn hiểu nguyên lý bag-of-words: đếm từ, bỏ qua ngữ pháp và thứ tự.
- Bạn biết TF-IDF khác bag-of-words ở điểm nào: giảm trọng số từ phổ biến, tăng trọng số từ hiếm nhưng đặc trưng.
Dự đoán giá cổ phiếu từ tin tức là bài toán RẤT khó làm chính xác tuyệt đối — quan trọng không phải là tìm ra công thức hoàn hảo, mà là biết cách đơn giản hoá bài toán (đặt ngưỡng, giới hạn phạm vi) để có được 1 phiên bản khả thi, dù không hoàn hảo, vẫn có giá trị thực tế.
Câu hỏi thường gặp
Bag-of-words có nhược điểm gì?
Bỏ qua hoàn toàn thứ tự từ và ngữ cảnh — “không tốt” và “tốt” có thể bị xem là gần giống nhau nếu chỉ đếm từ “tốt” mà quên mất chữ “không” phía trước làm đảo nghĩa. Các kỹ thuật hiện đại hơn (nằm ngoài phạm vi lộ trình này) giải quyết được vấn đề này.
Mô hình dự đoán giá cổ phiếu từ tin tức có thực sự dùng được để giao dịch không?
Có thể dùng làm công cụ “gợi ý đọc tin đáng chú ý” (như sách đề cập) hơn là công cụ giao dịch tự động hoàn toàn — vì giá cổ phiếu còn bị ảnh hưởng bởi rất nhiều yếu tố không nằm trong tin tức.
Kỹ thuật này có áp dụng được cho báo cáo tài chính (không phải tin tức) không?
Có — nguyên lý giống nhau: biến văn bản báo cáo (phần thuyết minh, nhận định ban lãnh đạo) thành dữ liệu số để phân tích cùng với các chỉ số tài chính định lượng khác.
