Khai Thác Dữ Liệu Văn Bản — Tin Tức Có Dự Đoán Được Giá Cổ Phiếu?

Tóm tắt nhanh: Khai thác dữ liệu văn bản là cách biến chữ viết (tin tức, đánh giá, ghi chú) thành dữ liệu số mà các mô hình đã học (phân loại, hồi quy) có thể xử lý được. Bài này đi qua 1 ví dụ thật rất liên quan đến đầu tư: dùng tin tức tài chính để dự đoán biến động giá cổ phiếu.
Ví dụ thật: dự đoán giá cổ phiếu từ tin tứcKỹ thuật: bag-of-words, TF-IDFNgưỡng thật: biến động ≥5%

Tất cả các mô hình bạn đã học từ đầu Module này đều cần dữ liệu dạng số hoặc phân loại rõ ràng. Nhưng rất nhiều dữ liệu quan trọng trong thực tế lại là văn bản: tin tức, báo cáo, đánh giá khách hàng, bài đăng mạng xã hội. Khai thác dữ liệu văn bản (text mining) là cầu nối giữa 2 thế giới này.

Bài toán thật: dự đoán giá cổ phiếu từ tin tức

Ý tưởng: mỗi ngày giao dịch, có rất nhiều tin tức về các công ty (sáp nhập, lợi nhuận, thay đổi quy định…). Nhà đầu tư đọc tin, thay đổi niềm tin, và giao dịch theo — dẫn đến giá cổ phiếu thay đổi. Câu hỏi: có thể dùng chính văn bản của tin tức để dự đoán trước biến động giá không?

Bài toán này rất khó nếu làm chính xác tuyệt đối, nên cần đơn giản hoá bằng vài giả định thực dụng:

  • Chỉ dự đoán biến động trong cùng ngày tin tức xuất hiện (không dự đoán xa hơn).
  • Không dự đoán giá cụ thể, chỉ dự đoán hướng biến động: tăng mạnh, giảm mạnh, hoặc ổn định.
  • Chỉ quan tâm biến động đủ lớn để có ý nghĩa thực tế — đặt ngưỡng 5%.
Đơn giản hoá bài toán: chỉ quan tâm biến động LỚNPLUNGE (giảm ≥ 5%)STABLE (giữa -2.5% và +2.5%)SURGE (tăng ≥ 5%)“vùng xám”: bỏ qua,không dán nhãn“vùng xám”: bỏ qua,không dán nhãnChỉ giữ lại các trường hợp biến động rõ ràng — bỏ qua vùng mập mờ giữa để tín hiệu “sạch” hơn.
Đặt ngưỡng 5% để phân loại rõ: tăng mạnh (surge), giảm mạnh (plunge), ổn định (stable) — bỏ qua vùng biến động nhỏ mập mờ ở giữa.

Biến chữ thành số: bag-of-words

Máy không đọc hiểu tiếng Việt hay tiếng Anh như con người. Cách đơn giản và phổ biến nhất để biến văn bản thành dữ liệu số là bag-of-words (túi từ): đếm số lần mỗi từ xuất hiện trong văn bản, bỏ qua thứ tự và ngữ pháp. Ví dụ “lợi nhuận vượt dự báo” và “dự báo lợi nhuận vượt” sẽ được xem là giống nhau về mặt túi từ, dù thứ tự khác.

Kỹ thuật cải tiến hơn gọi là TF-IDF: không chỉ đếm số lần xuất hiện, mà còn giảm trọng số cho các từ xuất hiện ở hầu hết văn bản (như “công ty”, “hôm nay” — ít mang thông tin phân biệt), và tăng trọng số cho từ hiếm nhưng đặc trưng (như tên 1 sản phẩm cụ thể, hoặc từ “sáp nhập”). Sau khi có vector số này, bạn có thể áp dụng bất kỳ mô hình đã học ở các bài trước (cây quyết định, hồi quy logistic, Naive Bayes) để dự đoán.

Xem thêm

Video này (tiếng Anh) minh họa cụ thể cách tính bag-of-words và TF-IDF trên ví dụ văn bản đơn giản, giúp bạn thấy rõ 2 kỹ thuật này khác nhau ở đâu.

Checklist tự kiểm tra sau bài này
  • Bạn giải thích được vì sao cần đơn giản hoá bài toán dự đoán giá cổ phiếu (đặt ngưỡng, chỉ dự đoán cùng ngày).
  • Bạn hiểu nguyên lý bag-of-words: đếm từ, bỏ qua ngữ pháp và thứ tự.
  • Bạn biết TF-IDF khác bag-of-words ở điểm nào: giảm trọng số từ phổ biến, tăng trọng số từ hiếm nhưng đặc trưng.
Cần nhớ

Dự đoán giá cổ phiếu từ tin tức là bài toán RẤT khó làm chính xác tuyệt đối — quan trọng không phải là tìm ra công thức hoàn hảo, mà là biết cách đơn giản hoá bài toán (đặt ngưỡng, giới hạn phạm vi) để có được 1 phiên bản khả thi, dù không hoàn hảo, vẫn có giá trị thực tế.

Câu hỏi thường gặp

Bag-of-words có nhược điểm gì?

Bỏ qua hoàn toàn thứ tự từ và ngữ cảnh — “không tốt” và “tốt” có thể bị xem là gần giống nhau nếu chỉ đếm từ “tốt” mà quên mất chữ “không” phía trước làm đảo nghĩa. Các kỹ thuật hiện đại hơn (nằm ngoài phạm vi lộ trình này) giải quyết được vấn đề này.

Mô hình dự đoán giá cổ phiếu từ tin tức có thực sự dùng được để giao dịch không?

Có thể dùng làm công cụ “gợi ý đọc tin đáng chú ý” (như sách đề cập) hơn là công cụ giao dịch tự động hoàn toàn — vì giá cổ phiếu còn bị ảnh hưởng bởi rất nhiều yếu tố không nằm trong tin tức.

Kỹ thuật này có áp dụng được cho báo cáo tài chính (không phải tin tức) không?

Có — nguyên lý giống nhau: biến văn bản báo cáo (phần thuyết minh, nhận định ban lãnh đạo) thành dữ liệu số để phân tích cùng với các chỉ số tài chính định lượng khác.

Nguồn: Foster Provost & Tom Fawcett, Data Science for Business, Chương 10 “Representing and Mining Text” (O’Reilly, 2013), phần “Example: Mining News Stories to Predict Stock Price Movement”. Nội dung diễn giải lại bằng lời riêng, không sao chép nguyên văn.