Bạn đã có NumPy (tính toán số nhanh). Nhưng dữ liệu thật thường không phải “1 dãy số” — nó là 1 BẢNG, có nhiều cột với tên và kiểu dữ liệu khác nhau (tên khách, tuổi, thành phố…). pandas được sinh ra chính xác cho việc này.
DataFrame — “Excel” điều khiển bằng code
Nếu bạn đã quen Excel, hãy nghĩ DataFrame như “Excel nhưng mạnh hơn rất nhiều”: xử lý được hàng triệu dòng (Excel thường ì ạch với vài trăm nghìn dòng), lặp lại chính xác 100% mỗi lần chạy lại (không lo bấm nhầm công thức), và ghép được với các thư viện phân tích/mô hình khác đã học.
3 lệnh dùng nhiều nhất khi mới bắt đầu
df.head() luôn nên là lệnh đầu tiên sau khi đọc bất kỳ file dữ liệu nào — giúp kiểm
tra ngay dữ liệu có đọc đúng không (đúng cột, đúng kiểu dữ liệu), tránh việc phân tích cả 1 lúc rồi
mới phát hiện lỗi đọc file từ đầu.
Xem thêm
Video này (tiếng Anh) hướng dẫn cài pandas và đọc/xem dữ liệu lần đầu, đúng các lệnh vừa học ở trên.
- Bạn đọc được 1 file CSV vào pandas bằng pd.read_csv() và xem 5 dòng đầu bằng .head().
- Bạn tính được giá trị trung bình của 1 cột bằng .mean().
- Bạn hiểu được DataFrame có tên cột VÀ tên dòng, khác với NumPy array (chỉ có vị trí số).
Luôn kiểm tra dữ liệu ngay sau khi đọc (bằng .head(), .info()) trước khi phân tích sâu — đây là thói quen giúp phát hiện sớm lỗi đọc file (sai định dạng, sai encoding, thiếu cột) thay vì phát hiện muộn sau khi đã phân tích cả 1 lúc.
Câu hỏi thường gặp
pandas có thay thế hoàn toàn Excel không?
Tùy nhu cầu — với dữ liệu nhỏ, thao tác đơn giản, Excel vẫn tiện. pandas phát huy sức mạnh rõ nhất khi dữ liệu lớn, cần lặp lại chính xác nhiều lần, hoặc cần kết hợp với mô hình/phân tích phức tạp hơn.
pandas đọc được những định dạng file nào?
Rất nhiều: CSV, Excel, JSON, SQL, và nhiều định dạng khác — sẽ học chi tiết hơn ở bài sau.
Series khác DataFrame thế nào?
Series là 1 CỘT đơn (như df[“tuoi”]), DataFrame là cả BẢNG (nhiều cột ghép lại) — Series có thể xem là 1 “lát cắt” của DataFrame.
