Python là ngôn ngữ số một trong phân tích dữ liệu, và hai thư viện bạn chắc chắn phải biết là NumPy và Pandas. Bài viết giới thiệu chúng qua các ví dụ thực tế.
NumPy — nền tảng tính toán số
NumPy cung cấp mảng (array) nhiều chiều, tính toán nhanh hơn list Python rất nhiều.
import numpy as np
a = np.array([1, 2, 3, 4])
print(a * 2) # [2 4 6 8] - nhân toàn bộ mảng
print(a.mean()) # 2.5 - trung bình
print(a.sum()) # 10
Mọi phép toán áp dụng lên cả mảng cùng lúc, không cần vòng lặp — vừa ngắn vừa nhanh.
Pandas — xử lý dữ liệu dạng bảng
Đối tượng trung tâm của Pandas là DataFrame — như một bảng tính có hàng và cột.
import pandas as pd
df = pd.DataFrame({
"ten": ["An", "Bình", "Chi"],
"tuoi": [25, 30, 28],
"luong": [15, 20, 18]
})
print(df.head()) # xem vài dòng đầu
print(df["luong"].mean()) # lương trung bình
Đọc dữ liệu từ file
df = pd.read_csv("du_lieu.csv") # đọc CSV
df = pd.read_excel("bang.xlsx") # đọc Excel
Lọc và nhóm dữ liệu
# Lọc những người lương trên 16
df[df["luong"] > 16]
# Nhóm theo cột và tính trung bình
df.groupby("phong_ban")["luong"].mean()
Quy trình phân tích dữ liệu điển hình
- Thu thập: đọc dữ liệu từ CSV, Excel, database, API.
- Làm sạch: xử lý giá trị thiếu, sai định dạng.
- Khám phá: thống kê, nhóm, lọc để tìm quy luật.
- Trực quan hóa: vẽ biểu đồ với Matplotlib/Seaborn.
- Kết luận: rút ra insight phục vụ quyết định.
Chỉ với NumPy và Pandas, bạn đã có thể xử lý phần lớn công việc phân tích dữ liệu hằng ngày.
