Máy học (machine learning) nghe có vẻ cao siêu, nhưng với scikit-learn, bạn có thể huấn luyện mô hình đầu tiên chỉ trong vài dòng. Bài viết giới thiệu quy trình cơ bản.
Máy học là gì?
Thay vì lập trình từng quy tắc, máy học để chương trình tự học quy luật từ dữ liệu. Ví dụ: dự đoán giá nhà từ diện tích, phân loại email spam.
Cài đặt
pip install scikit-learn
Quy trình điển hình
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
# Dữ liệu: diện tích -> giá
X = [[30], [50], [70], [90]] # đặc trưng
y = [900, 1500, 2100, 2700] # nhãn (giá)
# Chia train/test
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.25)
# Huấn luyện
model = LinearRegression()
model.fit(X_train, y_train)
# Dự đoán
print(model.predict([[60]])) # ước lượng giá nhà 60m2
Đánh giá mô hình
from sklearn.metrics import r2_score
du_doan = model.predict(X_test)
print(r2_score(y_test, du_doan)) # càng gần 1 càng tốt
Các loại bài toán phổ biến
- Hồi quy: dự đoán số (giá, nhiệt độ).
- Phân loại: dự đoán nhãn (spam/không spam).
- Gom cụm: nhóm dữ liệu tương tự.
Bước tiếp theo
scikit-learn có hàng loạt thuật toán sẵn dùng chung một giao diện fit/predict. Khi đã quen, bạn có thể khám phá deep learning với TensorFlow hoặc PyTorch. Nhưng scikit-learn là điểm khởi đầu lý tưởng cho hành trình máy học.
