Đại số tuyến tính cho AI · Bài 3/3
Trị riêng, vector riêng và SVD
Bài học minh hoạ — nội dung sẽ được Phòng Học thuật & Nghiên cứu Giáo dục BMATH biên soạn và thẩm định chính thức trước khi xuất bản.
Ở Bài 1, ta đã gặp định nghĩa: với ma trận vuông , vector khác không là vector riêng ứng với trị riêng nếu:
Nói cách khác, phép biến đổi tuyến tính chỉ kéo giãn/co vector riêng theo hệ số , không đổi hướng của nó. Về mặt tính toán, các trị riêng là nghiệm của phương trình đặc trưng .
Ma trận đối xứng và PCA
Ma trận hiệp phương sai (covariance matrix) của một tập dữ liệu luôn là ma trận đối xứng (). Với ma trận đối xứng thực, mọi trị riêng đều là số thực và các vector riêng ứng với trị riêng khác nhau luôn trực giao với nhau — tính chất then chốt để phân tích thành phần chính (PCA) hoạt động đúng.
PCA tìm các vector riêng của ma trận hiệp phương sai, sắp xếp theo trị riêng giảm dần. Vector riêng có trị riêng lớn nhất (gọi là thành phần chính thứ nhất) là hướng mà dữ liệu biến thiên nhiều nhất; trị riêng của nó chính là phương sai của dữ liệu theo hướng đó. Giữ lại vector riêng đầu () cho phép giảm chiều dữ liệu từ chiều xuống chiều mà vẫn giữ được phần lớn thông tin (phương sai).
SVD — phân tích giá trị kỳ dị
Trị riêng/vector riêng chỉ định nghĩa được cho ma trận vuông. Với ma trận bất kỳ (kể cả không vuông — ví dụ ma trận đánh giá người dùng × sản phẩm trong hệ gợi ý), ta dùng SVD (Singular Value Decomposition):
Trong đó và là các ma trận trực giao, còn là ma trận đường chéo chứa các giá trị kỳ dị . Các cột của là vector riêng của , các cột của là vector riêng của , và với là trị riêng (không âm) của .
Khi đối xứng, SVD và phân tích trị riêng trùng nhau — vì vậy có thể xem PCA là một trường hợp đặc biệt của SVD áp dụng lên ma trận hiệp phương sai.
Ứng dụng trong AI
Ngoài giảm chiều dữ liệu (PCA), SVD còn là nền tảng của: hệ gợi ý qua ma trận phân rã (matrix factorization — tách ma trận đánh giá thưa thớt thành đặc trưng ẩn của người dùng và sản phẩm), phân tích ngữ nghĩa tiềm ẩn (Latent Semantic Analysis trong xử lý ngôn ngữ tự nhiên truyền thống), và nén mô hình (xấp xỉ ma trận trọng số hạng thấp — low-rank approximation — để giảm số tham số của mạng nơ-ron).
Đến đây, khoá học đã trang bị đủ nền tảng đại số tuyến tính cốt lõi cho AI. Các khoá tiếp theo (Xác suất & Thống kê, Giải tích, Tối ưu hoá) sẽ xây dựng trên nền tảng này.