Bài 7: hình học biểu diễn, covariance, rank, CKA và probe#
Bắt đầu · Trước: xác suất · Tiếp: mạng nơ-ron
Mục tiêu và cầu nối toán#
Sau bài này, bạn tính được norm, cosine và covariance của vài vector; nối SVD với PCA; chỉ ra effective rank đang dùng spectrum nào; phân biệt hình học, khả năng đọc nhãn và việc detector thực sự dựa vào một cue.
Gọi là vector của mẫu thứ . Ma trận xếp mỗi mẫu vào một hàng. “Mẫu” có thể là utterance hoặc token: phải khai báo trước khi diễn giải kết quả. Ký hiệu là chuyển vị, đổi hàng thành cột. Tích ma trận đòi hỏi số cột của bằng số hàng của .
1. Norm và góc trả lời hai câu khác nhau#
L2 norm là độ dài. Cosine của hai vector khác zero là
Cosine đo hướng tương đối, còn Euclidean distance đo khoảng cách. Đơn vị embedding do model quy định; không mặc nhiên là Hz hay dB. S16: Deep Learning, chương 2, §§2.2, 2.5–2.6.
Ví dụ đã giải: , . Hai norm là 5 và 10; dot product là 50; cosine bằng . Khoảng cách bằng 5. Hai vector cùng hướng nhưng scale khác nhau. Nếu nhãn nằm trong độ dài, chuẩn hóa có thể xóa cue đó.
Phản ví dụ: , . Dot product là 99, mỗi norm là , nên cosine bằng . Tuy vậy, chỉ nhìn dấu tọa độ thứ hai đã tách B/S hoàn hảo trong ví dụ này. Một thành phần chung lớn có thể làm cosine chưa center rất cao; con số đó chưa chứng minh collapse.
2. Centering và covariance: bỏ vị trí chung, giữ biến thiên#
Mean là ; hàng đã center là . Với , sample covariance:
Đường chéo chứa variance từng chiều; ngoài đường chéo đo hai chiều cùng biến thiên. Covariance có đơn vị embedding bình phương. Covariance dương không xác lập nguyên nhân: speaker, channel hoặc content có thể cùng thay đổi. S14: Deep Learning, chương 3, §3.8.
Ví dụ đã giải: bốn vector có mean . Khi đó
Mọi biến thiên nằm trên trục thứ nhất. Rank bằng 1 vẫn có thể hữu ích: nếu nhãn là dấu tọa độ thứ nhất, ngưỡng 0 phân loại đúng cả bốn mẫu.
Các hàng đã center cộng thành zero, tạo một phụ thuộc tuyến tính. Vì thế, trong số học chính xác,
Với 64 vector utterance, mỗi vector 768 chiều, covariance rank tối đa là 63. Nếu mỗi clip đóng góp 128 hàng token, số hàng thực tế khác. Tolerance và precision cũng ảnh hưởng cách đếm numerical rank.
3. SVD và PCA: hướng variance có thể khác hướng nhãn#
Rank đếm số hướng độc lập. Nullspace là tập vector bị phép biến đổi gửi thành zero, như ở bài 5.
SVD dạng compact viết . Các cột của là những hướng feature trực giao; singular values cho độ mạnh trên từng hướng; cho tọa độ của các mẫu. Suy ra
PCA chọn các hướng có eigenvalue lớn để giữ variance và giảm squared reconstruction error trong họ phép chiếu tuyến tính cùng rank. Nó không đọc nhãn detection. S16: §§2.7–2.8 và 2.12.
Phản ví dụ đã tính: đặt , với và bốn tổ hợp xuất hiện đều; nhãn là . Mean bằng zero và . PCA một chiều giữ trục đầu vì variance lớn gấp 100 lần, nhưng bỏ toàn bộ tín hiệu nhãn trong toy này. Đây là ví dụ biên soạn, không phải kết quả Audio-JEPA.
4. Effective rank: cần ghi rõ ma trận và spectrum#
Roy–Vetterli định nghĩa effective rank của một ma trận khác zero, dựa trên singular values:
với quy ước . singular values khác zero bằng nhau cho ; chỉ một giá trị khác zero cho 1. Kết quả có thể không nguyên. S17: Roy & Vetterli (2007), §2.1 Definition và §2.2 Properties, toàn văn EURASIP.
Ví dụ đã giải: cho , entropy và effective rank . Nếu phân tích covariance với eigenvalues tỷ lệ , mass là , entropy và effective rank .
Hai số mô tả hai đối tượng. Covariance là positive semidefinite nên singular values của nó bằng eigenvalues không âm; tính erank trên chúng khác tính erank trên .
Nhân mọi singular value với không đổi mass hay effective rank, nhưng variance giảm . Vì thế nhiễu rất nhỏ và trải đều vẫn có thể có effective rank cao. Với ma trận toàn zero, mẫu số bằng zero: công thức không xác định, cần báo degenerate hoặc công bố quy ước riêng. Không âm thầm gán 1.
5. CKA: tương đồng giữa hai tập biểu diễn trên cùng mẫu#
Cho và đã center theo mẫu, với các hàng ứng với cùng mẫu và cùng thứ tự. Linear CKA là
Frobenius norm . Có thể tính tương đương từ centered Gram matrices . Nếu một representation sau center là zero, denominator bằng zero. S18: Kornblith et al. (2019), §§2–3, Table 1 và §5.
Ví dụ đã giải: , . Ta có , , , nên CKA . Scale chung không đổi thống kê. Nếu nhãn độc lập với , CKA bằng 1 vẫn không làm representation hữu ích cho detection.
CKA hỏi hai cấu trúc biểu diễn giống nhau đến đâu trên tập mẫu đang xét. Nó chưa trả lời khả năng đọc nhãn hay nguyên nhân quyết định.
6. Linear probe, collapse và usefulness#
Linear probe giữ encoder cố định và học một classifier affine trên representation đã định nghĩa. Train/dev/heldout và regularization là một phần của protocol. Nó hỏi nhãn có đọc tuyến tính được trong protocol đó hay không.
Frozen encoder với trainable attentive pooling và MLP phi tuyến của paper không phải linear probe. Probe tốt có thể khai thác quan hệ source–label; chưa chứng minh cue generator nào đã được mã hóa, càng chưa chứng minh head dựa vào cue đó.
Phản ví dụ XOR: bốn điểm có nhãn B khi hai tọa độ cùng dấu, S khi khác dấu. Covariance là , rank và effective rank đều bằng 2. Tuy nhiên một đường thẳng không tách đúng cả bốn điểm. Score phi tuyến tách được. Linear probe kém chưa chứng minh mọi thông tin nhãn đã biến mất.
Nhiễu độc lập nhãn có thể có full rank; classifier lớn vẫn có thể nhớ train mà không tổng quát hóa. Ngược lại, rank 1 ở mục 2 chứa nhãn hoàn hảo. Total collapse là mọi mẫu cùng vector, khiến centered variance bằng zero. Dimensional collapse cần được định nghĩa theo phép đo và mục tiêu: low rank tự nhiên của một task một chiều chưa đủ gọi là failure. Các phân biệt này dựa trên phản ví dụ toán biên soạn.
7. Liên hệ paper và bài tập#
Lịch sử v41 có cosine/rank trên batch speech trong chương 06; chưa tái đo ở lượt này. Trước khi diễn giải cần biết layer, pooling, đơn vị clip/token, centering, spectrum và normalization. Chẩn đoán hình học không tự chứng minh objective làm mất forensic cue hoặc source bias gây EER.
- Với và , tính norm, cosine và distance.
- có hai hàng . Tính mean, sample covariance và giới hạn rank sau center.
- Với 20 utterance vectors, mỗi vector 768 chiều, covariance rank 300 có phù hợp không? Cần kiểm gì trước khi quy kết lỗi?
- Với , effective rank bằng bao nhiêu? Nhân spectrum với thay đổi gì? Nếu tất cả bằng zero thì sao?
- CKA bằng 0.95 và source probe tốt có chứng minh detector dựa vào source không?
Đáp án — mở sau khi thử
- Norm là 1 và 2; cosine 0; distance .
- Mean ; centered rows ; covariance . Eigenvalues là 4 và 0; rank bằng 1 và tối đa .
- Không theo định nghĩa mỗi utterance là một hàng: tối đa 19. Kiểm số hàng thực tế, token/window, centering, cách tích lũy mẫu, định nghĩa metric và tolerance.
- Effective rank bằng 2; scale không đổi con số này nhưng variance giảm . All-zero không xác định theo công thức.
- Không. CKA đo tương đồng, probe đo decodability. Reliance của head cần bằng chứng về quyết định hoặc can thiệp có thiết kế phù hợp.
Đào sâu tự chọn#
Chứng minh positive semidefinite bằng . Đọc entropy như kỳ vọng , nối với bài 6. Khi so encoder, giữ sample order, domain, layer và preprocessing phù hợp. Thiết kế can thiệp tìm nguyên nhân thuộc lớp 5; lớp 1 chỉ xây nền tảng để đọc chúng.