ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
8 phút đọc · Toàn văn
Mục lục bài · 9 mục

Bài 7: hình học biểu diễn, covariance, rank, CKA và probe#

Bắt đầu · Trước: xác suất · Tiếp: mạng nơ-ron

Mục tiêu và cầu nối toán#

Sau bài này, bạn tính được norm, cosine và covariance của vài vector; nối SVD với PCA; chỉ ra effective rank đang dùng spectrum nào; phân biệt hình học, khả năng đọc nhãn và việc detector thực sự dựa vào một cue.

Gọi hi∈Rdh_i\in\mathbb R^d là vector của mẫu thứ ii. Ma trận H∈Rn×dH\in\mathbb R^{n\times d} xếp mỗi mẫu vào một hàng. “Mẫu” có thể là utterance hoặc token: phải khai báo trước khi diễn giải kết quả. Ký hiệu A⊤A^\top là chuyển vị, đổi hàng thành cột. Tích ma trận (AB)ij=∑kAikBkj(AB)_{ij}=\sum_k A_{ik}B_{kj} đòi hỏi số cột của AA bằng số hàng của BB.

1. Norm và góc trả lời hai câu khác nhau#

L2 norm ∥h∥=∑jhj2\|h\|=\sqrt{\sum_j h_j^2} là độ dài. Cosine của hai vector khác zero là

cos⁡(u,v)=u⊤v∥u∥∥v∥.\cos(u,v)=\frac{u^\top v}{\|u\|\|v\|}.

Cosine đo hướng tương đối, còn Euclidean distance ∥u−v∥\|u-v\| đo khoảng cách. Đơn vị embedding do model quy định; không mặc nhiên là Hz hay dB. S16: Deep Learning, chương 2, §§2.2, 2.5–2.6.

Ví dụ đã giải: u=[3,4]u=[3,4], v=[6,8]v=[6,8]. Hai norm là 5 và 10; dot product là 50; cosine bằng 50/(5×10)=150/(5\times10)=1. Khoảng cách bằng 5. Hai vector cùng hướng nhưng scale khác nhau. Nếu nhãn nằm trong độ dài, chuẩn hóa h/∥h∥h/\|h\| có thể xóa cue đó.

Phản ví dụ: hB=[10,1]h_B=[10,1], hS=[10,−1]h_S=[10,-1]. Dot product là 99, mỗi norm là 101\sqrt{101}, nên cosine bằng 99/101≈0.98019899/101\approx0.980198. Tuy vậy, chỉ nhìn dấu tọa độ thứ hai đã tách B/S hoàn hảo trong ví dụ này. Một thành phần chung lớn có thể làm cosine chưa center rất cao; con số đó chưa chứng minh collapse.

2. Centering và covariance: bỏ vị trí chung, giữ biến thiên#

Mean là μ=(1/n)∑ihi\mu=(1/n)\sum_i h_i; hàng đã center là hc,i=hi−μh_{c,i}=h_i-\mu. Với n>1n>1, sample covariance:

C=Hc⊤Hcn−1,Cjk=1n−1∑i(hij−μj)(hik−μk).C=\frac{H_c^\top H_c}{n-1},\qquad C_{jk}=\frac{1}{n-1}\sum_i(h_{ij}-\mu_j)(h_{ik}-\mu_k).

Đường chéo chứa variance từng chiều; ngoài đường chéo đo hai chiều cùng biến thiên. Covariance có đơn vị embedding bình phương. Covariance dương không xác lập nguyên nhân: speaker, channel hoặc content có thể cùng thay đổi. S14: Deep Learning, chương 3, §3.8.

Ví dụ đã giải: bốn vector [−2,0],[−1,0],[1,0],[2,0][-2,0],[-1,0],[1,0],[2,0] có mean [0,0][0,0]. Khi đó

Hc⊤Hc=[10000],C=diag⁡(10/3,0).H_c^\top H_c=\begin{bmatrix}10&0\\0&0\end{bmatrix}, \qquad C=\operatorname{diag}(10/3,0).

Mọi biến thiên nằm trên trục thứ nhất. Rank bằng 1 vẫn có thể hữu ích: nếu nhãn là dấu tọa độ thứ nhất, ngưỡng 0 phân loại đúng cả bốn mẫu.

Các hàng đã center cộng thành zero, tạo một phụ thuộc tuyến tính. Vì thế, trong số học chính xác,

rank⁡(Hc)=rank⁡(C)≤min⁡(d,n−1).\operatorname{rank}(H_c)=\operatorname{rank}(C)\leq\min(d,n-1).

Với 64 vector utterance, mỗi vector 768 chiều, covariance rank tối đa là 63. Nếu mỗi clip đóng góp 128 hàng token, số hàng thực tế khác. Tolerance và precision cũng ảnh hưởng cách đếm numerical rank.

3. SVD và PCA: hướng variance có thể khác hướng nhãn#

Rank đếm số hướng độc lập. Nullspace là tập vector bị phép biến đổi gửi thành zero, như Wv=0Wv=0 ở bài 5.

SVD dạng compact viết Hc=UΣV⊤H_c=U\Sigma V^\top. Các cột của VV là những hướng feature trực giao; singular values σi≥0\sigma_i\geq0 cho độ mạnh trên từng hướng; UU cho tọa độ của các mẫu. Suy ra

C=VΣ2n−1V⊤,λi(C)=σi(Hc)2n−1.C=V\frac{\Sigma^2}{n-1}V^\top,\qquad \lambda_i(C)=\frac{\sigma_i(H_c)^2}{n-1}.

PCA chọn các hướng có eigenvalue lớn để giữ variance và giảm squared reconstruction error trong họ phép chiếu tuyến tính cùng rank. Nó không đọc nhãn detection. S16: §§2.7–2.8 và 2.12.

Phản ví dụ đã tính: đặt h=[10u,v]h=[10u,v], với u,v∈{−1,+1}u,v\in\{-1,+1\} và bốn tổ hợp xuất hiện đều; nhãn là vv. Mean bằng zero và C=diag⁡(400/3,4/3)C=\operatorname{diag}(400/3,4/3). PCA một chiều giữ trục đầu vì variance lớn gấp 100 lần, nhưng bỏ toàn bộ tín hiệu nhãn trong toy này. Đây là ví dụ biên soạn, không phải kết quả Audio-JEPA.

4. Effective rank: cần ghi rõ ma trận và spectrum#

Roy–Vetterli định nghĩa effective rank của một ma trận khác zero, dựa trên singular values:

pi=σi∑jσj,H(p)=−∑ipiln⁡pi,reff=exp⁡H(p),p_i=\frac{\sigma_i}{\sum_j\sigma_j},\quad H(p)=-\sum_i p_i\ln p_i,\quad r_{\mathrm{eff}}=\exp H(p),

với quy ước 0ln⁡0=00\ln0=0. kk singular values khác zero bằng nhau cho reff=kr_{\mathrm{eff}}=k; chỉ một giá trị khác zero cho 1. Kết quả có thể không nguyên. S17: Roy & Vetterli (2007), §2.1 Definition và §2.2 Properties, toàn văn EURASIP.

Ví dụ đã giải: σ=[3,1]\sigma=[3,1] cho p=[0.75,0.25]p=[0.75,0.25], entropy ≈0.562335\approx0.562335 và effective rank ≈1.754765\approx1.754765. Nếu phân tích covariance với eigenvalues tỷ lệ [9,1][9,1], mass là [0.9,0.1][0.9,0.1], entropy ≈0.325083\approx0.325083 và effective rank ≈1.384145\approx1.384145.

Hai số mô tả hai đối tượng. Covariance là positive semidefinite nên singular values của nó bằng eigenvalues không âm; tính erank(C)(C) trên chúng khác tính erank(Hc)(H_c) trên σ(Hc)\sigma(H_c).

Nhân mọi singular value với 10−810^{-8} không đổi mass hay effective rank, nhưng variance giảm 10−1610^{-16}. Vì thế nhiễu rất nhỏ và trải đều vẫn có thể có effective rank cao. Với ma trận toàn zero, mẫu số bằng zero: công thức không xác định, cần báo degenerate hoặc công bố quy ước riêng. Không âm thầm gán 1.

5. CKA: tương đồng giữa hai tập biểu diễn trên cùng mẫu#

Cho X∈Rn×dxX\in\mathbb R^{n\times d_x} và Y∈Rn×dyY\in\mathbb R^{n\times d_y} đã center theo mẫu, với các hàng ứng với cùng mẫu và cùng thứ tự. Linear CKA là

CKA⁡(X,Y)=∥X⊤Y∥F2∥X⊤X∥F ∥Y⊤Y∥F.\operatorname{CKA}(X,Y)= \frac{\|X^\top Y\|_F^2}{\|X^\top X\|_F\,\|Y^\top Y\|_F}.

Frobenius norm ∥A∥F=∑ijAij2\|A\|_F=\sqrt{\sum_{ij}A_{ij}^2}. Có thể tính tương đương từ centered Gram matrices XX⊤,YY⊤XX^\top,YY^\top. Nếu một representation sau center là zero, denominator bằng zero. S18: Kornblith et al. (2019), §§2–3, Table 1 và §5.

Ví dụ đã giải: X=[−1,0,1]⊤X=[-1,0,1]^\top, Y=2XY=2X. Ta có X⊤Y=4X^\top Y=4, X⊤X=2X^\top X=2, Y⊤Y=8Y^\top Y=8, nên CKA =42/(2×8)=1=4^2/(2\times8)=1. Scale chung không đổi thống kê. Nếu nhãn độc lập với XX, CKA bằng 1 vẫn không làm representation hữu ích cho detection.

CKA hỏi hai cấu trúc biểu diễn giống nhau đến đâu trên tập mẫu đang xét. Nó chưa trả lời khả năng đọc nhãn hay nguyên nhân quyết định.

6. Linear probe, collapse và usefulness#

Linear probe giữ encoder cố định và học một classifier affine w⊤h+bw^\top h+b trên representation đã định nghĩa. Train/dev/heldout và regularization là một phần của protocol. Nó hỏi nhãn có đọc tuyến tính được trong protocol đó hay không.

Frozen encoder với trainable attentive pooling và MLP phi tuyến của paper không phải linear probe. Probe tốt có thể khai thác quan hệ source–label; chưa chứng minh cue generator nào đã được mã hóa, càng chưa chứng minh head dựa vào cue đó.

Phản ví dụ XOR: bốn điểm (±1,±1)(\pm1,\pm1) có nhãn B khi hai tọa độ cùng dấu, S khi khác dấu. Covariance là diag⁡(4/3,4/3)\operatorname{diag}(4/3,4/3), rank và effective rank đều bằng 2. Tuy nhiên một đường thẳng không tách đúng cả bốn điểm. Score phi tuyến h1h2h_1h_2 tách được. Linear probe kém chưa chứng minh mọi thông tin nhãn đã biến mất.

Nhiễu độc lập nhãn có thể có full rank; classifier lớn vẫn có thể nhớ train mà không tổng quát hóa. Ngược lại, rank 1 ở mục 2 chứa nhãn hoàn hảo. Total collapse là mọi mẫu cùng vector, khiến centered variance bằng zero. Dimensional collapse cần được định nghĩa theo phép đo và mục tiêu: low rank tự nhiên của một task một chiều chưa đủ gọi là failure. Các phân biệt này dựa trên phản ví dụ toán biên soạn.

7. Liên hệ paper và bài tập#

Lịch sử v41 có cosine/rank trên batch speech trong chương 06; chưa tái đo ở lượt này. Trước khi diễn giải cần biết layer, pooling, đơn vị clip/token, centering, spectrum và normalization. Chẩn đoán hình học không tự chứng minh objective làm mất forensic cue hoặc source bias gây EER.

  1. Với [1,0][1,0] và [0,2][0,2], tính norm, cosine và distance.
  2. HH có hai hàng [1,2],[3,4][1,2],[3,4]. Tính mean, sample covariance và giới hạn rank sau center.
  3. Với 20 utterance vectors, mỗi vector 768 chiều, covariance rank 300 có phù hợp không? Cần kiểm gì trước khi quy kết lỗi?
  4. Với σ=[1,1,0]\sigma=[1,1,0], effective rank bằng bao nhiêu? Nhân spectrum với 10−910^{-9} thay đổi gì? Nếu tất cả bằng zero thì sao?
  5. CKA bằng 0.95 và source probe tốt có chứng minh detector dựa vào source không?
Đáp án — mở sau khi thử
  1. Norm là 1 và 2; cosine 0; distance 5\sqrt5.
  2. Mean [2,3][2,3]; centered rows [−1,−1],[1,1][-1,-1],[1,1]; covariance [2222]\begin{bmatrix}2&2\\2&2\end{bmatrix}. Eigenvalues là 4 và 0; rank bằng 1 và tối đa n−1=1n-1=1.
  3. Không theo định nghĩa mỗi utterance là một hàng: tối đa 19. Kiểm số hàng thực tế, token/window, centering, cách tích lũy mẫu, định nghĩa metric và tolerance.
  4. Effective rank bằng 2; scale không đổi con số này nhưng variance giảm 10−1810^{-18}. All-zero không xác định theo công thức.
  5. Không. CKA đo tương đồng, probe đo decodability. Reliance của head cần bằng chứng về quyết định hoặc can thiệp có thiết kế phù hợp.

Đào sâu tự chọn#

Chứng minh CC positive semidefinite bằng a⊤Ca=∥Hca∥2/(n−1)≥0a^\top Ca=\|H_ca\|^2/(n-1)\geq0. Đọc entropy như kỳ vọng H(p)=E[−ln⁡p]H(p)=E[-\ln p], nối với bài 6. Khi so encoder, giữ sample order, domain, layer và preprocessing phù hợp. Thiết kế can thiệp tìm nguyên nhân thuộc lớp 5; lớp 1 chỉ xây nền tảng để đọc chúng.

DỪNG LẠI & TỰ KIỂM TRA

Bạn đã giải thích được cơ chế trong bài?

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.