Bài 1 — Biểu diễn phải phục vụ điều gì?#
Bắt đầu lớp 3 · Tiếp: target và loss
Mục tiêu và tiền đề#
Sau bài này, bạn phân biệt được có thông tin, đọc được thông tin và thông tin còn hữu ích khi đổi miền; tự chứng minh một invariance có thể xóa bằng chứng; dùng sufficiency/bottleneck với đúng giả định. Cần vector và xác suất có điều kiện từ lớp 1. Nếu chưa quen, đọc cầu nối ngay dưới đây; không cần học information theory trước.
Một encoder nhận audio , trả . Downstream đọc để dự đoán nhãn . là tham số encoder; là tham số head. là vector hoặc là chuỗi token. Chiều feature không mang đơn vị Hz/dB mặc định.
Trực giác: người nghe hỏi “câu gì?”, người xác minh giọng hỏi “ai nói?”, forensic detector hỏi “quá trình tạo/biến đổi có phù hợp nhãn không?”. Cùng một audio nhưng ba câu hỏi cần các thông tin khác nhau. Đây là quan điểm representation phụ thuộc task trong Deep Learning, chương 15, phần mở đầu và §15.3. Các toy và liên hệ forensic dưới đây do chúng ta biên soạn, không phải kết quả checkpoint.
1. Ba yêu cầu không thay thế nhau#
Information: nếu hai input mang nhãn khác nhau bị map về đúng cùng , không head nào chỉ thấy phân biệt được chúng. Với nhãn không tất định, câu hỏi là có giữ posterior cần cho quyết định không.
Accessibility: giữ thông tin chưa có nghĩa head với dữ liệu ít và budget giới hạn đọc được. Head tuyến tính, MLP và attention pooling có năng lực khác nhau.
Stability: head có thể đọc rất tốt một cue đúng trong train nhưng mất quan hệ với nhãn ở test. Chuyển microphone, speaker hoặc genuine source có thể làm association đổi. Xem cue và domain shift, lớp 2.
Ba phép kiểm cũng khác: collision/conditional distribution cho information; probes có protocol cho accessibility; held-out conditions cho stability. Một source probe tốt mới chứng minh source decodable trong protocol ấy; chưa chứng minh detection head dựa vào source.
2. Ví dụ đã giải: giữ đủ một bit nhưng đọc không dễ#
Toy input , hai bit dấu độc lập , bốn tổ hợp có xác suất bằng nhau. Nhãn detection toy là . Hai encoder:
| Nhãn | |||
|---|---|---|---|
| −1 | −1 | −1 | |
| −1 | +1 | −1 | |
| +1 | −1 | +1 | |
| +1 | +1 | +1 |
cho head threshold ở 0 đọc nhãn ngay. cũng giữ đủ: , bởi . Tuy nhiên hai lớp nằm trên hai đường chéo, không thể tách hết bằng một đường thẳng. Proof nhỏ: nếu dương tại , cộng hai bất đẳng thức cho . Nếu nó âm tại , cộng cho . Mâu thuẫn. Với phân loại đúng nghiêm ngặt, classifier affine bất khả thi; tích hai tọa độ thì đủ.
Kết luận chính xác: linear accessibility khác information. Không dùng toy này để kết luận JEPA có hình học XOR; nó chỉ bác bỏ việc “linear probe kém ⇒ mọi thông tin nhãn đã mất”. Encoder và head phải được đọc cùng nhau.
3. Invariance và equivariance: giữ cái gì khi input đổi?#
Một biến đổi có thể là gain, codec, đổi microphone hoặc time shift. Invariance yêu cầu
Equivariance yêu cầu
với là tác động tương ứng trong representation. Ví dụ token sequence dịch theo thời gian có thể dịch các vị trí feature tương ứng, thay vì tất cả feature giữ nguyên. Padding, absolute positions, crop và boundary khiến network thực không mặc nhiên equivariant.
Một proof về mất cue. Giả sử và có nhãn tất định khác nhau theo task đã định nghĩa, nhưng encoder bị buộc invariant. Head thấy cùng vector cho hai đáp án. Nếu cặp xuất hiện cân bằng, head chỉ đạt tối đa 50% trên cặp đó. Nếu xác suất hai phần tử là , ít nhất khối lượng bị sai trong bài toán chỉ gồm cặp. Đây là giới hạn do observation collision, không do classifier yếu.
Trong forensic task, một phép làm mượt có thể xóa dấu synthesis; cùng phép ấy có thể giữ transcript. Nhưng không có bằng chứng ở đây rằng mọi codec/làm mượt luôn đổi nhãn hoặc luôn xóa cue. Nếu task coi codec genuine là hợp lệ, ta muốn quyết định ổn định với codec trong điều kiện đó; không nhất thiết muốn xóa mọi thông tin codec ở mọi layer. Head có thể dùng channel information để điều chỉnh cách đọc cue khác.
Một hệ thống có thể giữ equivariant/token detail ở encoder, rồi tạo invariance ở pooling/head. Đừng suy từ invariance của score sang invariance của từng hidden layer.
4. Sufficiency: đủ cho một nhãn, không đủ cho mọi nhãn#
Cầu nối toán: là phân phối nhãn khi đã biết input; “ độc lập với khi biết ” viết .
Với , sufficiency cho dự đoán nhãn ở một joint distribution đang xét có thể diễn đạt:
Nghĩa là biết thêm ngoài không cải thiện posterior đúng. Không yêu cầu khôi phục waveform. Nếu là transcript, representation giữ transcript có thể sufficient cho , vẫn không sufficient cho nhãn spoof .
Toy gồm ba bit độc lập cân bằng: content , artifact , channel . Đặt transcript và forensic label . đủ cho nhưng không chứa thông tin về : . đủ cho cả hai trong toy. có thể đạt train accuracy cao nếu dataset train gắn channel với nhãn; khi độc lập với ở test, nó không còn sufficient. Những tên “content/artifact/channel” là giả định của toy, chưa xác nhận factorization của audio thật.
Sufficiency về xác suất cũng không tự bảo đảm accessibility với head hữu hạn, hoặc sufficiency sau domain shift. Phải nói task, distribution và họ head.
5. Bottleneck: nén theo relevance nào?#
Với biến rời rạc, mutual information đo mức giảm uncertainty:
Log cơ số 2 cho đơn vị bit. Hai biến độc lập cho 0; một bit cân bằng được giữ hoàn hảo cho 1 bit. Information bottleneck chuẩn đặt trade-off
Term đầu ưu tiên nén input; term sau ưu tiên giữ relevance đối với . Nguồn gốc là Tishby, Pereira, Bialek, The information bottleneck method, §3, Eq. 14–15. Nó giả định joint distribution và một mapping xác suất; không phải công thức mà mọi encoder SSL thực đang tối ưu.
Trong toy ba bit ở mục 4: có , , . có , , . Bottleneck chỉ quan tâm có lý do ưu tiên bỏ . Khi thay relevance bằng , đáp án tốt đổi. Ít thông tin hơn không đồng nghĩa tốt hơn; phải hỏi thông tin về cái gì.
Giới hạn: mutual information không đo head complexity, robustness hoặc reliance; ước lượng ở chiều cao khó; deterministic mappings giữa biến liên tục có thể làm MI vô hạn/không tương ứng entropy rời rạc. Không dùng kích thước 768 hay norm để tuyên bố “encoder nén còn 768 đơn vị thông tin”. Nhánh sâu này là lăng kính phân tích, không proof JEPA tối ưu forensic sufficiency.
6. Neo vào Audio-JEPA#
Paper SOICT §3 dùng chuỗi token của context encoder, kết hợp layer rồi attentive statistics pooling và MLP. Frozen mode vẫn có head phi tuyến; không phải linear probe. Encoder được học trước bằng một nhiệm vụ khác nhãn spoof. Vì thế phải hỏi: checkpoint giữ cue nào, head đọc được cue nào, và quan hệ có bền ngoài miền không. Giải phẫu paper.
Latent prediction không tự bảo đảm target chỉ chứa semantics hoặc luôn bỏ noise. Target học được và có contextualization; task SSL cùng corpus/normalization/architecture quyết định ưu tiên. Bài 6 sẽ truy vết recipe thay vì dùng “semantic” như một chứng minh.
Bài tập tăng dần#
- Một encoder trả đúng transcript nhưng bỏ mọi thông tin khác. Nó tốt cho ASR có đủ để kết luận tốt cho detection không? Nêu giả định cho câu trả lời.
- Tự khôi phục từ và chứng minh không thể tách tuyến tính bốn điểm.
- Encoder invariant với , nhưng hai input trong một cặp có nhãn khác nhau và tần suất 80/20. Best accuracy trên cặp là bao nhiêu?
- Toy ba bit: tính MI của với . Một bit có ít hơn hai bit nhưng task nào được lợi?
- Source probe đạt 95% và detection tốt trên cùng source. Viết điều được biết và một điều chưa biết.
Đáp án — thử giải thích trước khi mở
- Chỉ đủ nếu nhãn detection được xác định từ transcript trong distribution ấy; điều này không được giả định cho speech deepfake. Cùng transcript có thể có genuine và spoof.
- ; proof cộng bất đẳng thức ở mục 2 cho đồng thời dương và âm.
- Chọn nhãn phổ biến đạt 80%, sai tối thiểu 20%. Không head nào khôi phục thông tin đã bị map về cùng vector.
- , , bit. Tốt cho , không cho trong toy độc lập.
- Biết source decodable trong protocol probe và hệ detection có performance quan sát được. Chưa biết head dùng source để quyết định; cần đối chứng quan hệ source–label và competing cues.
Đào sâu tự chọn#
Với loss quyết định riêng, một representation có thể đủ cho Bayes decision mà không giữ toàn posterior; criterion sufficiency ở trên mạnh hơn. Đọc lại hình học/probe lớp 1, thử một phép biến đổi khả nghịch bảo toàn thông tin nhưng đổi margin tuyến tính. Đích là tách information khỏi cách đọc, không dựng một scalar “quality” chung cho mọi task.