Bài 9 — Encoder downstream và prediction-error scoring#
Đích học: giải thích hai cách dùng khác nhau của SSL; chứng minh prediction error chưa tự là density hoặc likelihood ratio; đọc đúng score của manuscript hiện tại. Cần bài 2, 6, 8 và xác suất/loss ở lớp 1.
1. Hai đường tính toán#
Encoder downstream: audio → frontend → encoder → pooling/head → score. Head có thể học bằng nhãn genuine/spoof, còn encoder được freeze hoặc fine-tune. Target encoder/predictor pretraining có thể được bỏ. Loss downstream có thể là CE và không còn là objective pretraining.
Prediction-error score: audio → chọn mask → context encoder/predictor → so với target features → aggregate error. Ở đây encoder, predictor, target generation, mask distribution và normalization cùng xác định score. Phải định nghĩa chiều score và quy tắc aggregate trước khi nói detection.
Pretraining Audio-JEPA học trên general audio; paper dùng encoder cho downstream tasks. Không có lý do từ objective alone để cho rằng “spoof khó dự đoán hơn genuine”. Một synthetic speech trơn, đều có thể dễ dự đoán hơn genuine có tiếng nền hoặc chuyển giọng. Đây là khả năng logic, không phải kết quả thực nghiệm của checkpoint. Audio-JEPA §§III–IV.
2. Error đo predictability trong không gian nào?#
Đặt một score giả định:
Nó đo khả năng dự đoán target theo recipe . Trong Audio-JEPA, target teacher nhìn full spectrogram; target vector contextualized không phải giá trị patch raw. Trong code normalized loss, score còn loại scale và mean target theo cách bài 6 đã chỉ ra.
Toy: target ở một vị trí là , context cho biết , predictor trả . Với thì error 0; với thì error 4. Cho cả genuine lẫn spoof đều có trường hợp smooth () và rough (): cùng error có thể thuộc cả hai nhãn. Error đang đo phần không dự đoán được trong toy, chưa định danh nguồn tạo audio.
Nếu thay bằng , raw squared error nhân . Nếu dùng unit-normalized cosine loss thì scale dương chung có thể bị triệt tiêu. Đổi mask từ patch kề visible sang block xa context cũng đổi error mà không đổi audio. “Error lớn” phải có đơn vị, mask recipe và reference population.
3. Energy, density và likelihood ratio#
Có thể gọi một scalar không âm là energy, nhưng để biến thành density phải có measure và normalization:
Không biết , không biết density có chuẩn hóa hữu hạn, và được thiết kế trên latent/masks chứ không trên raw audio thì không tự có . Đẳng thức này là định nghĩa mô hình energy có điều kiện bổ sung, không phải thuộc tính tự có của JEPA.
MSE tương đương negative log-likelihood Gaussian có điều kiện nếu target có density với variance cố định và các giả định cụ thể:
Điều này vẫn là density của target trong không gian đã định nghĩa. Nó chưa cung cấp : encoder có thể nhiều-một, target thay đổi trong training, mask lấy ngẫu nhiên, và cần cả distribution của context để có joint density. Một conditional score trên một số positions không tự là likelihood toàn utterance.
Detection tối ưu theo một mô hình xác suất có thể dựa trên:
cùng prior và cost để đặt threshold. Một energy duy nhất không cho cả hai class-conditional densities. Ngay cả true genuine density thấp cũng có thể là genuine ngoài miền. Novelty/OOD và spoof là hai định nghĩa nhãn khác nhau.
4. Fine-tune encoder có thể phá cặp encoder–predictor#
Ban đầu predictor và target cho , error 0. Fine-tune/đổi hệ tọa độ encoder bằng phép quay khả nghịch , nhưng giữ predictor cũ trả . Error vector-squared thành . Thông tin trong biểu diễn không mất vì khả nghịch; predictor chỉ đang ở hệ tọa độ cũ. Nếu cả prediction và target cùng quay, error vẫn 0.
Toy này không chứng minh fine-tune thực tế tạo một phép quay, hoặc error của checkpoint cụ thể sẽ tăng. Nó chứng minh representation usefulness và predictor compatibility là hai thuộc tính khác nhau. Freeze encoder downstream và encoder được fine-tune cần được ghi riêng khi đọc bất kỳ latent-error proposal nào.
5. Manuscript SOICT đang làm gì?#
Đối chiếu trực tiếp §§3.1–3.4, trang 3–6 của SOICT_2026_paper_4308.pdf; file này ở Downloads, không nằm trong study tree. Phiếu nguồn ghi đường dẫn và SHA-256. Không sửa manuscript trong lượt này.
Đường downstream được paper mô tả là context encoder Audio-JEPA + learned layer combination + attentive statistics pooling + MLP classifier. Mười ba outputs (12 blocks + final normalization) được weighted-sum; pooling mean/std tạo 1,536 chiều; MLP 1,536→256→2, GELU/dropout. Loss là weighted CE, score dùng . Predictor và target encoder pretraining không xuất hiện trong detector này.
Frozen setting vẫn train layer weights, pooling và MLP: đó là frozen encoder với nonlinear head, không phải linear probe. Fine-tune setting cho gradient vào context encoder. Việc paper Audio-JEPA gốc đánh giá target encoder và manuscript dùng context encoder là lựa chọn khác nhau; chưa có kiểm chứng trong lượt này về tác động của lựa chọn đó.
Với CE binary, bằng softmax output cho lớp genuine của head. Nhưng weighted CE không tự cho deployment posterior được calibration. Ở bài toán population lý tưởng với weights , optimum theo mỗi là:
Ví dụ cho , logit . Đây là suy ra từ weighted CE trong toy population, không phải đo calibration của model. Sampling, regularization, finite data và domain priors còn làm khác optimum. Xem lớp đánh giá để học threshold/calibration sâu hơn; lớp 3 chỉ cần không gắn nhầm nghĩa xác suất cho score.
Frontend downstream cũng khác native pretraining: paper dùng 2.56 s, 256 time frames, patch 8 time ×32 mel thay vì native 10 s và patch 16×16. Cùng 128 tokens không có nghĩa cùng độ phân giải vật lý. Bài 6 đã truy dấu geometry; đây là một confound khi giải thích transfer, chưa chứng minh nguyên nhân thắng/thua.
6. Cách đọc một claim score mà không vượt bằng chứng#
| Claim | Bằng chứng tối thiểu để diễn giải đúng |
|---|---|
| “Encoder tốt cho task” | Head, frozen/fine-tune, split, metric và domain của downstream |
| “Error là anomaly score” | Training population, mask/loss/aggregation và anomaly definition |
| “Error là spoof score” | Genuine/spoof protocol, polarity, threshold chọn trên dev, held-out attacks/domains |
| “Output là xác suất” | Target probability, weighted/sampled training, calibration protocol và test distribution |
| “Objective JEPA hơn MAE” | Kiểm soát data, frontend, architecture, compute và downstream recipe; pretrained checkpoint comparison alone chưa isolate objective |
Các mục là yêu cầu về bằng chứng khi đọc paper, không phải lựa chọn hướng nghiên cứu hay lệnh chạy experiment.
7. Tự kiểm tra#
- Smooth spoof có thể có latent error thấp không? Điều đó mâu thuẫn JEPA objective không?
- Giả định Gaussian trên latent target đủ để suy chưa?
- Trong toy quay hệ tọa độ, thông tin mất hay cặp predictor/target không tương thích?
- Frozen encoder + attentive pooling + MLP có phải linear probe không?
- Với weighted CE , softmax 0.9 tự là genuine posterior trong deployment không?
- Hai encoder đều tạo 128 tokens có bảo đảm chúng nhìn cùng thời lượng và frequency bandwidth không?
Đáp án và lý do
- Có thể; objective thưởng target predictability, chưa định nghĩa class genuine/spoof.
- Chưa. Đó là conditional latent density dưới giả định; cần mapping, measure, context distribution và class model.
- Hệ tọa độ đổi khả nghịch nên thông tin giữ; predictor cũ không tương thích.
- Không. Head có attention/statistics và nonlinear MLP.
- Không. Class weights dịch optimum, cùng các khác biệt về sampling/prior/domain; cần kiểm chứng calibration riêng.
- Không. Token count không xác định physical time/frequency geometry.
Đọc tiếp: Biến thể và đọc bằng chứng.