Bài 1 — Câu hỏi nghiên cứu và bản đồ paper#
Mục tiêu và tiền đề#
Tách bốn câu hỏi: hệ làm gì, học thế nào, thí nghiệm đo gì và đóng góp thuộc loại nào. Cần task/labels lớp 2, representation phục vụ task lớp 3, estimand lớp 5.
1. Tên paper chưa nói loss downstream#
Audio-JEPA là nguồn representation; speech deepfake detection là task. PDF §3 trang 3–6 dùng context encoder đã tiền huấn luyện trên AudioSet, thêm back-end, rồi học nhãn bona fide/spoof bằng weighted cross-entropy. Nhóm mình không tiền huấn luyện Audio-JEPA trong thí nghiệm này; latent prediction error không phải detector score.
Với waveform x, tiền xử lý r, encoder từ checkpoint c là f_c và back-end là h_ψ:
Frozen giữ tham số encoder, vẫn học ψ. Full fine-tuning cập nhật cả encoder và ψ. Score d là scalar không có đơn vị vật lý, high=B. Output cấp utterance không cho timestamp của đoạn giả.
2. Hai câu hỏi thực nghiệm lồng nhau#
Q1 — Hệ chuyển giao ra sao? Train trên subset ASV2019 LA, đánh giá EER trên năm corpus. AASIST và published systems cung cấp bối cảnh cho complete systems, với điều kiện huấn luyện riêng của mỗi hệ.
Q2 — Hai checkpoint chuyển giao khác nhau thế nào? Giữ recipe downstream h, thay c=JEPA/MAE, xét regime a và corpus D. Gọi M(c,h,a,D) là mean EER qua training seeds:
Δ dương nghĩa JEPA có mean EER thấp hơn trong contrast ấy. Đây là estimand có điều kiện. Muốn đo tác động nhân quả của objective phải định nghĩa intervention trên objective và kiểm các upstream factors. Hai released checkpoints chưa tạo intervention đó. Bài 6, PDF §3.4 trang 6 và §8 trang 12.
3. Mỗi phần paper phục vụ một câu hỏi#
| Phần PDF | Điều cần lấy | Điều chưa tự suy ra |
|---|---|---|
| Abstract/§1, trang 1–2 | Motivation và phạm vi comparison | Objective causality |
| §2, trang 2–3 | Related targets, methods, benchmarks | Novelty chỉ từ tên JEPA |
| §3/Fig. 1, trang 3–6 | Forward path và update path | Đã tái lập run |
| §4/Table 1, trang 6–8 | Train/exposure/protocol/gates | Mọi source/generator đều disjoint |
| §5/Tables 2–4, trang 8–10 | Observations và uncertainty được báo | Significance hoặc mechanism |
| §6, trang 9–11 | Hypotheses và counterexamples | Cue retention đã được đo trực tiếp |
| §§7–8, trang 11–12 | Open questions và limitations | Các hướng mới đã chạy thành công |
Đọc limitation cùng bảng giúp xác định bảng trả lời câu hỏi nào. Nó không làm observation mất giá trị.
4. Ví dụ: ba câu cùng dùng ô DFADD#
Table 2 trang 9 báo frozen DFADD 8,47 ± 0,35% EER, n=3.
- “Hệ frozen có mean EER 8,47 trong setup này.” Đúng mức observation P.
- “Released JEPA tốt hơn MAE ở DFADD frozen.” Cần thêm MAE 11,04 ± 0,75 ở Table 4 và common recipe; gap là 2,57 pp.
- “Latent prediction giữ artifact tốt hơn reconstruction.” Cần xác định cue, đo retention và kiểm objective contrast; bảng chưa đo các điều đó.
Phản ví dụ: random frozen features cũng có thể cho nonlinear head đọc mel cues. Một kết quả gần JEPA trong lịch sử không phủ nhận ô 8,47; nó giới hạn việc giải thích ô ấy hoàn toàn bằng pretraining. Xem bài 7.
5. Tự kiểm#
- Vì sao tên Audio-JEPA detector chưa cho biết loss downstream?
- Cùng ViT-Base và AudioSet đã đủ gọi Δ là effect của objective chưa?
- Frozen thắng MAE loại được giải thích nào, còn khác biệt nào?
- Viết một câu cho ô 8,47 gồm task, condition, metric và evidence level.
Đáp án và reasoning
- Tên cho nguồn features; phải đọc update path. PDF §3.3 báo supervised weighted CE.
- Chưa: input, masking, normalization, optimization, data realization/budget và encoder branch còn khác.
- Gap ấy không cần fine-tuning encoder; vẫn có learned head, input adaptation và upstream differences.
- Ví dụ: “Theo recipe downstream ASV2019-subset được paper báo cáo, hệ frozen Audio-JEPA đạt 8,47 ± 0,35% EER qua ba seed trên bản DFADD được đánh giá.” Đây là reported result, chưa phải rerun ở lớp học.
Đào sâu: chọn một câu abstract, trace tới table/section, rồi viết một giải thích khác cũng phù hợp observation. Xem claim lớp 5 và bài 9.