06 — Đọc lại paper và đặt lịch sử nghiên cứu vào taxonomy#
Chương này là bản đồ. Học cơ chế qua mười bài lớp 6, đặc biệt waveform tới score, kết quả/uncertainty, lịch sử có version và claim–evidence. Sổ nguồn/root review tách reported result, code và unknown provenance.
1. Nguồn nào có thẩm quyền cho việc gì?#
Bản đã nộp: SOICT_2026_paper_4308.pdf, 14 trang, tiêu đề Audio-JEPA Representations for Speech Deepfake Detection. Đây là nguồn cho cấu hình và số liệu được báo cáo ở các mục 2–4 dưới đây.
Lịch sử nghiên cứu: các handoff và ghi chép preflight trong workspace dùng để hiểu nhánh đã thử, giả thuyết và việc chưa hoàn tất. Chúng chứa một số số liệu/kết luận cũ khác paper. Tài liệu ôn tập không coi chúng là kết quả mới tái lập.
Literature: nguồn primary được đối chiếu ngày 11/10/2026. Ngày nhận kết quả 12/10 là mốc do bạn cung cấp; việc học và đánh giá khoa học của đề tài độc lập với quyết định acceptance.
2. Đặt paper vào taxonomy#
| Trục | Paper của mình |
|---|---|
| Task | Audio-only, utterance-level genuine/spoof detection |
| Downstream supervision | Labels thật/giả, weighted cross-entropy |
| Front-end | Context encoder từ released Audio-JEPA checkpoint |
| Pretraining objective | Continuous masked latent prediction, đã chạy bởi tác giả checkpoint |
| Pretraining corpus | AudioSet-2M, paper ghi 5.338 giờ general audio |
| Kiến trúc | ViT-Base, 12 blocks, 768 width, 12 heads; 85,4 M encoder params |
| Input | Fixed 2,56 s crop, log-mel 256×128 |
| Token geometry | 8 time frames × 32 mel bins → 32×4 grid, 128 tokens |
| Back-end | Weighted layers + attentive statistics + MLP |
| Adaptation | Frozen và full fine-tuning |
| Score | |
| Protocol | Speech DF Arena toolkit; năm corpora |
| Metric | EER %, mean ± sample SD khi có ba seeds |
| Main comparison | Hai released checkpoints dưới common downstream recipe |
Đây là JEPA representations used for a supervised detector. Paper không huấn luyện một JEPA pretraining objective mới và không dùng predictor error làm detection score.
3. Truy vết waveform tới score#
| Bước | Shape / setting | Kiến thức cần nối |
|---|---|---|
| Toolkit input | 16 kHz, tile/truncate tới 64.600 samples (~4s) | Sample rate, fixed-length protocol |
| Model preprocessing | Resample 32 kHz, lấy đầu 2,56 s; tile nếu cần | Upsampling không thêm bandwidth; crop bỏ evidence ngoài đoạn |
| Log-mel | 128 bands, 25ms window, 10ms hop, 20–8.000Hz; waveform mean subtraction | Resolution và invariance |
| Frame handling | Pad/truncate tới 256 frames | Padding behavior phải nhất quán |
| Patch projection | 8×32 patch, 128×768 token sequence | Time-frequency geometry |
| Checkpoint adaptation | Bicubic interpolate 16×16 patch weights thành 8×32; regenerate position embedding | Shape equal chưa nghĩa semantics equal |
| Encoder readouts | 12 block outputs + final LN = 13 sequences | Layer information |
| Layer aggregation | Softmax-weighted sum | Learned representation selection |
| Attentive stats | Weighted mean + std = 1.536 dims | Pooling mất thứ tự, giữ dispersion |
| Classifier | LN → 1.536→256 → GELU → Dropout0,2 → 256→2 | Nonlinear frozen-mode head |
| Score | Logit difference | Ranking và calibration khác nhau |
Head có 495.632 parameters: 13 layer weights, 98.561 pooling và 397.058 classifier. Frozen mode học khoảng 0,5 M, nhưng toàn hệ vẫn khoảng 85,9 M parameters ở inference.
Training setup#
ASVspoof2019 LA train có 25.380 utterances: 2.580 genuine và 22.800 spoof. Giữ A05 và 600 genuine để theo dõi, còn 20.980 train samples. A05 không quyết định checkpoint main runs. Đây là attack holdout, không bảo đảm speaker/family disjoint.
Sáu epochs; batch 32; AdamW; weight decay 0,05; OneCycle 10% warm-up; AMP; encoder peak LR , head . CE upweight genuine khoảng 9,6 theo training subset. Augmentation duy nhất là mask kiểu SpecAugment: một time band tới16 frames và một frequency band tới16 bins.
Seeds: 1234, 2, 3, trừ ô được đánh dấu n=1. Dùng final six-epoch checkpoint; exploratory variants trước đó đã ảnh hưởng configuration choices.
4. Bảng số liệu cần nhớ và cách đọc#
Table 2 của bản PDF#
| Corpus | Genuine source | JEPA frozen | JEPA fine-tuned | AASIST re-run |
|---|---|---|---|---|
| DFADD | VCTK | 8,47 ± 0,35 | 10,75 ± 3,48 | 41,87 |
| ASVspoof2019 LA eval | VCTK | 17,70 ± 1,44 | 7,39 ± 0,69 | 0,83 |
| ADD2022 Track1 | Mandarin | Chưa chạy | 44,10 ± 2,04 | 47,92 |
| LibriSeVoc | LibriTTS | 47,38 ± 4,19 | 41,96 ± 2,93 | 37,95 |
| In-the-Wild | Web sources | 47,55 ± 8,55 | 52,00 (n=1) | 43,02 |
Không suy ra frozen tốt hơn fine-tune ngoài miền nói chung. DFADD ủng hộ frozen; LibriSeVoc mean ủng hộ fine-tune; In-the-Wild fine-tune chưa đủ seeds cho comparison ổn định.
Table 4: released checkpoint comparison#
| Corpus/regime | JEPA | AudioMAE | Gap MAE−JEPA theo PDF |
|---|---|---|---|
| ASV2019 fine-tune | 7,39 ± 0,69 | 13,25 ± 0,57 | +5,87 |
| ASV2019 frozen | 17,70 ± 1,44 | 25,25 ± 0,68 | +7,55 |
| DFADD frozen | 8,47 ± 0,35 | 11,04 ± 0,75 | +2,57 |
| ADD22-T1 fine-tune | 44,10 ± 2,04 | 42,02 ± 2,85 | −2,08 |
Gap chép theo bảng báo cáo; trừ hai mean đã làm tròn có thể khác0,01. Ba ô JEPA tốt hơn có seed ranges không chồng; đó là descriptive evidence, không phải significance test.
Những kết luận đứng được#
- Audio-JEPA là một front-end dùng được cho detection, đặc biệt DFADD trong recipe này.
- Released Audio-JEPA checkpoint tốt hơn released AudioMAE checkpoint ở ba trong bốn comparisons đã chạy.
- Frozen representation và fine-tuning tương tác khác nhau với corpus.
- Generalization của hệ hiện tại yếu trên nhiều corpus khác source; đây là giới hạn rõ của setup.
Những kết luận chưa đứng được#
- JEPA objective nhân quả tốt hơn reconstruction objective nói chung.
- JEPA luôn giữ synthesis artifacts tốt hơn MAE.
- Shared genuine source là nguyên nhân duy nhất của performance pattern.
- Giảm trainable params thành0,5 M làm detector inference chỉ lớn0,5 M.
- Hệ tổng quát hóa tốt chỉ vì đứng gần XLSR+SLS trên DFADD.
Published DFADD comparison có systems khác kiến trúc, pretraining, recipe và training subsets; Whisper-MesoNet khác downstream training data. Thứ hạng trong bảng có ý nghĩa trong điều kiện được nêu, không phải thứ hạng toàn lĩnh vực.
5. Những biến nào đã giữ giống, những biến nào còn khác?#
| Variable | JEPA vs MAE trong paper |
|---|---|
| Encoder family/scale | ViT-Base cùng họ/scale |
| Pretraining data source | Cùng AudioSet-2M source |
| Downstream input/head/data/recipe/seeds | Dùng chung |
| Pretraining objective | Khác |
| Pretraining masking/optimizer/sampling/budget | Còn khác |
| Native pretraining input | Khác frame count, sample rate và temporal patch span |
| Downstream displacement khỏi native config | Không đối xứng |
AudioMAE nhận256 thay1024 frames; token count quartered so với native. Audio-JEPA giữ full token count nhưng temporal patch span danh nghĩa đổi625→80ms; AudioMAE160→80ms. Giữ input chung kiểm soát downstream input nhưng không tạo native setting chung cho cả hai.
Đây là bài học về estimand: comparison đang đo transfer performance của hai model dưới cùng deployment/training recipe, không riêng causal effect của objective.
6. Lịch sử kỹ thuật: dùng để học, không đóng dấu “vĩnh viễn thất bại”#
Nguồn các hàng: handoff nhánh ngoài miền, handoff nhánh tiền huấn luyện, ghi chép preflight và lịch sử tuyên bố đã rút.
| Nhánh | Ghi chép đã có | Bài học taxonomy |
|---|---|---|
| JEPA + AASIST backend | Không cải thiện trong thử nghiệm đã ghi | Encoder geometry và graph topology phải tương thích; nguyên nhân thất bại chưa được causal isolation |
| Match native mel config | A05 tốt hơn, eval xấu hơn | Task/input adaptation và validation representativeness khác nhau |
| Frozen encoder | DFADD tốt, corpus khác không cùng pattern | Adaptation×corpus interaction |
| Ít epochs | Không giải quyết generalization trong các config đã thử | Loss saturation/overtraining chưa phải nguyên nhân duy nhất |
| Fusion ba seed | Không hơn seed tốt nhất ở comparison ghi lại | Ensemble diversity và calibration phải đo |
| A05 dùng chọn hyperparameters | Nhiều lần chọn sai hướng | Một attack holdout không đại diện toàn shift |
| Learning-rate sweeps | Optimum phụ thuộc corpus trong exploratory runs | Test-driven tuning tạo development contamination |
| Temporal patch sweep v40 | Handoff ghi patch (4,32) so với (8,32): DFADD 9,72 ± 1,07 so với 10,75 ± 3,48; LibriSeVoc 50,01 ± 0,61 so với 41,96 ± 2,93 | Trục này đã thử. Kết quả không bác bỏ mọi giả thuyết về fine-grained artifacts; ở lượt này chưa tái kiểm raw results |
| Speech continued-pretraining v41 | Preflight kỹ thuật và các số đo representation | Readiness/preflight khác completed pretraining study |
Một config thất bại không chứng minh cả họ kỹ thuật vô ích. Các chẩn đoán cũ như “chắc chắn do source” hoặc “không phải overfitting” mạnh hơn mức evidence cho phép; nên đọc chúng như working hypotheses lịch sử.
Một kết quả phụ đáng học: random frozen encoder#
Handoff ghi DFADD frozen: JEPA8,47±0,35; MAE11,04±0,75; random8,66±2,25. ASV2019 frozen: JEPA17,70±1,44; random14,25±1,48. Random fine-tune được ghi13,68 với n=1.
Các số này không nằm trong Table 4 của paper đã nộp và chưa tái lập ở lượt ôn tập. Chúng đặt câu hỏi quan trọng về inductive bias, random features, head capacity và source cues. Chúng chưa chứng minh pretraining “không có ích” hoặc JEPA đã collapse.
Một kết quả preflight về hình học representation#
Ghi chép v41/G4b báo các hàng speech batch B=64 dưới đây; đây là số trong handoff, chưa đo lại:
| Input path được notes gọi | Cross-utterance token cosine | Centered token effective rank | Normalized utterance std |
|---|---|---|---|
| Native-style config | 0,6793 | 263,1 | 0,0061 |
| Detection config | 0,7192 | 247,9 | 0,0060 |
Đọc collapse_metrics(H) cho thấy H[B,N,D] được reshape thành BN token rows rồi center; với B=64,N=128,D=768, bound là min(8192−1,768)=768, không phải 63. Effective rank dùng entropy của singular values σ, không σ². std_utt dùng mean raw tokens rồi L2-normalize từng utterance; đó là readout khác. Giải và phản ví dụ ở bài 8.
Code G4b mở stream riêng, lọc clips ≥10 s; G4 lọc ≥2,56 s, nên chưa đảm bảo cùng paired clip IDs. Native-style path cast audio 16 kHz rồi resample 32 kHz; fmax16k không tạo content trên8k. Đây chưa là isolation của input config. Có dấu anisotropy trong các speech batches được notes báo, nhưng speech khác AudioSet distribution; số này chưa chứng minh global checkpoint collapse hoặc anisotropy gây EER kém. Reference isotropic random vector không phải chuẩn khỏe phổ quát. Code/nguồn và unknowns.
Ghi chép cũng có random masks để khoảng90% target patches còn hàng xóm visible, và block masks giảm mạnh adjacency. Đây là đo task geometry; chưa chứng minh model thực sự chỉ dùng local interpolation.
7. Những khoảng mở trong taxonomy của chính dự án#
Các hàng dưới là trục học và câu hỏi chưa được kiểm hệ thống trong các nguồn đã đọc, không phải chọn đề tài hoặc khẳng định tuyệt đối chưa ai làm.
| Trục | Câu hỏi để hiểu sâu |
|---|---|
| Context vs target encoder | EMA branch có feature downstream khác context bao nhiêu? |
| Predictor use | Error giữ forensic evidence hay chỉ đo speech/channel difficulty? |
| Masking | Task difficulty và artifact retention liên hệ thế nào? |
| Pretraining domain | Speech/general audio khác ở domain, scale, quality hay exposure? |
| Source diversity | Detector có dùng source cues và có giảm reliance được không? |
| Augmentation/CMVN | Invariance nào có ích và invariance nào xóa evidence? |
| Parameter-efficient adaptation | Update hạn chế giữ cue nào so full fine-tune? |
| Multi-view/phase/temporal cues | Cue nào complementary với mel-ViT? |
| Localization/streaming | Pooling whole clip và fixed crop có giới hạn gì? |
| Calibration/open-world | Threshold và rejection policy transfer thế nào? |
| Causal objective comparison | Có thể tách objective khỏi masking/compute/input displacement ra sao? |
8. Thử trình bày paper của mình trong 90 giây#
“Chúng tôi dùng encoder từ Audio-JEPA làm front-end cho supervised speech deepfake detection. Model xử lý log-mel patches, kết hợp nhiều layer rồi pooling và classification. Chúng tôi so hai released checkpoints JEPA/AudioMAE bằng cùng downstream recipe, ở frozen và fine-tuned regimes. JEPA tốt hơn ở ba trong bốn comparisons, nhưng chưa tách hết differences tiền huấn luyện nên chưa chứng minh objective effect. Hệ đạt kết quả tốt trên DFADD nhưng yếu ở nhiều corpus khác genuine source; đó là association cần được nghiên cứu tiếp.”
Nếu có thể tự giải thích từng giới hạn trong đoạn này, bạn đã nối được nền tảng với bài hiện tại và có cơ sở đọc các bài mới một cách chủ động.