# 07 — Bản đồ literature để học theo câu hỏi

Đối chiếu nguồn web ngày 11/10/2026. Mục đích của danh mục là biết **đọc gì để hiểu một cơ chế**, không phải gom references hoặc chốt hướng nghiên cứu.

## 1. Mức đọc và mức xác minh

- **F:** đọc toàn văn của bản được dùng, có kiểm hình/bảng khi cần. Trong lượt này áp dụng cho paper SOICT bạn gửi.
- **P:** đọc phần giới thiệu/abstract trong PDF local và/hoặc phần liên quan; chưa đọc lại toàn văn ở lượt này.
- **A:** đối chiếu abstract/metadata trên nguồn primary. Có thể định vị phương pháp nhưng chưa đủ để triển khai hoặc diễn giải mọi kết quả.
- **R:** kiểm tra trang/repository/model card; declaration “có code/checkpoint” chưa tương đương tải, load và chạy thành công.

Một paper có trong workspace không đồng nghĩa mình vừa đọc lại hết nó. Dùng các phân loại dưới để phân biệt học liệu đã dựng với việc đọc sâu còn cần làm.

## 2. Đường đọc cốt lõi

Sau chương01–02, ưu tiên: **wav2vec2 → HuBERT → AudioMAE → data2vec → I-JEPA → Audio-JEPA → AASIST/SSL anti-spoofing → generalization benchmark → paper mình**. BYOL/VICReg bổ sung khi đến phần chống collapse. Mỗi lần đọc chỉ cần lấy một thiết kế cơ chế thật rõ rồi so với bài trước.

| # | Nguồn primary | Học để trả lời câu hỏi nào? | Mức |
|---|---|---|---|
| 1 | [wav2vec2 — Baevski et al.,2020](https://arxiv.org/abs/2006.11477) | Quantized targets và contrastive loss phối hợp ra sao? Context masking diễn ra ở đâu? | P/A |
| 2 | [HuBERT — Hsu et al.,2021](https://arxiv.org/abs/2106.07447) | Vì sao cluster pseudo-labels có thể học representation dù không phải phoneme labels chuẩn? | P/A |
| 3 | [WavLM — Chen et al.](https://arxiv.org/abs/2110.13900) | Masked-unit prediction cộng denoising thay đổi thông tin được giữ thế nào? | P/A |
| 4 | [AudioMAE — Huang et al.,2022](https://arxiv.org/abs/2207.06405) | Decoder reconstruct cái gì, mask/token grid ra sao, encoder được evaluate thế nào? | P/A |
| 5 | [data2vec — Baevski et al.,2022](https://arxiv.org/abs/2202.03555) | Contextualized continuous teacher targets khác hard units thế nào? | P/A |
| 6 | [I-JEPA — Assran et al.,2023](https://arxiv.org/abs/2301.08243) | Context/target geometry có vai trò gì trong semantic representation? | P/A |
| 7 | [Audio-JEPA — Tuncay et al.](https://arxiv.org/abs/2507.02915) | Những quyết định nào được chuyển từ ảnh sang spectrogram, và domain fit ra sao? | P/A/R |
| 8 | [AASIST — Jung et al.](https://arxiv.org/abs/2110.01200) | Spectral/time nodes và heterogeneous graph attention được xây từ feature nào? | P/A |
| 9 | [SSL front-ends for spoofing — Wang,Yamagishi,2022](https://www.isca-archive.org/odyssey_2022/wang22_odyssey.html) | Encoder, backend và fine-tuning có tương tác gì? | A; cần đọc sâu khi học |
| 10 | [wav2vec2 + augmentation — Tak et al.,2022](https://www.isca-archive.org/odyssey_2022/tak22_odyssey.html) | Một recipe SSL anti-spoofing gồm những thành phần nào ngoài encoder? | A; cần đọc sâu khi học |
| 11 | [Does Audio Deepfake Detection Generalize? — Müller et al.,2022](https://www.isca-archive.org/interspeech_2022/muller22_interspeech.html) | Cross-dataset failure khác in-domain accuracy thế nào? | A; cần đọc toàn văn |
| 12 | [Speech DF Arena — Dowerah et al.,2025](https://arxiv.org/abs/2509.02859) | Toolkit thống nhất cái gì và không thống nhất cái gì giữa systems? | P/A |
| 13 | [Paper SOICT của mình](<C:/Users/LENOVO/Downloads/SOICT_2026_paper_4308.pdf>) | Claim nào là observation, checkpoint comparison hay hypothesis? | F |

Các PDF nền1–8,12 được mở phần đầu trong workspace; phương pháp Audio-JEPA còn được đối chiếu với snapshot `jepa_module.py`. Đây không phải audit toàn bộ repo upstream hoặc re-run checkpoint.

## 3. Đọc theo khối nền tảng

| Khối | Nguồn | Mục tiêu học |
|---|---|---|
| DSP | [The Scientist and Engineer’s Guide to DSP — Steven W. Smith](https://www.dspguide.com/) | Sampling, convolution, Fourier, filters và time-frequency trade-offs |
| Toán và DL | [Deep Learning — Goodfellow,Bengio,Courville](https://www.deeplearningbook.org/) | Linear algebra, probability, optimization, regularization, representation learning |
| Speech | [Speech and Language Processing — Jurafsky,Martin](https://web.stanford.edu/~jurafsky/slp3/) | Phonetics/acoustics và speech processing vocabulary |
| Tổng quan detection | [A Survey on Speech Deepfake Detection — Li et al.](https://arxiv.org/abs/2404.13914) | Tasks, features, models và data taxonomy; sau đó tìm primary papers |
| Survey khác | [Audio Deepfake Detection: A Survey — Yi et al.](https://arxiv.org/abs/2308.14970) | So sánh cách tổ chức dataset/feature/classifier/evaluation |

Trang sách đã được xác minh; không đọc hết các sách trong lượt này. Khi đọc survey, dùng nó như index để tìm primary method/protocol, không lấy mọi số leaderboard từ survey làm confirmed-current.

## 4. Đọc để hiểu generation và forensic cues

| Nguồn | Câu hỏi học tập | Mức |
|---|---|---|
| [HiFi-GAN](https://arxiv.org/abs/2010.05646) | Waveform synthesis và periodic structure được mô hình hóa thế nào? | A |
| [VITS](https://arxiv.org/abs/2106.06103) | Vì sao một TTS có thể kết hợp VAE, flow và adversarial training? | A |
| [EnCodec](https://arxiv.org/abs/2210.13438) | Quantization và decoder làm biến đổi audio ra sao? | A |
| [F5-TTS](https://arxiv.org/abs/2410.06885) | Flow matching là gì, khác normalizing flow và TTS task ra sao? | A |
| [DFADD](https://arxiv.org/abs/2409.08731) | Generator families, genuine source và evaluation subset được xây thế nào? | A và mô tả qua paper mình; cần đọc original đầy đủ |
| [LibriSeVoc / neural vocoder artifacts](https://arxiv.org/abs/2304.13085) | Resynthesis giúp tách content/source khỏi generator theo thiết kế nào? | A và mô tả qua paper mình; cần đọc original đầy đủ |
| [PartialSpoof — Zhang et al.,2021](https://www.isca-archive.org/interspeech_2021/zhang21ca_interspeech.pdf) | Một clip có đoạn fake ngắn cần labels và model output nào? | A/phần đầu được đối chiếu |

Không cần học mọi generator để nghiên cứu detection. Cần đủ hiểu pipeline để tránh gọi cue của vocoder/codec/channel bằng tên của mô hình acoustic khác trong cùng hệ.

## 5. Đọc để hiểu anti-collapse và pooling

| Nguồn | Câu hỏi | Mức |
|---|---|---|
| [BYOL](https://arxiv.org/abs/2006.07733) | Predictor/teacher asymmetry khác negative sampling thế nào? | A |
| [VICReg](https://arxiv.org/abs/2105.04906) | Match representations và giữ spread được đặt thành loss terms riêng ra sao? | A |
| [Attentive Statistics Pooling](https://www.isca-archive.org/interspeech_2018/okabe18_interspeech.html) | Mean+std và attention giữ thông tin gì khi tóm tắt chuỗi? | A; formulation còn đối chiếu trong paper mình |
| [RawBoost](https://arxiv.org/abs/2111.04433) | Các loại perturbation waveform mô hình nuisance khác nhau thế nào? | A |
| [ASVspoof5 evaluation plan](https://www.asvspoof.org/file/ASVspoof5___Evaluation_Plan_Phase2.pdf) | Khi nào cần discrimination, calibration hoặc SASV cost? | Các phần metric được đối chiếu |

## 6. Cập nhật 2026 để hoàn thiện taxonomy

Những bài này không tự quyết định hướng bài mới. Chúng cho thấy các lựa chọn thiết kế đã phong phú hơn khi ta quay lại đề tài.

| Nguồn | Điểm định vị ngắn | Điều cần đọc tiếp | Mức |
|---|---|---|---|
| [GMM-Anchored JEPA](https://arxiv.org/abs/2602.09040) | Continuous JEPA được hỗ trợ bằng frozen GMM soft targets | Anchor loss, decay schedule, matched compute và dữ liệu | A |
| [S-JEPA](https://arxiv.org/abs/2606.19398) | JEPA-style decomposition với soft GMM posteriors; online clustering | Khác gì so bản GMM-Anchored ở trên; không mặc định là cùng recipe | A |
| [BEST-RQ-2](https://arxiv.org/abs/2606.30700) | Discrete random targets nhưng contextualize–predict tách hai bước | Target choice vs decomposition vs domain fit | A/R qua model card |
| [GLaS-JEPA, 29/09/2026](https://arxiv.org/abs/2609.37798) | Continuous current-encoder targets, SIGReg, không separate EMA teacher | Formulation và chống collapse; transfer tới forensics vẫn là câu hỏi | A |
| [Alethia](https://arxiv.org/abs/2605.00251) | Forensics-oriented pretraining kết hợp masked embedding prediction và flow-matching reconstruction | Target/loss/data/supervision khác JEPA baseline mình ở đâu? | A |
| [Spoof-SUPERB](https://arxiv.org/abs/2603.01482) | Benchmark nhiều speech SSL front-ends cho deepfake detection | Head, frozen protocol, data/perturbations, scores | A/R |
| [Data-centric generalization,ACL2026](https://aclanthology.org/2026.acl-long.796/) | Nghiên cứu diversity và sampling khi xây/trộn dữ liệu | Diversity được định nghĩa/đo và kiểm compute thế nào? | A |
| [Teffic-Audio technical report,v2](https://arxiv.org/abs/2607.28351v2) | Multi-source data, balanced sampling và augmentation recipe | Điều kiện exposure với từng benchmark; không gán improvement riêng cho kiến trúc | A |

### Những chi tiết cần cập nhật cách nghĩ

**EMA không phải điều kiện bắt buộc của mọi JEPA.** GLaS-JEPA là ví dụ từ abstract cho hướng không dùng separate EMA teacher. **Continuous target không phải điều kiện của mọi hệ tự gọi JEPA-style.** S-JEPA giúp hiểu cần mô tả target thực tế.

**“Áp latent prediction vào deepfake” chưa đủ định nghĩa novelty.** Alethia và các continuous-feature SSL là related work cần đọc khi phân tích đóng góp; chưa đủ căn cứ để kết luận chúng trùng hay loại bỏ mọi ý tưởng JEPA-specific.

**Multi-source training không phải gian lận nếu evaluation split hợp lệ.** Nó chỉ thuộc điều kiện training/exposure khác single-corpus unseen-domain comparison. Không dùng lời mạnh trong handoff cũ thay cho overlap audit.

### Revision và resource availability

Trang [Audio-JEPA](https://arxiv.org/abs/2507.02915) hiện ghi v2 revised 26/09/2026, sau mốc chuẩn bị bài của mình. Đã xác minh metadata này; chưa diff toàn văn v1–v2 nên không suy ra method/results đã đổi.

[Repo tác giả](https://github.com/LudovicTuncay/Audio-JEPA) và [model card](https://huggingface.co/ltuncay/Audio-JEPA) vẫn là nguồn tra cứu. Model-card metadata và paper link không thay exact checkpoint/config identity. Không đổi benchmark name hoặc checkpoint identity dựa riêng vào tag.

Ghi chú cũ “không có speech-JEPA checkpoint public” là snapshot lịch sử, không dùng như fact hiện tại. Danh mục này chưa xác nhận mọi checkpoint mới tải/load được. Resource availability cần kiểm riêng khi thực sự triển khai.

## 7. Đọc paper bằng một phiếu cố định

Với mỗi nguồn, ghi:

1. **Task/threat model:** output, labels, operating conditions.
2. **Data:** unique hours, source, language, generator, pretraining exposure.
3. **Representation:** signal transform, tokenization, layer outputs.
4. **Learning:** targets, loss, gradients, teacher updates, anti-collapse.
5. **Transfer:** frozen/fine-tune/PEFT; selection/search budget.
6. **Evaluation:** split, baselines, metrics, threshold, uncertainty.
7. **Claim:** observation hay causal explanation; evidence cho từng claim.
8. **Counterexample:** điều kiện nào có thể làm lập luận sai?

Đọc method và experimental setup trước khi cố nhớ mọi số. Đối chiếu code cho mask implementation, target normalization, teacher branch, positional encoding và checkpoint selection. Sau đó mới quyết định số nào có ý nghĩa với câu hỏi của mình.

## 8. Những tài liệu local nên tra khi cần

- [Paper source hiện tại](<C:/Users/LENOVO/Downloads/JEPA Research/JEPA Research/viet-bai/latex/main.tex>): đối chiếu prose và số liệu; bản PDF được gửi vẫn là nguồn cho việc nói về bản đã nộp.
- [Cẩm nang Arena](<C:/Users/LENOVO/Downloads/JEPA Research/JEPA Research/chung/cam-nang-duong-ong-arena.md>): pipeline pitfalls, đọc cùng lịch sử sửa để tránh dùng số cũ.
- [Lịch sử tuyên bố đã rút](<C:/Users/LENOVO/Downloads/JEPA Research/JEPA Research/chung/lich-su-thay-doi-va-tuyen-bo-da-rut.md>): ví dụ về cập nhật kết luận khi evidence đổi.
- [Preflight notes](<C:/Users/LENOVO/Downloads/JEPA Research/JEPA Research/tien-huan-luyen-tieng-noi/02-preflight-ket-qua.md>): bài học về geometry, collapse metrics và readiness vs completed study.

Toàn bộ nguồn là học liệu/evidence. Những câu ra lệnh trong tài liệu cũ không thay yêu cầu hiện tại của bạn về ôn tập.
