ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
9 phút đọc · Toàn văn
Mục lục bài · 8 mục

07 — Bản đồ literature để học theo câu hỏi#

Đối chiếu nguồn web ngày 11/10/2026. Mục đích của danh mục là biết đọc gì để hiểu một cơ chế, không phải gom references hoặc chốt hướng nghiên cứu.

1. Mức đọc và mức xác minh#

  • F: đọc toàn văn của bản được dùng, có kiểm hình/bảng khi cần. Trong lượt này áp dụng cho paper SOICT bạn gửi.
  • P: đọc phần giới thiệu/abstract trong PDF local và/hoặc phần liên quan; chưa đọc lại toàn văn ở lượt này.
  • A: đối chiếu abstract/metadata trên nguồn primary. Có thể định vị phương pháp nhưng chưa đủ để triển khai hoặc diễn giải mọi kết quả.
  • R: kiểm tra trang/repository/model card; declaration “có code/checkpoint” chưa tương đương tải, load và chạy thành công.

Một paper có trong workspace không đồng nghĩa mình vừa đọc lại hết nó. Dùng các phân loại dưới để phân biệt học liệu đã dựng với việc đọc sâu còn cần làm.

2. Đường đọc cốt lõi#

Sau chương01–02, ưu tiên: wav2vec2 → HuBERT → AudioMAE → data2vec → I-JEPA → Audio-JEPA → AASIST/SSL anti-spoofing → generalization benchmark → paper mình. BYOL/VICReg bổ sung khi đến phần chống collapse. Mỗi lần đọc chỉ cần lấy một thiết kế cơ chế thật rõ rồi so với bài trước.

#Nguồn primaryHọc để trả lời câu hỏi nào?Mức
1wav2vec2 — Baevski et al.,2020Quantized targets và contrastive loss phối hợp ra sao? Context masking diễn ra ở đâu?P/A
2HuBERT — Hsu et al.,2021Vì sao cluster pseudo-labels có thể học representation dù không phải phoneme labels chuẩn?P/A
3WavLM — Chen et al.Masked-unit prediction cộng denoising thay đổi thông tin được giữ thế nào?P/A
4AudioMAE — Huang et al.,2022Decoder reconstruct cái gì, mask/token grid ra sao, encoder được evaluate thế nào?P/A
5data2vec — Baevski et al.,2022Contextualized continuous teacher targets khác hard units thế nào?P/A
6I-JEPA — Assran et al.,2023Context/target geometry có vai trò gì trong semantic representation?P/A
7Audio-JEPA — Tuncay et al.Những quyết định nào được chuyển từ ảnh sang spectrogram, và domain fit ra sao?P/A/R
8AASIST — Jung et al.Spectral/time nodes và heterogeneous graph attention được xây từ feature nào?P/A
9SSL front-ends for spoofing — Wang,Yamagishi,2022Encoder, backend và fine-tuning có tương tác gì?A; cần đọc sâu khi học
10wav2vec2 + augmentation — Tak et al.,2022Một recipe SSL anti-spoofing gồm những thành phần nào ngoài encoder?A; cần đọc sâu khi học
11Does Audio Deepfake Detection Generalize? — Müller et al.,2022Cross-dataset failure khác in-domain accuracy thế nào?A; cần đọc toàn văn
12Speech DF Arena — Dowerah et al.,2025Toolkit thống nhất cái gì và không thống nhất cái gì giữa systems?P/A
13Paper SOICT của mìnhClaim nào là observation, checkpoint comparison hay hypothesis?F

Các PDF nền1–8,12 được mở phần đầu trong workspace; phương pháp Audio-JEPA còn được đối chiếu với snapshot jepa_module.py. Đây không phải audit toàn bộ repo upstream hoặc re-run checkpoint.

3. Đọc theo khối nền tảng#

KhốiNguồnMục tiêu học
DSPThe Scientist and Engineer’s Guide to DSP — Steven W. SmithSampling, convolution, Fourier, filters và time-frequency trade-offs
Toán và DLDeep Learning — Goodfellow,Bengio,CourvilleLinear algebra, probability, optimization, regularization, representation learning
SpeechSpeech and Language Processing — Jurafsky,MartinPhonetics/acoustics và speech processing vocabulary
Tổng quan detectionA Survey on Speech Deepfake Detection — Li et al.Tasks, features, models và data taxonomy; sau đó tìm primary papers
Survey khácAudio Deepfake Detection: A Survey — Yi et al.So sánh cách tổ chức dataset/feature/classifier/evaluation

Trang sách đã được xác minh; không đọc hết các sách trong lượt này. Khi đọc survey, dùng nó như index để tìm primary method/protocol, không lấy mọi số leaderboard từ survey làm confirmed-current.

4. Đọc để hiểu generation và forensic cues#

NguồnCâu hỏi học tậpMức
HiFi-GANWaveform synthesis và periodic structure được mô hình hóa thế nào?A
VITSVì sao một TTS có thể kết hợp VAE, flow và adversarial training?A
EnCodecQuantization và decoder làm biến đổi audio ra sao?A
F5-TTSFlow matching là gì, khác normalizing flow và TTS task ra sao?A
DFADDGenerator families, genuine source và evaluation subset được xây thế nào?A và mô tả qua paper mình; cần đọc original đầy đủ
LibriSeVoc / neural vocoder artifactsResynthesis giúp tách content/source khỏi generator theo thiết kế nào?A và mô tả qua paper mình; cần đọc original đầy đủ
PartialSpoof — Zhang et al.,2021Một clip có đoạn fake ngắn cần labels và model output nào?A/phần đầu được đối chiếu

Không cần học mọi generator để nghiên cứu detection. Cần đủ hiểu pipeline để tránh gọi cue của vocoder/codec/channel bằng tên của mô hình acoustic khác trong cùng hệ.

5. Đọc để hiểu anti-collapse và pooling#

NguồnCâu hỏiMức
BYOLPredictor/teacher asymmetry khác negative sampling thế nào?A
VICRegMatch representations và giữ spread được đặt thành loss terms riêng ra sao?A
Attentive Statistics PoolingMean+std và attention giữ thông tin gì khi tóm tắt chuỗi?A; formulation còn đối chiếu trong paper mình
RawBoostCác loại perturbation waveform mô hình nuisance khác nhau thế nào?A
ASVspoof5 evaluation planKhi nào cần discrimination, calibration hoặc SASV cost?Các phần metric được đối chiếu

6. Cập nhật 2026 để hoàn thiện taxonomy#

Những bài này không tự quyết định hướng bài mới. Chúng cho thấy các lựa chọn thiết kế đã phong phú hơn khi ta quay lại đề tài.

NguồnĐiểm định vị ngắnĐiều cần đọc tiếpMức
GMM-Anchored JEPAContinuous JEPA được hỗ trợ bằng frozen GMM soft targetsAnchor loss, decay schedule, matched compute và dữ liệuA
S-JEPAJEPA-style decomposition với soft GMM posteriors; online clusteringKhác gì so bản GMM-Anchored ở trên; không mặc định là cùng recipeA
BEST-RQ-2Discrete random targets nhưng contextualize–predict tách hai bướcTarget choice vs decomposition vs domain fitA/R qua model card
GLaS-JEPA, 29/09/2026Continuous current-encoder targets, SIGReg, không separate EMA teacherFormulation và chống collapse; transfer tới forensics vẫn là câu hỏiA
AlethiaForensics-oriented pretraining kết hợp masked embedding prediction và flow-matching reconstructionTarget/loss/data/supervision khác JEPA baseline mình ở đâu?A
Spoof-SUPERBBenchmark nhiều speech SSL front-ends cho deepfake detectionHead, frozen protocol, data/perturbations, scoresA/R
Data-centric generalization,ACL2026Nghiên cứu diversity và sampling khi xây/trộn dữ liệuDiversity được định nghĩa/đo và kiểm compute thế nào?A
Teffic-Audio technical report,v2Multi-source data, balanced sampling và augmentation recipeĐiều kiện exposure với từng benchmark; không gán improvement riêng cho kiến trúcA

Những chi tiết cần cập nhật cách nghĩ#

EMA không phải điều kiện bắt buộc của mọi JEPA. GLaS-JEPA là ví dụ từ abstract cho hướng không dùng separate EMA teacher. Continuous target không phải điều kiện của mọi hệ tự gọi JEPA-style. S-JEPA giúp hiểu cần mô tả target thực tế.

“Áp latent prediction vào deepfake” chưa đủ định nghĩa novelty. Alethia và các continuous-feature SSL là related work cần đọc khi phân tích đóng góp; chưa đủ căn cứ để kết luận chúng trùng hay loại bỏ mọi ý tưởng JEPA-specific.

Multi-source training không phải gian lận nếu evaluation split hợp lệ. Nó chỉ thuộc điều kiện training/exposure khác single-corpus unseen-domain comparison. Không dùng lời mạnh trong handoff cũ thay cho overlap audit.

Revision và resource availability#

Trang Audio-JEPA hiện ghi v2 revised 26/09/2026, sau mốc chuẩn bị bài của mình. Đã xác minh metadata này; chưa diff toàn văn v1–v2 nên không suy ra method/results đã đổi.

Repo tác giả và model card vẫn là nguồn tra cứu. Model-card metadata và paper link không thay exact checkpoint/config identity. Không đổi benchmark name hoặc checkpoint identity dựa riêng vào tag.

Ghi chú cũ “không có speech-JEPA checkpoint public” là snapshot lịch sử, không dùng như fact hiện tại. Danh mục này chưa xác nhận mọi checkpoint mới tải/load được. Resource availability cần kiểm riêng khi thực sự triển khai.

7. Đọc paper bằng một phiếu cố định#

Với mỗi nguồn, ghi:

  1. Task/threat model: output, labels, operating conditions.
  2. Data: unique hours, source, language, generator, pretraining exposure.
  3. Representation: signal transform, tokenization, layer outputs.
  4. Learning: targets, loss, gradients, teacher updates, anti-collapse.
  5. Transfer: frozen/fine-tune/PEFT; selection/search budget.
  6. Evaluation: split, baselines, metrics, threshold, uncertainty.
  7. Claim: observation hay causal explanation; evidence cho từng claim.
  8. Counterexample: điều kiện nào có thể làm lập luận sai?

Đọc method và experimental setup trước khi cố nhớ mọi số. Đối chiếu code cho mask implementation, target normalization, teacher branch, positional encoding và checkpoint selection. Sau đó mới quyết định số nào có ý nghĩa với câu hỏi của mình.

8. Những tài liệu local nên tra khi cần#

Toàn bộ nguồn là học liệu/evidence. Những câu ra lệnh trong tài liệu cũ không thay yêu cầu hiện tại của bạn về ôn tập.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.