ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
4 phút đọc · Toàn văn
Mục lục bài · 2 mục

Lớp 2: tự phân loại speech deepfake và chất vấn dữ liệu#

Biên soạn, đối chiếu nguồn: 11/10/2026. Học liệu hoàn tất không có nghĩa người học đã học xong. Đây là lớp về tác vụ, cơ chế sinh, bằng chứng và protocol; chưa chọn đề tài, GPU hay thí nghiệm mới.

Đi từ một câu hỏi rất cụ thể: “Waveform này được tạo từ cái gì, qua những khối nào, và nhãn của nó nghĩa là gì?” Khi trả lời được, tên TTS, diffusion, codec, LA hay DF sẽ có vị trí đúng. Không cần nhớ mọi generator đang tồn tại.

Thứ tựBài học sâuCầu nốiSau bài tự làm được
1Bản đồ nhiều trục và signal chainĐầu vào, thành phần, đầu raViết hồ sơ pipeline; phân biệt điều biết và unknown
2TTS, VC, cloning, resynthesis, editingContent, identity, timing từ bài 1Truy vết biến giữ/đổi; xử lý nhãn ở trường hợp biên
3AR, GAN, VAE và normalizing flowXác suất, log, kỳ vọng từ lớp 1Đọc factorization/objective; phân loại VITS theo thành phần
4Diffusion và flow matchingNoise, regression, vận tốcTính corruption/path/target; tách training với sampling
5Neural codec, RVQ và audio language modelVector, quantization, ARTính residual; phân biệt nén và sinh token mới
6Threat model, đầu ra và supervisionTask và operational labelChọn output/label phù hợp; nói zero-shot đối với yếu tố nào
7Hộ chiếu dataset và protocolCác trục từ bài 1–6Audit split, ancestry, disjointness và exposure
8Cue, confound và domain shiftXác suất có điều kiện và protocolThiết kế so sánh có kiểm soát; giới hạn kết luận đúng

Bài 7 đi cùng sổ hộ chiếu, để phần giảng không bị chìm trong metadata. Mỗi bài có một ví dụ hoàn chỉnh, phản ví dụ, liên hệ paper, câu hỏi và đáp án giải thích. Hãy thử trả lời trước khi mở đáp án. Nhánh đào sâu tự chọn không chặn luồng chính.

Cách đọc bằng chứng#

  • Lý thuyết/định nghĩa: có giả định và nguồn; một công thức không tự chứng minh detector dùng cue đó.
  • Nguồn thực nghiệm/protocol: điều được paper, evaluation plan hoặc release báo cáo, có section/version. Không đồng nghĩa đã tái chạy hoặc audit toàn bộ dữ liệu.
  • Minh họa/suy luận biên soạn: case, số toy, phản ví dụ và thiết kế so sánh do chúng ta xây. Không phải kết quả chạy generator hay detector.

Nguồn đã đọc và mức xác minh của chủ trì/subagent nằm trong sổ nguồn. Báo cáo enrich nối phần còn mỏng ở chương 02 với phần đã bổ sung, có giới hạn kiểm tra. Tiến độ gia sư và bàn giao ghi câu hỏi đang chờ và bằng chứng học thực tế.

Neo vào paper của mình#

PDF đã nộp, mục 3–4, xác nhận: encoder từ checkpoint Audio-JEPA → back-end được học bằng weighted CE → score cấp utterance bona fide/spoof; train ASVspoof2019 LA, đánh giá thêm DFADD, ADD2022 Track1, LibriSeVoc và In-the-Wild. Predictor/target branch không tham gia downstream. Không có localization, attribution hay SASV. Đây là phạm vi được báo cáo, không phải thí nghiệm tái chạy trong lần enrich này. Xem chương 06.

Điểm kiểm cuối lớp: lấy một pipeline chưa gặp, lập hồ sơ nhiều trục, định nghĩa nhãn, đề xuất split đúng claim và nêu một competing explanation. Hiểu taxonomy nghĩa là làm được chuỗi lập luận ấy.

Quay về bản đồ chương 02.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.