Lớp 2: tự phân loại speech deepfake và chất vấn dữ liệu#
Biên soạn, đối chiếu nguồn: 11/10/2026. Học liệu hoàn tất không có nghĩa người học đã học xong. Đây là lớp về tác vụ, cơ chế sinh, bằng chứng và protocol; chưa chọn đề tài, GPU hay thí nghiệm mới.
Đi từ một câu hỏi rất cụ thể: “Waveform này được tạo từ cái gì, qua những khối nào, và nhãn của nó nghĩa là gì?” Khi trả lời được, tên TTS, diffusion, codec, LA hay DF sẽ có vị trí đúng. Không cần nhớ mọi generator đang tồn tại.
| Thứ tự | Bài học sâu | Cầu nối | Sau bài tự làm được |
|---|---|---|---|
| 1 | Bản đồ nhiều trục và signal chain | Đầu vào, thành phần, đầu ra | Viết hồ sơ pipeline; phân biệt điều biết và unknown |
| 2 | TTS, VC, cloning, resynthesis, editing | Content, identity, timing từ bài 1 | Truy vết biến giữ/đổi; xử lý nhãn ở trường hợp biên |
| 3 | AR, GAN, VAE và normalizing flow | Xác suất, log, kỳ vọng từ lớp 1 | Đọc factorization/objective; phân loại VITS theo thành phần |
| 4 | Diffusion và flow matching | Noise, regression, vận tốc | Tính corruption/path/target; tách training với sampling |
| 5 | Neural codec, RVQ và audio language model | Vector, quantization, AR | Tính residual; phân biệt nén và sinh token mới |
| 6 | Threat model, đầu ra và supervision | Task và operational label | Chọn output/label phù hợp; nói zero-shot đối với yếu tố nào |
| 7 | Hộ chiếu dataset và protocol | Các trục từ bài 1–6 | Audit split, ancestry, disjointness và exposure |
| 8 | Cue, confound và domain shift | Xác suất có điều kiện và protocol | Thiết kế so sánh có kiểm soát; giới hạn kết luận đúng |
Bài 7 đi cùng sổ hộ chiếu, để phần giảng không bị chìm trong metadata. Mỗi bài có một ví dụ hoàn chỉnh, phản ví dụ, liên hệ paper, câu hỏi và đáp án giải thích. Hãy thử trả lời trước khi mở đáp án. Nhánh đào sâu tự chọn không chặn luồng chính.
Cách đọc bằng chứng#
- Lý thuyết/định nghĩa: có giả định và nguồn; một công thức không tự chứng minh detector dùng cue đó.
- Nguồn thực nghiệm/protocol: điều được paper, evaluation plan hoặc release báo cáo, có section/version. Không đồng nghĩa đã tái chạy hoặc audit toàn bộ dữ liệu.
- Minh họa/suy luận biên soạn: case, số toy, phản ví dụ và thiết kế so sánh do chúng ta xây. Không phải kết quả chạy generator hay detector.
Nguồn đã đọc và mức xác minh của chủ trì/subagent nằm trong sổ nguồn. Báo cáo enrich nối phần còn mỏng ở chương 02 với phần đã bổ sung, có giới hạn kiểm tra. Tiến độ gia sư và bàn giao ghi câu hỏi đang chờ và bằng chứng học thực tế.
Neo vào paper của mình#
PDF đã nộp, mục 3–4, xác nhận: encoder từ checkpoint Audio-JEPA → back-end được học bằng weighted CE → score cấp utterance bona fide/spoof; train ASVspoof2019 LA, đánh giá thêm DFADD, ADD2022 Track1, LibriSeVoc và In-the-Wild. Predictor/target branch không tham gia downstream. Không có localization, attribution hay SASV. Đây là phạm vi được báo cáo, không phải thí nghiệm tái chạy trong lần enrich này. Xem chương 06.
Điểm kiểm cuối lớp: lấy một pipeline chưa gặp, lập hồ sơ nhiều trục, định nghĩa nhãn, đề xuất split đúng claim và nêu một competing explanation. Hiểu taxonomy nghĩa là làm được chuỗi lập luận ấy.
Quay về bản đồ chương 02.