# Nguồn: task và protocol dữ liệu

**Ngày đối chiếu nguồn:** 11/10/2026. Phiếu này phục vụ đọc bài toán và diễn giải kết quả của paper hiện tại; không thay đổi manuscript, recipe train hay lựa chọn đề tài. Các mô tả dưới đây dựa trên kế hoạch đánh giá, bài mô tả dữ liệu/phương pháp và trang/repo của tác giả được dẫn ở từng mục. “Chưa xác nhận” nghĩa là trường đó không được xác lập trong phần nguồn đã đọc hoặc chưa đối chiếu trực tiếp với manifest của bản dữ liệu dùng trong paper.

## 1. Phạm vi paper hiện tại

Paper làm **phát hiện bona fide/spoof bằng audio, ở mức utterance**. Model dùng fixed 2,56 s crop và tạo score $z_{\mathrm{bonafide}}-z_{\mathrm{spoof}}$; score cao biểu thị bona fide. Metric paper báo cáo là EER, không phải các metric ASV-integrated của LA/PA hay SASV. Downstream dùng nhãn nhị phân và weighted cross-entropy, với context encoder từ checkpoint Audio-JEPA đã phát hành. Checkpoint đã được tác giả huấn luyện objective JEPA trên AudioSet-2M; paper hiện tại không huấn luyện lại objective JEPA, không dùng prediction error làm score và không làm source attribution.

Recipe được ghi trong hồ sơ paper: train từ ASVspoof2019 Logical Access (LA); giữ A05 cùng 600 mẫu bona fide để theo dõi, còn 20.980 mẫu trong train subset. A05 là attack holdout nội bộ, không phải bằng chứng rằng speaker, model family, vocoder hay mọi attack mechanism đều disjoint. Evaluation được báo cáo trên ASVspoof2019 LA eval, DFADD, ADD2022 Track 1, LibriSeVoc và In-the-Wild. Các protocol của bộ dữ liệu dưới đây giúp đọc đúng sự khác biệt giữa những evaluation này; không mở rộng scope paper thành pretraining, localization, SASV hoặc attribution.

### Task, output và threat model

- **Output:** một score clip-level cho nhãn vận hành của từng corpus (ở đây tính trên crop cố định). Không có timestamp, frame/segment score hay nhãn vị trí bị sửa; vì thế kết quả không đo localization, kể cả khi một corpus có thể cung cấp segment labels.
- **Supervision:** supervised binary downstream detection. Nhãn spoof trong các benchmark không có cùng định nghĩa vật lý/xã hội: có thể là tổng hợp/chuyển giọng, resynthesis, replay trong ASV, hoặc nội dung deepfake thu thập trên web. “Spoof” là nhãn protocol, không tự nó chứng minh giả mạo có ác ý, thiếu đồng thuận hay không được phép.
- **Threat model:** detector nhận audio; không có video, enrollment speaker, xác thực chữ ký hay watermark. ASVspoof LA/PA mô tả đường tấn công lên hệ xác thực người nói; ASVspoof DF là task deepfake detection riêng. TTS/VC mô tả phương pháp sinh, còn LA/PA mô tả kịch bản truy cập.
- **Không phải SASV:** không kiểm tra đồng thời danh tính người nói được đăng ký và tính bona fide. SASV có trial target bona fide, non-target bona fide và spoof-target; “non-target bona fide” vẫn là tiếng thật. Mục tiêu chấp nhận target bona fide khác mục tiêu phân loại clip bona fide/spoof của paper.
- **Không phải attribution/provenance:** score không chỉ ra generator, vocoder hay nguồn file; cũng không xác minh danh tính người nói, nguồn gốc/chuỗi chỉnh sửa, quyền sử dụng hay authenticity bằng watermark.

## 2. Passport các corpus

### ASVspoof2019 LA — train và in-domain evaluation

**Task/unit/label.** LA là logical-access spoofing trong bối cảnh ASV: clip tiếng nói được tổng hợp hoặc chuyển giọng đi vào đường số. Đơn vị file/utterance; detector cho score bona fide/spoof. Mọi tiếng nói bona fide trong protocol đều thuộc lớp bona fide cho bài toán file-level này; target/non-target là phân biệt trial ASV, không biến tiếng thật thành spoof.

**Nguồn và ancestry.** Tiếng thật lấy từ VCTK, 107 speaker trong corpus đầy đủ. Train và dev có 6 system ID (A01–A06; hai VC và bốn TTS theo paper), eval có A07–A19. Eval dùng attack ID khác, nhưng paper mô tả trường hợp thuật toán được tái dùng giữa train và eval, gồm A16/A04 và A19/A06. Vì vậy “unseen attack ID” không đồng nghĩa unseen algorithm, family, kiến trúc hay vocoder.

**Split/disjointness.** Official plan mô tả ba partition; bona-fide LA: train 2.580, dev 2.548, eval 7.355; spoof: train 22.800, dev 22.296, eval 63.882. Target-speaker partitions không chồng nhau theo protocol. Attack ID eval được giữ ngoài train/dev trong benchmark, nhưng ví dụ tái sử dụng thuật toán giới hạn claim về disjointness ở mức ID. Recipe của paper giữ A05 và 600 bona fide để monitoring; đó là biến thể train nội bộ, không đổi định nghĩa official eval.

**Version/giới hạn.** Bản nguồn là protocol ASVspoof2019 LA. Bản manifest/checksum cụ thể được dùng cho các run của paper chưa được đối chiếu trong phiếu này. LA không gồm tác động truyền âm qua loa/phòng/micro như replay PA.

### ASVspoof2021 LA, DF và PA — ba protocol không thể hoán tên

**LA.** Đây là ASV task trên logical-access speech; evaluation dùng attack của ASVspoof2019 LA với bảy điều kiện codec/truyền dẫn. C1 giữ kịch bản gần nguyên bản 2019; các điều kiện còn lại thêm kênh VoIP/PSTN/điện thoại và codec. Genuine lẫn spoof đều có thể bị nén/truyền, nên benchmark nhấn mạnh channel/codec robustness cùng detection. Challenge dùng ASVspoof2019 LA train/dev, không phát hành train/dev mới trong protocol chính; metric tích hợp ASV là t-DCF.

**DF.** Đây là track riêng cho standalone deepfake detection, **không có ASV**. Bài database mô tả source lấy từ ASVspoof2019 LA evaluation cùng VCC2018/VCC2020, với hơn 100 TTS/VC attack methods; audio có chín điều kiện lossy compression. Metric chính là EER. Analysis sau challenge cho thấy đổi nguồn bona fide làm kết quả biến động mạnh; detector có thể khai thác khoảng lặng/non-speech và source-specific cues. Vì thế tên “ASVspoof2021” một mình chưa xác định task hay kiểu tổng quát hóa.

**PA để phân biệt khái niệm.** PA là replay vật lý qua loa, môi trường và microphone. Replay có thể bắt đầu từ bản thu giọng thật; nguồn gốc bona fide của waveform không khiến replay trở thành bona fide trong threat model ASV. ASVspoof2019 PA từng dùng mô phỏng; PA 2021 có replay thật. Cả LA/PA là đường tấn công ASV, không phải tên chung cho mọi deepfake.

**Disjointness/version.** LA eval tái dùng các attack 2019 và thay đổi điều kiện truyền; DF trộn nguồn và pipeline khác. Không diễn giải chúng như một phép holdout cùng trục. Plan PDF 2021 được liên kết trong audit log nhưng không trích được nội dung trực tiếp trong lượt đọc này; các điểm trên được kiểm từ trang challenge chính thức, release cards chính thức và hai bài primary về database/post-challenge. Không tải dữ liệu.

### ASVspoof5 — Track 1 speech deepfake detection và Track 2 SASV

**Task/unit/label.** Track 1 là standalone speech deepfake detection, score một utterance và phân biệt bona fide/spoof; protocol báo cáo minDCF, actDCF, Cllr và EER. Track 2 là SASV: trial ghép probe với enrollment; gồm target bona fide, non-target bona fide và spoof-target, chỉ target bona fide mới nên được chấp nhận. Track 2 không phải binary detector cùng estimand với Track 1.

**Nguồn/split.** Bài mô tả dữ liệu dùng tiếng Anh từ MLS, có nguồn audiobook/crowdsourced và môi trường thiết bị đa dạng; xây các partition theo speaker. Train khoảng 400 speaker với 19k bona-fide và 164k spoof từ tám thuật toán; dev có attack methods tách khỏi train; eval có 16 attack methods tách khỏi train/dev, thêm attack/adversarial condition và codec lossy cho bona fide lẫn spoof. Các con số và phân loại ở đây tóm tắt bài data/method; attack-generation recipes chi tiết không được công khai đủ để tái dựng chỉ từ mô tả này.

**Disjointness và ancestry.** Evaluation plan áp đặt kiểm soát speaker overlap với MLS/LibriLight và loại nguồn mà không xác định được overlap; plan cho phép LibriSpeech với lý do thiết kế speaker-disjoint của evaluation. Điều đó minh họa rằng quan hệ ancestry giữa corpus không chứng minh hai split chứa cùng speaker/utterance. Ngược lại, chỉ thấy corpus hay generator name khác nhau cũng chưa chứng minh không có trùng nội dung. Cần hash/metadata, speaker, transcript và audio identity audit cho dữ liệu cụ thể.

**Giới hạn claim.** Attack method ID disjoint không nhất thiết đồng nghĩa high-level TTS/VC family, backbone hay vocoder disjoint. Không gọi kết quả của paper này là ASVspoof5 hoặc SASV: paper không dùng Track 2 hay ASV trial.

### DFADD — VCTK-paired TTS benchmark

**Task/unit/label.** Speech-level TTS deepfake detection. Paper tạo fake từ 300 prompt câu lấy từ LJ Speech, tránh dùng chính prompt VCTK để giảm text leakage; genuine là tiếng VCTK. Dữ liệu ở 16 kHz. Paper mô tả 44.455 utterance genuine và 163.500 fake, sinh từ 109 VCTK speakers × 300 prompt × 5 hệ TTS.

**Generator/source.** Năm hệ gồm diffusion Grad-TTS, NaturalSpeech2, StyleTTS2 và flow-matching Matcha-TTS, PFlow-TTS. Paper có một mâu thuẫn nội bộ cần giữ nguyên trong passport: câu mở đầu §3.2 nói D2, D3 và F1 dùng model pretrained trên VCTK; mô tả checkpoint cụ thể tại §3.2.3 lại nói StyleTTS2 pretrained trên LibriTTS. Chưa xác định từ nguồn đã đọc câu nào phản ánh đúng checkpoint thực tế, nên ancestry training của D3 ghi **chưa xác nhận (VCTK/LibriTTS discrepancy)**. D1 và F2 được train từ đầu trên VCTK; khi inference dùng HiFi-GAN pretrained trên VCTK. Genuine/fake được ghép theo identity/source design, nhưng vẫn có thể chia sẻ corpus/vocoder lineage. “Generator khác ASVspoof19” không tự động chứng minh toàn bộ family/vocoder/component mới.

**Split/disjointness.** Paper nêu split theo speaker: validation p226/p229, test p227/p228, speaker còn lại cho train. Đây là speaker split của DFADD; không chứng minh độc lập theo corpus ancestry hay generator component. Test hai speaker theo paper, nên khái quát hóa theo speaker có ít identity test và độ bất định cao hơn một test đa speaker. Đây là hệ quả về phạm vi lấy mẫu, không phải đánh giá lại số liệu.

**Version.** Repo tác giả ghi cập nhật phát hành vào tháng 4/2025 để sửa mismatch label Matcha và thống nhất format file. Không xác định ở đây rằng exact files/manifest version của paper hiện tại là bản sửa đó; khi tái lập cần khóa release, index và hashes. Không tải dữ liệu/checkpoint.

### LibriSeVoc — self-vocoder resynthesis

**Task/unit/label.** Benchmark phát hiện artifact do vocoder resynthesis. 13.201 utterance real lấy từ LibriTTS; mỗi utterance được tổng hợp qua sáu vocoder: WaveNet, WaveRNN, WaveGrad, DiffWave, MelGAN, Parallel WaveGAN. Vì sinh từ cùng utterance/mel nguồn, fake có quan hệ nội dung và speaker với real tương ứng; đây là thiết kế paired/resynthesis, không phải 6 nhóm TTS độc lập về ngữ nghĩa. Bản mô tả gốc báo 24 kHz, 34,92 giờ real và 208,74 giờ fake.

**Split/disjointness.** Bài báo cáo 55.440 train, 18.480 dev, 18.487 test theo chia non-overlap gần 6:2:2. Bài đã đọc không xác lập rõ split theo speaker hoặc group theo utterance nguồn trước khi tách; do đó chưa kết luận split speaker-disjoint hay source-utterance-disjoint. Sáu vocoder là các lớp/family đã biết trong thiết kế, không phải test unseen vocoder. Cần kiểm manifest để biết mỗi real/fake pair và utterance nguồn nằm trong split nào.

**Ancestry và leakage caution.** LibriTTS có gốc từ LibriSpeech, vốn có ancestry LibriVox audiobook. Quan hệ này chỉ là tín hiệu cần audit; không đủ để tuyên bố có exact duplicate hay leakage với ASVspoof5, AudioSet-2M hoặc dữ liệu khác. Muốn nói có overlap phải đối chiếu speaker ID, transcript, waveform fingerprints/audio similarity và exposure/manifests đúng phiên bản.

**Version/giới hạn.** Mô tả trên lấy từ paper và repo tác giả. Bản đóng gói của benchmark aggregator có thể resample/đổi container; chưa dùng aggregator để làm nguồn số liệu và chưa xác định release cục bộ trong paper hiện tại. Tách được vocoder artifact trong corpus không có nghĩa kết quả trên corpus khác chỉ do vocoder, vì source, speaker, nội dung, recording setup cũng có thể đổi.

### In-the-Wild — deepfake audio thu thập từ web

**Task/unit/label.** Bộ dữ liệu đánh giá utterance-level genuine/fake bằng các đoạn tiếng Anh của người nổi tiếng/chính trị gia. Bài báo cáo 58 identities, khoảng 20,8 giờ bona fide, 17,2 giờ fake, 31.779 clips, trung bình khoảng 4,3 giây, chuẩn hóa 16 kHz. Genuine và fake được ghép tương đối theo speaker, style/background và độ dài.

**Ancestry/generator.** Fake được trích từ 219 ví dụ deepfake công khai trên web/video/social platforms; generator/checkpoint/pipeline cho từng clip thường không được xác định đầy đủ. Genuine lấy từ nội dung công khai khác. Cùng speaker không có nghĩa cùng bản ghi, nội dung, microphone hay kênh. Web provenance có thể tạo tương quan nguồn/codec/biên tập/nhiễu với nhãn; matching ở mức speaker/style không loại hết các confound đó.

**Split/disjointness/version.** Nguồn đã đọc không mô tả một official train/dev/test split theo speaker/model có thể áp cho mọi phiên bản; corpus thường được dùng như external evaluation. Manifest/release ID cụ thể và generator labels từng file chưa được kiểm. Không tuyên bố generator-disjoint hoặc temporal-generalization chỉ vì tên “in the wild”. Nó đo chuyển dịch sang dữ liệu web thu thập trong protocol đó, không đại diện tự động cho generator thương mại mới nhất.

### ADD2022 — chỉ Track 1 trong paper

**Task/unit/label.** ADD có nhiều track. Paper hiện tại dùng **Track 1 / LF: low-quality full fake speech detection**, tiếng Quan thoại, phân loại clip đầy đủ bona fide/fake dưới nhiễu nền/nhạc và điều kiện chất lượng thấp. Không nhầm với Track 2 partial fake hoặc fake-game Track 3. Output benchmark là phát hiện clip, không localization; challenge metric là EER.

**Nguồn/generator.** Challenge paper mô tả dữ liệu genuine từ AISHELL-3 cho train/dev; Track 1 bổ sung điều kiện noise/background music và adaptation. Spoof được sinh từ TTS/VC systems; danh sách/checkpoint/quan hệ generator cụ thể của từng tập test chưa được xác lập trong phần nguồn đã đọc. Không suy đoán generator family disjoint chỉ từ “unseen” hoặc từ Track 1.

**Split.** Challenge paper báo train 3.012 genuine + 24.072 fake; dev 2.307 genuine + 26.017 fake; adaptation Track 1 có 300 genuine + 700 fake; test Track 1 khoảng 109.199 utterances. Paper xác nhận speaker-disjoint giữa train và dev. Test được mô tả là có utterances chưa thấy, nhưng điều đó không xác nhận speaker-disjoint với train/dev; quan hệ speaker của test và adaptation với các split khác chưa rõ trong §§3.1–3.3 đã đọc. Bài liên kết [Train & Dev](https://zenodo.org/records/12188127), [Adaptation](https://zenodo.org/records/12188083), và [Track1 eval](https://zenodo.org/records/10843991); đây là protocol bài challenge; exact release/manifest và mapping từng speaker/file của paper hiện tại chưa được khóa. Metric và cách nộp cần gắn đúng track/version.

### PartialSpoof — đối chứng khái niệm localization, không phải task paper

PartialSpoof được xây từ ASVspoof2019 LA bằng cách thay một số span VAD trong utterance với span cùng speaker nhưng khác lớp; paper mô tả matching, chuẩn hóa và ghép nối/crossfade. Nó có nhãn utterance và nhãn temporal/segment ở nhiều độ phân giải; label đoạn có thể là spoof nếu đoạn chứa phần waveform được thay. Split kế thừa nền ASVspoof2019, nhưng exact generator-family disjointness vẫn cần metadata. Dataset này cho thấy clip-level label/score không trả lời câu hỏi “đoạn nào bị sửa”. Paper hiện tại không có segment supervision, output timestamp hay metric localization.

### Các benchmark CodecFake/Codecfake — giữ riêng identity và release

- **CodecFake, Wu et al. (arXiv:2406.07237; Interspeech 2024; [paper](https://arxiv.org/html/2406.07237), [author site](https://codecfake.github.io/), [author dataset card](https://huggingface.co/datasets/rogertseng/CodecFake)):** VCTK, 107 speakers; train/dev/test speaker-disjoint (validation p226/p229, test p227/p228). Sáu codec frameworks / 15 pretrained codec models encode rồi decode lại tiếng VCTK; 15 subsets theo codec model và có corresponding genuine source. Đây là codec resynthesis benchmark, không đồng nhất với full codec-language-model generation. Các codec model có dữ liệu pretrain khác nhau: paper table liệt kê LibriSpeech, LibriTTS, VCTK, AISHELL, Common Voice/DAPS cùng nguồn khác; provenance của dấu vết vì thế gắn cả source VCTK đầu vào lẫn codec model. Codec IDs đã được chọn trong corpus; không suy ra unseen codec family.
- **Codecfake: An Initial Dataset, Lu et al. (arXiv:2406.08112v1, 12/06/2024; [paper](https://arxiv.org/html/2406.08112)):** bảy codec methods F01–F07 re-encode/decode genuine từ VCTK và AISHELL3; các neural codec models được train trên LibriTTS theo paper. Đây là codec resynthesis dùng làm benchmark fake, không đồng nghĩa mọi mẫu là output của một ALM tạo nội dung mới. Bài báo cáo 1.058.216 samples: 132.277 real, 925.939 fake. F01–F06 có mặt train/dev; F07 được chỉ định làm unseen forgery method trong evaluation. Paper đã đọc không chứng minh split speaker-disjoint, cũng không đủ để gọi F07 là unseen family/vocoder; exact grouping theo source utterance chưa được audit. Không có release ID/manifests riêng được khóa trong lượt này.
- **The Codecfake Dataset and Countermeasures, Xie et al. (arXiv:2405.04880v3, 25/12/2024; [paper](https://arxiv.org/html/2405.04880), [author repository](https://github.com/xieyuankun/Codecfake), [Zenodo record](https://zenodo.org/records/13838106)):** paper này cũng gọi dataset là Codecfake, mô tả cùng hai nguồn VCTK/AISHELL3, F01–F07 và cùng các tổng số trên. Tác giả có overlap với paper Lu và mô tả cùng bảy codec methods; vì vậy không đếm hai paper thành hai corpus độc lập hoặc cộng counts. Khóa đúng release bằng record/repo và manifest/hash; mối quan hệ phiên bản cụ thể giữa hai bài chưa được xác minh trong lượt này. Bản Xie mô tả F07 unseen ở test và các condition C1–C7; unseen method ID vẫn không tự đảm bảo unseen high-level family. Không corpus nào trong ba identity trên thuộc evaluation của paper hiện tại.

## 3. Trục tổng quát hóa và cue/confound

| Trục cần gọi đúng tên | Nguồn có thể cho thấy điều gì | Điều không được suy ra tự động |
|---|---|---|
| Attack ID / generator | ASVspoof2019 giữ A07–A19 khỏi train IDs; ASVspoof5 tách attack methods; DFADD có các hệ TTS riêng | Unseen ID không đảm bảo unseen method family, backbone, vocoder hoặc codec |
| Speaker | ASVspoof2019, ASVspoof5, DFADD và CodecFake mô tả speaker-disjoint split ở mức protocol; ADD2022 xác nhận rõ train-dev | Corpus khác hoặc speaker name khác không chứng minh không trùng audio/text; speaker split chỉ áp trong corpus/split đó |
| Genuine source / corpus ancestry | VCTK, LibriTTS/LibriSpeech/LibriVox, AISHELL, MLS, VCC và web có recording/source khác nhau | Chia sẻ ancestry không phải exact duplicate; khác corpus cũng không đảm bảo độc lập speaker hay audio |
| Content/text | DFADD chọn câu prompt từ LJ Speech thay VCTK prompts; LibriSeVoc fake sinh từ cùng nguồn utterance/mel | Khác câu không chứng minh khác speaker; cùng câu không chứng minh cùng recording. Cần group split và transcript/audio audit |
| Generator task/family | TTS, VC, vocoder resynthesis, neural codec và codec-LM tạo các can thiệp khác nhau | Đổi tên model không có nghĩa đổi họ công nghệ hay toàn bộ decoder/vocoder |
| Channel/compression | ASVspoof2021 LA/DF có codec/transmission; ASVspoof5 có lossy codec; ADD có noise/background music | EER đổi không tách được channel khỏi source/generator nếu các yếu tố cùng đổi |
| Recording environment | PA replay, In-the-Wild web recordings, clean VCTK và MLS khác thiết bị/phòng/nền | Model score cao không chứng minh dùng cue synthesis thay vì noise floor, silence hoặc recording pipeline |
| Language | ADD Track1 là Mandarin; nhiều nguồn khác là English | Cross-language đồng thời đổi corpus, speaker, script, generator và channel, trừ khi được kiểm soát |
| Duration/silence | Các nghiên cứu ASVspoof phân tích shortcut amplitude, duration, leading/trailing silence và non-speech | Đây là rủi ro benchmark; không phải bằng chứng model Audio-JEPA cụ thể đã học shortcut |
| Partial fraction / temporal span | PartialSpoof thay một phần utterance và có segment labels | Binary whole-clip score không cho localization hoặc sensitivity theo tỷ lệ đoạn giả |
| Thời gian / thành phần shift | Generator mới, codec mới, source mới có thể kết hợp | Một corpus external không chứng minh temporal generalization hoặc robustness trước mọi tổ hợp shift |

Các phân tích ASVspoof2021 cho thấy source bona fide mismatch, khoảng lặng/non-speech và source-specific score shift có thể chi phối benchmark. ASVspoof5 cũng mô tả kiểm tra shortcut gồm peak amplitude, thời lượng phần im lặng đầu/cuối và tổng duration. Đây là **confound cần đo/kiểm soát**, không phải chẩn đoán đã chứng minh về representation Audio-JEPA trong paper. Codec/upsampling có thể xóa hoặc tạo dấu vết; một resynthesis hợp pháp trong ứng dụng vẫn có thể mang artifact và bị benchmark gán spoof.

### Dùng đúng tên cho distribution shift

- **Covariate shift:** phân phối đầu vào (p(x)) đổi, trong khi quan hệ (p(y\mid x)) được giả định giữ nguyên.
- **Label/prior shift:** (p(y)) đổi, trong khi (p(x\mid y)) được giả định giữ nguyên.
- **Concept shift:** (p(y\mid x)) đổi. Nếu định nghĩa vận hành của “spoof” đổi — chẳng hạn codec resynthesis bị xem là spoof trong benchmark nhưng là audio hợp lệ trong ứng dụng — target semantics cũng đã đổi; đó không chỉ là covariate shift.

Trong audio deepfake, nhiều shift thường xảy ra đồng thời. Muốn quy nguyên nhân cho một trục phải có split/cặp đối chứng giữ các trục còn lại ổn định.

## 4. Checklist trước khi nói “leakage” hoặc “generalization”

1. Khóa tên/version/track, nguồn phát hành, manifest và hash các files thực sự chấm điểm.
2. So sánh speaker ID/metadata; nếu nguồn khác schema, chuẩn hóa bằng speaker matching có kiểm định.
3. So transcript/text, utterance IDs và nguồn recording; kiểm exact hash lẫn perceptual/audio fingerprints sau khi chuẩn hóa sample rate/container.
4. Với fake, truy vết generator ID, model family, checkpoint, vocoder, codec và preprocessing; tách “ID unseen” khỏi “family/component unseen”.
5. Đối chiếu nguồn pretraining theo danh sách exposure có thể kiểm chứng. AudioSet-2M label/metadata hoặc dataset ancestry không đủ để kết luận mọi recording chưa từng xuất hiện.
6. Ghi từng tầng: shared corpus ancestry; shared speaker; shared transcript; same source utterance; exact/near duplicate audio. Chỉ tầng được audit mới được tuyên bố.
7. Ghi metric, protocol và phân bố lớp của đúng track; EER cùng tên vẫn không làm hai estimand/threat model giống nhau.

Đặc biệt, LibriTTS có ancestry LibriSpeech/LibriVox và ASVspoof5 có audit overlap speaker với một số nguồn. Đó là lý do cần audit speaker/text/audio giữa đúng manifests trước khi nói LibriSeVoc “leak” vào train/eval khác. Không có kết quả audit đó trong phiếu này; không kết luận leakage.

## 5. Nhật ký nguồn đã đọc

Ngày truy cập/đối chiếu cho tất cả mục: **11/10/2026**. “Đọc sâu” dưới đây nghĩa đọc phần protocol/data/method/setup liên quan của full text/official plan hoặc README tác giả; không có nghĩa audit toàn bộ code, manifest, từng waveform hay mọi revision. Không tải corpus/checkpoint.

| Dataset / nguồn primary | Version / ngày nguồn được quan sát | Phần đã đọc và claim được hỗ trợ | Mức đọc và giới hạn |
|---|---|---|---|
| [ASVspoof2019 Evaluation Plan](https://www.asvspoof.org/asvspoof2019/asvspoof2019_evaluation_plan.pdf); [database paper](https://arxiv.org/html/1911.01601) | Plan chính thức 2019; arXiv HTML v4, 14/07/2020 | LA/PA threat, VCTK source, split, speakers, attack IDs/algorithms, label và utterance score | Đọc plan cùng §§2–3 của paper. Không xác minh checksums của bản local |
| [ASVspoof2021 official page](https://www.asvspoof.org/index2021.html); [official LA](https://zenodo.org/records/4837263), [PA](https://zenodo.org/records/4834716), [DF](https://zenodo.org/records/4835108); [database paper](https://arxiv.org/html/2109.00537); [post-challenge analysis](https://arxiv.org/html/2210.02437) | Challenge 2021; database paper arXiv v1 (01/09/2021), post-challenge paper arXiv v3 (22/06/2023); official release cards được xem 11/10/2026 | LA codec/channel, DF là task standalone và nguồn mix, PA replay vật lý, metric; source/silence/non-speech shortcut findings | Đọc official page, card metadata và paper §§dataset/analysis. PDF eval plan chính thức được liên kết nhưng không parse được trực tiếp trong lượt này; không khẳng định đã đọc nội dung plan |
| [ASVspoof5 Evaluation Plan Phase 2](https://www.asvspoof.org/file/ASVspoof5___Evaluation_Plan_Phase2.pdf); [data/method paper](https://arxiv.org/html/2502.08857) | Plan v0.6, 28/06/2024; arXiv HTML v4, 24/04/2025 | Track1 vs Track2 SASV, trial semantics, metric, split/attack design, MLS ancestry, speaker-overlap restrictions và shortcut checks | Đọc plan §§task/metrics/restrictions và paper §§2–4, §7.1. Không có attack recipes/checkpoint-level audit đầy đủ |
| [DFADD paper](https://arxiv.org/html/2409.08731); [author repository](https://github.com/isjwdu/DFADD); [author dataset card](https://huggingface.co/datasets/isjwdu/DFADD) | Paper v1, 13/09/2024; repo README ghi update 04/2025 | Dataset construction, 5 TTS, split/speakers, file/label correction; §3.2 intro nói D2/D3/F1 pretrained VCTK; §3.2.3 nêu riêng StyleTTS2/D3 pretrained LibriTTS | Đọc §§3–4 và README. Chưa có evidence trong nguồn đã đọc để resolve D3 checkpoint ancestry hoặc khóa release/manifest của paper hiện tại |
| [LibriSeVoc paper](https://arxiv.org/html/2304.13085); [author repository](https://github.com/csun22/Synthetic-Voice-Detection-Vocoder-Artifacts) | Paper v2, 27/04/2023; repo chính thức | LibriTTS origin, self-vocoder synthesis, 6 vocoders, 24 kHz, split counts | Đọc §4.1–4.2, bảng dataset và README. Speaker/source grouping chưa được xác lập từ mô tả đã đọc; không dùng mirror làm nguồn số liệu |
| [In-the-Wild paper](https://arxiv.org/html/2203.16263); [official dataset page](https://deepfake-demo.aisec.fraunhofer.de/in_the_wild) | Paper HTML v5, 27/03/2026; trang nguồn xem 11/10/2026 | Speakers, collection from web deepfake demos, matching strategy, size/duration/sample rate | Đọc paper phần construction/evaluation và trang dữ liệu. Không có manifest audit hay per-file generator mapping trong lượt này |
| [ADD2022 challenge paper](https://arxiv.org/html/2202.08433); [Track1 eval release](https://zenodo.org/records/10843991) | arXiv v3, 02/07/2024 (paper first appeared 2022) | Track definitions, Track1 task/data/counts/metric; train-dev speaker-disjoint statement; test/adaptation cross-split speaker overlap unknown; broad generator description | Đọc phần task, challenge data/protocol và metrics. Không xác minh exact Track1 release, test model IDs hay file-level metadata |
| [PartialSpoof paper](https://arxiv.org/html/2204.05177); [author repository](https://github.com/nii-yamagishilab/PartialSpoof) | arXiv v3, 30/01/2023; [PartialSpoof dataset v1.2](https://zenodo.org/records/5766198); repo README xem 11/10/2026 | Partial construction, inherited ASV19 source split, utterance/segment labels và localization distinction | Đọc method/setup và README; không phải corpus đánh giá trong paper hiện tại |
| [CodecFake paper](https://arxiv.org/html/2406.07237); [author site](https://codecfake.github.io/); [dataset card](https://huggingface.co/datasets/rogertseng/CodecFake) | arXiv v1, 11/06/2024; Interspeech 2024 | VCTK identity/split, codec resynthesis, 15 pretrained codecs và scope artifact | Đọc §§2–3.2 và author card; card được xem 11/10/2026, chưa khóa release/checksum dùng trong paper |
| [Codecfake: An Initial Dataset](https://arxiv.org/html/2406.08112) | arXiv v1, 12/06/2024 | Bảy codec methods, VCTK/AISHELL3, LibriTTS ancestry, split counts, F07 unseen condition | Đọc §§2–3; không tìm thấy separate release ID hay chứng cứ speaker-disjoint |
| [The Codecfake Dataset and Countermeasures](https://arxiv.org/html/2405.04880); [author repo](https://github.com/xieyuankun/Codecfake); [Zenodo](https://zenodo.org/records/13838106) | arXiv v3, 25/12/2024; record/repo được xem 11/10/2026 | Dataset identity, sources, seven codec methods, counts, split/conditions | Đọc §§III, V–VII và README. Cùng Codecfake name/methods/counts như paper Lu; không xác minh version-to-version manifest identity |
| [Distribution shift taxonomy](https://www.sciencedirect.com/science/article/pii/S0031320311002901) | Moreno-Torres et al., 2012 | Định nghĩa covariate, label/prior và concept shift | Đọc taxonomy liên quan; các điều kiện “giữ cố định” là giả định của loại shift, không phải điều đã đo trong paper |

### Nguồn đối chiếu nội bộ về scope

Nguồn nội bộ đọc ngày 11/10/2026: [02-DEEPFAKE-VA-BAI-TOAN.md](../../02-DEEPFAKE-VA-BAI-TOAN.md), [06-GIAI-PHAU-PAPER.md](../../06-GIAI-PHAU-PAPER.md) (phần task, training setup và dataset), và [07-LITERATURE.md](../../07-LITERATURE.md) (bản đồ nguồn). Chúng hỗ trợ việc giữ đúng scope bài, A05 holdout, danh sách corpus và phân biệt robustness/generalization; chúng không thay nguồn primary của các protocol corpus trong bảng trên.
