ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
11 phút đọc · Toàn văn
Mục lục bài · 8 mục

02 — Taxonomy deepfake, bài toán và dữ liệu#

Chương này giữ vai trò bản đồ. Bắt đầu học sâu tại Lớp2: tám bài theo tiến trình; xem báo cáo enrich và tiến độ gia sư. Học liệu hoàn tất không đồng nghĩa người học đã học xong.

1. Cần phân loại theo nhiều trục riêng#

Tác vụ tạo gì, được điều kiện hóa bằng gì, mô hình tạo bằng cách nào, biểu diễn ở đâu, và audio đi qua xử lý gì là các câu hỏi khác nhau. “Diffusion”, “TTS” và “codec” không phải ba loại cùng cấp.

TrụcVí dụCâu hỏi cần trả lời
Tác vụ sinh/chỉnh sửaTTS, VC, speech editing, resynthesisĐiều kiện đầu vào và thứ bị thay đổi là gì?
ConditioningText, source speech, reference voice, speaker embedding, context/maskNội dung/identity/context đi vào từ đâu?
Cơ chế mô hìnhAutoregressive, GAN, VAE, normalizing flow, diffusion, flow matchingPhân phối audio được học/sampling thế nào?
Biểu diễnWaveform, mel, latent liên tục, codec tokensKhối nào dự đoán loại dữ liệu nào?
Signal chainVocoder/codec decoder, resampling, MP3, Opus, replayDấu vết quan sát đến từ generator, decoder hay đường truyền?

Một TTS có thể dùng flow matching để tạo mel, rồi dùng vocoder GAN để tạo waveform. Một mô hình autoregressive có thể tạo codec tokens thay vì mẫu waveform. Attribution “đây là diffusion artifact” cần xem toàn pipeline.

Ví dụ nhiều trục và trường unknown: bài1. Task, architecture và operational label cũng được giữ riêng.

2. Taxonomy tác vụ tạo và thao tác#

Tác vụĐầu vào → đầu raYếu tố thường giữYếu tố thường đổi
Text-to-speech (TTS)Text + conditioning → speechCâu chữ theo textSignal được sinh mới
Voice cloningReference/identity + text hoặc speech → giọng mục tiêuIdentity mong muốnKhông phải một kiến trúc độc lập; có thể thực hiện bằng TTS/VC
Voice conversion (VC)Speech nguồn + identity → speechNội dung, có thể cả timingVoice identity/timbre và nhiều đặc tính khác
Vocoder resynthesisAcoustic features của audio → waveformFeature được cung cấpChi tiết waveform không được feature xác định
Neural-codec resynthesisWaveform → quantized latent → waveformNội dung gần đúngDấu lượng tử hóa/decoder, tùy bitrate và model
Speech editing/inpaintingAudio + vùng sửa + conditioning → audioPhần không sửaMột số từ/đoạn và vùng chuyển tiếp
SplicingGhép đoạn từ nhiều bản ghiAudio từng đoạnTính liên tục và ngữ cảnh
Singing synthesis/conversionText/score/reference → tiếng hátTùy điều kiệnDomain khác speech thông thường

Resynthesis không tự đồng nghĩa lừa đảo. Neural codec có thể nén cuộc gọi thật. Dataset có thể gán nó là spoof để đo khả năng nhận ra quá trình tái tạo; ứng dụng khác có thể vẫn coi đó là audio hợp lệ. Nhãn phải gắn với định nghĩa task.

“Deepfake” cũng không đồng nghĩa “không được phép”. Detector âm học không suy ra được consent, ý định hoặc nội dung có đúng sự thật không.

Truy vết content/identity và hai kiểu mask editing: bài2.

3. Taxonomy cơ chế sinh#

Autoregressive#

p(x∣c)=∏tp(xt∣x<t,c).p(x\mid c)=\prod_t p(x_t\mid x_{<t},c).

xtx_t có thể là mẫu, acoustic frame hoặc token codec. Mô hình học phụ thuộc tuần tự; tốc độ và lỗi tích lũy phụ thuộc thiết kế. “Autoregressive” không đồng nghĩa luôn có artifact chu kỳ.

GAN#

Generator tạo mẫu để đánh lừa discriminator, thường kết hợp loss spectral/feature matching. HiFi-GAN là ví dụ vocoder dạng này. Detector forensics và discriminator của GAN có phân phối, mục tiêu và protocol khác nhau; không thể coi discriminator huấn luyện generator là detector tổng quát. Nguồn ví dụ: HiFi-GAN.

VAE và normalizing flow#

VAE học biến tiềm ẩn với reconstruction term và regularization phân phối. Normalizing flow dùng ánh xạ khả nghịch với đổi biến để tính density. VITS kết hợp nhiều thành phần, minh họa vì sao gán một TTS vào đúng một nhãn cơ chế thường quá đơn giản. Nguồn ví dụ: VITS.

Diffusion#

Làm nhiễu dữ liệu ở nhiều mức, học quá trình khử nhiễu/score để sinh mẫu. Có thể chạy trên mel, latent hoặc waveform. Chất lượng phụ thuộc representation, conditioning, sampler và decoder. Đừng suy ra rằng mọi diffusion TTS có cùng forensic signature.

Flow matching#

Học vector field vận chuyển từ phân phối nguồn tới dữ liệu theo một đường xác suất đã chọn. Một dạng loss:

LFM=E∥vθ(xt,t,c)−ut∥2.\mathcal L_{FM}=\mathbb E\|v_\theta(x_t,t,c)-u_t\|^2.

Sampling có thể dùng giải ODE. Flow matching không phải synonym của normalizing flow: FM là cách huấn luyện vector field, có thể dùng để học continuous normalizing flows; ODE flow khả nghịch dưới điều kiện regularity/uniqueness phù hợp. Không suy FM và NF không liên quan. F5-TTS là ví dụ cho tác vụ TTS. Nguồn: FM §§2–3, F5-TTSv3.

Neural codec và audio language model#

Codec thường có encoder, quantization và decoder. Audio language model có thể học phân phối trên token do codec tạo. Vì vậy cần tách lỗi của mô hình token khỏi đặc tính codec decoder. Nguồn nền: EnCodec.

Mục tiêu học phần này là hiểu điểm nào có thể tạo dấu vết, không phải học cách triển khai mọi generator.

Factorization/loss và VITS train–inference: bài3. Noise/path/target và sampling: bài4. Residual RVQ, bitrate và codec-LM: bài5.

4. Dấu vết có thể nằm ở đâu?#

Nhóm cueVí dụRủi ro khi dùng
Spectral fine structureHarmonics, envelope, vùng tần số bất thườngCodec/filter có thể xóa hoặc tạo cue tương tự
Phase và excitationCoherence, periodicity, chuyển tiếpNhạy với channel và căn chỉnh
Temporal dynamicsTính liên tục, duration, transitionSpeech tự nhiên cũng rất đa dạng
Prosody và articulationRhythm, pitch trajectory, coarticulationNhiều generator mới mô hình hóa tốt; lệch ngôn ngữ có thể thành confound
Background và silenceNoise floor, phần không nói, boundaryDễ trở thành dấu của dataset hoặc preprocessing
Codec/upsamplingCutoff, residual, lượng tử hóaKhông nhất thiết chứng minh fake theo ứng dụng
Semantic/cross-modalAudio–video timing, nội dung–speakerCần modality/metadata khác; khác audio-only forensics

Không phải mọi cue đều là artifact của generator. Tập genuine có micro A còn tập spoof được lưu bằng pipeline B: classifier rất dễ thắng mà không hiểu synthesis.

Đối chứng2×2 và cách giới hạn artifact claim: bài8.

5. Taxonomy bài toán phát hiện#

Theo đầu ra#

TaskĐầu raKiến thức thêm cần có
Utterance-level detectionScore của cả clipPooling, threshold, EER/DCF
Segment/frame detectionScore theo thời gianTemporal resolution, label alignment
Partial-fake localizationVị trí vùng sửaBoundary metrics, ngắn/dài, overlap
Source attributionGenerator/family/sourceClosed/open set, hierarchy, unknown source
Forensic similarityHai mẫu có cùng quá trình tạo không?Metric learning và relation-level evaluation
Spoof-aware speaker verification (SASV)Có phải đúng người và bona fide?Target, non-target và spoof; nhiều loại chi phí
Audio-visual detectionScore từ audio và videoFusion, missing modality, synchronization
Provenance/watermark verificationCó dấu nguồn xác thực không?Đây là evidence về nguồn, khác phát hiện artifact

Trong paper của mình: audio-only supervised utterance-level detection, score cao là bona fide. Không có segment labels, source attribution hoặc SASV.

Theo đường tấn công#

  • Logical access (LA): signal tổng hợp/chuyển đổi đưa vào đường số của hệ xác thực.
  • Physical access (PA): phát lại qua loa–phòng–micro; replay có thể dùng cả genuine lẫn synthetic source.
  • ASVspoof DF track: định nghĩa cụ thể của benchmark deepfake, không phải nhãn chung cho mọi LA/PA.

LA/PA mô tả threat scenario; TTS/VC mô tả cách tạo signal. Replay giọng người thật vẫn có thể là spoof với hệ ASV.

Theo supervision#

Chế độDữ liệu huấn luyệnGiới hạn
Supervised binaryGenuine + các fake đã biếtKhông bảo đảm fake mới nằm cùng ranh giới
One-class / anomalyChủ yếu genuineOutlier genuine có thể bị coi fake; fake tự nhiên có thể lọt
Semi-supervisedMột phần labeled, nhiều unlabeledPseudo-label error và distribution mismatch
Few-shot adaptationÍt mẫu domain/attack mớiCần protocol tách support và query
Zero-shot transferKhông dùng nhãn target task/domain theo định nghĩa công bốPhải nói rõ “zero-shot” đối với cái gì
Domain adaptationCó dữ liệu target, có/không labelKhác domain generalization không truy cập target

“Không dùng spoof lúc train” không bảo đảm “phát hiện mọi spoof”. Prediction error cao là bất thường với model, chưa phải bất thường về tính xác thực.

SASV ba loại trial, attribution theo độ hạt/unknown rejection, watermark/provenance và target exposure: bài6.

6. Taxonomy generalization và robustness#

TrụcVí dụ chuyển dịchCó thể đánh giá riêng không?
SpeakerNgười nói mớiCó, nếu split theo người
ContentText/phoneme/style mớiCó, nếu metadata và kiểm overlap đủ
GeneratorTTS/VC system mớiCó, nhưng cần phân biệt model family, checkpoint, vocoder chung
Genuine sourceVCTK → LibriTTS/webThường đổi đồng thời speaker, device, style
LanguageEnglish → Mandarin/VietnameseThường kèm thay corpus và generator
ChannelLossless → MP3/Opus/telephoneCó thể xử lý cặp cùng utterance để tách channel
EnvironmentClean → noise/reverbCó thể kiểm soát bằng perturbation
TimeGenerator/lưu lượng năm sauCần temporal holdout
AdversarialKẻ tấn công tối ưu để né modelKhác noise ngẫu nhiên
Compositional shiftGenerator mới + codec mới + ngôn ngữ mớiKhó hơn từng shift độc lập

Robustness thường là ổn định dưới perturbation; generalization rộng hơn, liên quan dữ liệu/điều kiện chưa thấy. Hai từ có vùng giao nhau nhưng không nên dùng như nhau.

Covariate shift: p(x)p(x) đổi, giả định p(y∣x)p(y\mid x) giữ. Label shift: p(y)p(y) đổi, giả định p(x∣y)p(x\mid y) giữ. Concept shift: quan hệ p(y∣x)p(y\mid x) hoặc định nghĩa label đổi; tên loại shift cần đi cùng giả định. Với deepfake, nhiều shift có thể cùng xảy ra; histogram score không đủ định danh. Ví dụ Bayes và phản ví dụ: bài8.

7. Taxonomy dataset phải dùng metadata, không chỉ tên#

NhómVai trò học tậpCảnh giác
ASVspoof2019 LAGenerator known/unseen, genuine VCTKEval in-corpus không có nghĩa mọi attack đã biết
ASVspoof2021 LA/DFChannel/codec và task khác nhauKhông đổi tên giữa LA và DF
ASVspoof5Attack và điều kiện mới, nhiều metricDùng đúng protocol/track hiện hành
DFADDDiffusion/flow TTS với genuine VCTKShared source khác exact overlap
LibriSeVocVocoder resynthesis trên LibriTTSShared ancestry với LibriSpeech cần audit
In-the-WildWeb genuine/fakeSpeaker, source và quality khó kiểm soát
CodecFake Wu et al.,2406.07237Neural-codec resynthesis và transfer sang codec TTSPhân biệt Codecfake Lu/Xie; khóa đúng paper/release
ADDLow-quality/partial/manipulation tùy trackKhông dùng tên ADD thay cho track và version
PartialSpoofFake ngắn nằm trong genuineUtterance labels không đủ để đo localization
MLAAD/SpoofCeleb và đa nguồn khácĐa ngôn ngữ/generator/sourceCần kiểm nguồn, split, quyền và quan hệ với test

Tên trên là bản đồ định vị, không phải xác nhận mọi bản phát hành đều có cùng số lượng, preprocessing hoặc giấy phép. Nguồn protocol: ASV2019 database §§2–3, ASV2021 overview §§II–III, PartialSpoof2021 §2, ASVspoof5 plan v0.6. Corpus phụ chỉ định vị, chưa được audit sâu ở lớp này. Số dùng cho paper cụ thể giữ ở chương06.

Cách đọc disjointness, ancestry và exposure: bài7. Metadata/version/unknown từng corpus: sổ hộ chiếu. Mức đọc primary: sổ nguồn.

Mẫu “hộ chiếu dataset”#

Ghi: genuine source; người nói; ngôn ngữ; text; generator family/checkpoint; vocoder/codec; sample rate và bandwidth; preprocessing; split; parent corpus; unit of annotation; class definition; overlap với pretraining/train/dev/test.

Không có metadata này, một bảng cross-dataset EER chỉ cho biết hệ khác nhau trên các gói dữ liệu; khó trả lời nguyên nhân.

8. Tự kiểm tra#

  1. Một TTS flow-matching + HiFi-GAN thuộc những ô nào?
  2. Tại sao neural-codec audio có thể hợp lệ nhưng vẫn mang dấu máy?
  3. Khác nhau giữa unseen generator và unseen corpus?
  4. Một attack holdout có cùng vocoder với train có phải family-disjoint không?
  5. Nếu làm localization bằng patch 80 ms, “phát hiện đoạn 10 ms” cần được giải thích thế nào?

Điều cần nhớ: định nghĩa task quyết định nhãn; cơ chế sinh quyết định giả thuyết về cue; protocol quyết định điều mà kết quả có thể chứng minh.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.