# Hồ sơ nguồn lớp 2: cơ chế sinh và thao tác tiếng nói

**Ngày đối chiếu nguồn: 11/10/2026.** Hồ sơ này phục vụ soạn bài về Audio-JEPA speech deepfake detection. Tôi đọc phần method liên quan trong các paper primary và ghi chính xác phạm vi đọc; không huấn luyện, chạy generator, hay suy ra “dấu vết cố định” của một họ mô hình. Mỗi claim về artifact phải gắn với điều kiện dữ liệu, representation, decoder, hậu xử lý và đường truyền đã được kiểm tra.

## 1. Tách task, cơ chế và biểu diễn

Một hệ sinh tiếng nói nên được mô tả theo ít nhất ba trục độc lập:

| Trục | Ví dụ | Câu hỏi |
|---|---|---|
| Tác vụ | TTS, voice conversion (VC), voice cloning, editing, resynthesis, splicing | Đầu vào là gì, phần nào được giữ và phần nào được tạo hoặc đổi? |
| Cơ chế học/sampling | Autoregressive (AR), GAN, VAE, normalizing flow, diffusion, flow matching | Mô hình học phân phối nào và tạo mẫu bằng bước nào? |
| Biểu diễn/đường âm thanh | Waveform, mel-spectrogram, latent liên tục, codec/RVQ tokens, vocoder hoặc codec decoder | Dữ liệu đi qua biểu diễn và thành phần nào trước khi thành waveform? |

Do đó, “diffusion”, “TTS” và “codec” không phải nhãn cùng cấp. Một hệ có thể là **TTS** (task), có **flow matching** (cơ chế acoustic model), xuất **mel-spectrogram** (biểu diễn), rồi đi qua **vocoder GAN** (waveform decoder). Attribution một dấu vết cho “diffusion” phải xét cả pipeline.

| Tác vụ | Đầu vào → đầu ra | Điều kiện cần giữ/đổi | Điều không thể suy ra chỉ từ tên task |
|---|---|---|---|
| TTS | Text/phoneme, có thể kèm speaker/reference → speech mới | Nội dung theo text; giọng có thể mặc định hoặc được điều kiện hóa | TTS không tự có nghĩa là giả mạo; cùng cơ chế có thể dùng cho trợ năng, lồng tiếng hoặc đọc sách. |
| VC | Speech nguồn + mô tả/embedding/reference của giọng đích → speech cùng nội dung dự kiến, màu giọng đổi | Thường muốn giữ nội dung; timing, prosody và phát âm có thể thay đổi | Không có bảo đảm nội dung được giữ hoàn hảo hay identity được đổi sạch hoàn toàn. |
| Voice cloning | Reference voice + text hoặc speech → tiếng nói bắt chước identity/style của reference | Là khả năng/kiểu conditioning có thể nằm trong TTS hoặc VC | Không phải một kiến trúc riêng. “Zero-shot” chỉ có nghĩa đối với protocol và speaker split mà paper đánh giá. |
| Speech editing/inpainting | Audio gốc + transcript đích/vùng cần sửa + context → audio đã sửa | Vùng ngoài phần sửa cần được giữ đủ tự nhiên và nhất quán | Editing không đồng nghĩa ghép file thủ công; một model có thể sinh lại span trong ngữ cảnh. |
| Vocoder resynthesis | Mel/linguistic features → waveform | Feature được cung cấp; pha/chi tiết waveform không được feature xác định duy nhất | Vocoder có thể tái tạo mel từ audio bona fide hoặc từ TTS; nhãn phụ thuộc định nghĩa dataset. |
| Neural-codec resynthesis | Waveform → latent → lượng tử hóa → decoder → waveform gần đúng | Tái tạo nội dung gần đúng theo bitrate/model | Codec là hệ nén/representation. Token hay decoder của codec không tự làm nguồn audio thành spoof. |
| Splicing | Đoạn từ một hay nhiều recording → clip ghép | Có thể giữ nguyên phần lớn clip và thay một span | Có thể không dùng neural generator; dấu chuyển tiếp cũng có thể do biên cắt, căn thời gian, gain hoặc crossfade. |

**Voice cloning là conditioning/capability.** VALL-E nhận phoneme của text cần sinh cùng codec tokens từ recording enrollment; paper mô tả prompt 3 giây cho speaker chưa thấy trong training. Reference đồng thời mang điều kiện âm học khác: paper báo cáo có thể giữ cảm xúc và môi trường thu. Vì thế “speaker identity” không phải thông tin duy nhất mà prompt chuyển vào output. [S6]

## 2. Các pipeline cụ thể

### TTS với vocoder waveform: HiFi-GAN

HiFi-GAN là **vocoder**: mel-spectrogram → generator tích chập tăng sample rate bằng transposed convolution → waveform. Sau mỗi bước upsampling, module multi-receptive-field fusion (MRF) cộng các residual block có kernel/dilation khác nhau. Generator không nhận noise riêng trong cấu hình paper. Hai nhóm discriminator bổ sung nhau: multi-period discriminator (MPD) reshape waveform thành các hàng/chuỗi tuần hoàn với period [2, 3, 5, 7, 11]; multi-scale discriminator (MSD) xét waveform ở nhiều mức downsample/smoothing. Loss generator gồm least-squares adversarial, feature matching và L1 mel-spectrogram reconstruction. [S1]

Vocoder không làm text analysis hoặc quyết định câu chữ. Muốn có TTS đầy đủ cần một acoustic/text model đứng trước nó; HiFi-GAN có thể chỉ nhận mel được tạo từ TTS, nhưng cũng có thể nhận mel trích từ speech đã thu. Vì vậy, “HiFi-GAN output” mô tả một stage của signal path, chưa xác định nguồn ban đầu hay nhãn deepfake.

### TTS end-to-end với VITS

VITS mô tả một **conditional VAE kết hợp normalizing flow và GAN**. Khi train, posterior encoder nhận linear spectrogram để tạo phân phối latent; text encoder và alignment phoneme–frame xác định conditional prior. Monotonic Alignment Search (MAS) tìm alignment đơn điệu để không cần ground-truth duration alignment. Decoder kiểu HiFi-GAN biến latent thành waveform; mel L1 loss so sánh mel của waveform tạo với mục tiêu, còn discriminator/feature matching giúp chất lượng waveform. Stochastic duration predictor mô hình hóa nhiều nhịp nói khả dĩ cho cùng text. Khi inference, posterior encoder và discriminator train-only không chạy; prior theo text, duration và decoder tạo tiếng nói. [S2]

“VITS là VAE” là mô tả thiếu: nó có flow làm prior expressive hơn, duration predictor dùng flow, và decoder được adversarially trained. Ngược lại, không nên gọi VITS là “normalizing-flow TTS” rồi quên VAE và decoder GAN. Đây là ví dụ vì sao cần định vị component thay vì ép toàn hệ vào một nhãn duy nhất.

### TTS diffusion: Grad-TTS

Grad-TTS nhận chuỗi text/phoneme → text encoder tạo đặc trưng μ̃ → duration predictor/MAS mở rộng thành μ theo từng frame mel → score decoder sinh mel bằng reverse diffusion/ODE → vocoder đổi mel sang waveform. Training khớp encoder-aligned μ với target mel và học score của mel bị làm nhiễu. Inference bắt đầu từ noise có điều kiện gần μ rồi tích phân reverse ODE; bước solver nhỏ hơn thường đổi tốc độ/chất lượng theo setup paper. [S3]

Điểm phân biệt: Grad-TTS dùng **score matching/diffusion**. Việc lấy một ODE để chạy reverse process không tự biến objective của nó thành flow matching hay normalizing flow.

### Flow-matching TTS và infilling: F5-TTS

F5-TTS bỏ explicit phoneme alignment và duration predictor trong thiết kế paper. Training lấy mel target, chọn temporal mask m, tạo noisy mel trên đường từ Gaussian noise tới mel thật, giữ phần mel ngoài mask làm context, và điều kiện hóa bằng transcript. Chữ được pad bằng filler tokens tới chiều dài frame; ConvNeXt V2 xử lý text riêng trước khi ghép điều kiện với speech features; Diffusion Transformer dự đoán vector field. Inference dùng prompt audio mel + transcript reference + text mới; ODE solver đi từ noise tới mel, bỏ phần prompt rồi vocoder khôi phục waveform. Sway Sampling thay cách chọn flow steps lúc inference. [S4]

Trong paper này, audio prompt cung cấp speaker characteristics còn text prompt hướng nội dung. F5-TTS là một task TTS với khả năng zero-shot prompt, và model là non-autoregressive theo chiều token; quá trình ODE vẫn lặp qua các flow steps. “Non-AR” vì thế không có nghĩa một forward pass duy nhất.

### VC: AutoVC

AutoVC minh họa VC qua spectrogram: speech nguồn → mel + content encoder có information bottleneck; reference của giọng đích → speaker encoder đã pretrain; decoder kết hợp content code nguồn với speaker code đích → mel chuyển đổi → WaveNet vocoder → waveform. Khi train, content từ một utterance và speaker embedding từ utterance cùng người nói buộc decoder tái tạo nguồn. Loss cơ bản là MSE reconstruction cộng λ lần L1 giữa content code đầu vào và content code sau khi tái dựng. Bottleneck được chọn để giảm thông tin identity trong content code mà vẫn giữ thông tin cần cho tái dựng. [S7]

Định lý của AutoVC dựa trên các giả định về speaker encoder (utterances cùng speaker cho embedding giống nhau, speaker khác nhau cho embedding khác nhau), tính chất nguồn speech và bottleneck; đây không phải bảo đảm vô điều kiện cho mọi giọng/mọi ngôn ngữ. Trong thí nghiệm zero-shot, target speakers vắng mặt trong train và paper dùng khoảng 20 giây speech tham chiếu cho mỗi target speaker; không nên rút thành “AutoVC clone được bất kỳ giọng nào với bất kỳ reference nào.”

### Codec language model: VALL-E

VALL-E dùng EnCodec làm tokenizer: waveform 24 kHz → encoder giảm thời gian 320 lần thành 75 latent frames/giây → RVQ có 8 quantizer, 1024 entries mỗi quantizer trong setting 6 kbps → discrete acoustic codes. Phoneme text và acoustic-code prompt từ enrollment recording đi vào hai phần language model: AR decoder dự đoán codebook đầu tiên theo thời gian; NAR model dự đoán codebooks 2–8 có điều kiện trên text, prompt và các codebook trước đó. EnCodec decoder biến token codes thành waveform. Ví dụ paper: 10 giây audio thành ma trận 750×8; 3 giây recording dùng làm speaker prompt ở inference. [S5, S6]

Đây là ví dụ codec **representation** + AR/NAR **modeling** + TTS **task** + voice cloning **conditioning** trong cùng hệ. Codec tự nó không phải generator của nội dung câu: language model dự đoán token có điều kiện, codec decoder dựng waveform từ tokens.

### Editing: VoiceCraft

VoiceCraft biểu diễn waveform bằng EnCodec thành ma trận T×K của RVQ tokens. Với speech editing, model chọn span cần thay, thay nó bằng mask token, rồi dời token gốc của span tới cuối chuỗi để causal decoder có thể dùng cả context trước và sau. Delayed stacking dịch thời điểm các codebook theo một pattern để model autoregressive dự đoán nhiều RVQ levels thuận tiện. Decoder-only Transformer nhận transcript và token sequence đã sắp xếp; K output heads dự đoán codebook tokens, train bằng negative log likelihood. Paper factorizes dự đoán các codebook tại cùng bước thời gian với giả định có điều kiện; đó là một quyết định mô hình hóa, không phải tính chất tất yếu của RVQ. EnCodec decoder đổi kết quả lại thành audio. Inference dùng transcript đã sửa và các span; phần ngoài span là context audio đã có. VoiceCraft dùng cùng nền tảng cho editing và zero-shot TTS continuation. [S8]

VoiceCraft nêu rõ mục tiêu editing: thay một số từ/cụm, giữ phần không được chọn. Đây khác với lấy clip TTS độc lập rồi nối vào audio gốc: model conditioning trên context nhằm giảm mismatch prosody/boundary. Nó vẫn là một model sinh token; “nguyên văn phần còn lại được giữ nguyên tuyệt đối” không nên khẳng định nếu chưa đối chiếu representation và output cụ thể.

### Resynthesis và splicing

**Self-vocoding/resynthesis:** LibriSeVoc lấy cùng mel từ mỗi audio gốc rồi dựng lại waveform bằng sáu vocoder (WaveNet, WaveRNN, WaveGrad, DiffWave, MelGAN, Parallel WaveGAN). Cách ghép này kiểm soát tốt hơn nội dung/mel trong phép so sánh giữa vocoder, và paper dùng nó để huấn luyện nhận dạng vocoder/artifact. Paper báo cáo RawNet2 đa nhiệm trên LibriSeVoc, WaveFake và ASVspoof 2019; có thêm thử nghiệm re-sampling/noise. Đây là bằng chứng có điều kiện cho sáu vocoder, dữ liệu và protocol đã nêu, không phải chứng minh mọi TTS hay mọi diffusion có cùng cue. [S9]

**Splicing/partial spoof:** PartialSpoof tạo clip pha trộn từ bona fide và spoof trong ASVspoof 2019 LA. Nhóm tác giả xác định speech regions bằng biểu quyết 2/3 từ ba VAD; thay segment bằng segment spoof gần thời lượng; căn điểm nối bằng cross-correlation và overlap-add sau normalize, sao cho overlap đặt trong vùng non-speech ở đầu/cuối segment; gán nhãn theo từng segment. Đây là recipe benchmark cụ thể để học task partial spoof/localization, không phải định nghĩa bao trùm mọi chỉnh sửa đời thực. [S10]

Điểm dùng trong bài: resynthesis thay đổi waveform dù nguồn nội dung là audio thật; splicing có thể chỉ thay một đoạn ngắn và không cần generator ở đoạn còn lại. Vì vậy nhãn spoof là quyết định theo threat model/dataset, không phải tính chất nội tại của codec hay phép biến đổi waveform.

## 3. Cơ chế và phương trình tối thiểu

Các công thức sau là mô hình hóa giản lược để hiểu objective. Ví dụ số là đồ chơi tính tay, không phải kết quả đo từ checkpoint hay tái hiện thí nghiệm paper.

### Autoregressive

Với chuỗi token y₁:T và điều kiện c:

\[
p(y_{1:T}\mid c)=\prod_{t=1}^{T}p(y_t\mid y_{<t},c).
\]

Ví dụ hai token: p(y₁|c)=0.8, p(y₂|y₁,c)=0.5, vậy xác suất của chuỗi này là 0.8×0.5=0.4. Ở VALL-E/VoiceCraft, yₜ có thể là codec token; AR không bắt buộc dự đoán từng PCM sample.

### GAN và HiFi-GAN

HiFi-GAN dùng least-squares GAN. Với một discriminator scalar D, giản lược:

\[
L_D=(D(x)-1)^2+(D(G(s)))^2,\qquad
L_G^{adv}=(D(G(s))-1)^2.
\]

Loss đầy đủ của generator còn cộng feature matching và mel L1; nhiều sub-discriminator được cộng. Toy: nếu discriminator trả D(G(s))=0.7, riêng generator adversarial loss là (0.7-1)²=0.09. Con số này không nói gì về detector spoof tổng quát: D học objective huấn luyện GAN trên real-vs-generated theo điều kiện paper.

### VAE và normalizing flow

Conditional VAE tối thiểu tối ưu negative ELBO:

\[
L_{VAE}=\mathbb E_{z\sim q(z\mid x)}[-\log p(x\mid z)]
+D_{KL}(q(z\mid x)\Vert p(z\mid c)).
\]

Với q=N(0,1), p=N(1,1), KL bằng (0-1)²/2=0.5. Nếu mục tiêu reconstruction là L1 và target mel toy là [0,1], output [0.2,0.7] cho L1 =0.2+0.3=0.5. VITS dùng text/alignment cho prior, posterior từ audio trong training và có thêm GAN decoder loss; hai số toy chỉ minh họa hai thành phần.

Normalizing flow là ánh xạ khả nghịch u=f(x) để tính density theo đổi biến:

\[
\log p_X(x)=\log p_U(f(x))+\log\left|\det J_f(x)\right|.
\]

Toy 1D: u=2x, nên |df/dx|=2 và log p_X(x)=log p_U(2x)+log2. Tính density được nhờ phép biến đổi khả nghịch và Jacobian. Đây là vai trò flow trong VITS.

### Diffusion/score model và Grad-TTS

Trong score matching, model dự đoán gradient log-density của dữ liệu ở mức nhiễu t. Với corruption Gaussian có độ lệch chuẩn σ quanh x₀, nếu xₜ=x₀+ε, score có điều kiện đúng là:

\[
\nabla_{x_t}\log p(x_t\mid x_0)=-\epsilon/\sigma^2.
\]

Toy: σ=0.5, perturbation ε=0.2, target score là -0.2/0.25=-0.8. Grad-TTS dùng noise schedule/mean có điều kiện theo text-aligned μ; công thức này là trường hợp Gaussian 1D để đọc trực giác, không thay toàn bộ schedule của paper. Reverse SDE/ODE dùng score đã học để đi từ noise về mel. [S3]

### Flow matching

Flow matching học vector field vₜ dọc theo probability path đã chọn. F5-TTS nêu Optimal Transport path tuyến tính:

\[
x_t=(1-t)x_0+t x_1,\qquad
L_{CFM}=\mathbb E\left\|v_t(x_t,c)-(x_1-x_0)\right\|^2.
\]

Toy: noise x₀=-1, target x₁=3, t=0.25: xₜ=0, velocity đích x₁-x₀=4. Nếu model dự đoán 3.5, squared error ở điểm này là (3.5-4)²=0.25. Inference giải dx/dt=vₜ(x,c) từ noise tới sample.

**Flow matching khác normalizing flow.** Công thức tên “flow” dễ gây nhầm: normalizing flow thường là chuỗi biến đổi khả nghịch cho likelihood/determinant; flow matching là objective khớp vector field của một path và thường sinh bằng ODE solver. FM không mặc nhiên đòi một bijection từng layer hay tính log-likelihood bằng change-of-variables như normalizing flow. Hai họ có thể liên quan qua continuous dynamics nhưng không phải đồng nghĩa. Diffusion score và FM cũng không đồng nghĩa: score model khớp score/noise dưới corruption process; FM khớp vector field mục tiêu theo path, dù một số cách sampling/diễn giải đều có thể dùng ODE.

### Neural codec và RVQ

Ở mỗi bước thời gian, RVQ lấy vector latent z, lần lượt chọn codeword gần nhất với residual:

\[
r_1=z,\quad k_j=\arg\min_k\|r_j-C_j[k]\|_2,\quad
r_{j+1}=r_j-C_j[k_j],\quad
\hat z=\sum_j C_j[k_j].
\]

Toy: z=(0.9,-0.4). Codebook 1 chọn q₁=(1,0), residual r₂=(-0.1,-0.4). Codebook 2 chọn q₂=(-0.1,-0.3), residual cuối r₃=(0,-0.1). Decoder nhận ẑ=q₁+q₂=(0.9,-0.3), nên ẑ−z=(0,0.1), còn residual z−ẑ=(0,-0.1). Thêm RVQ stage có thể giảm residual theo thiết kế/train, nhưng số codebook/bitrate đổi representation và bitrate chứ không tạo một “nhãn fake” tự động. [S5, S6]

### Ghép đoạn và biên

Một splice toy có thể viết y[n]=α[n]a[n]+(1-α[n])b[n] trong vùng overlap. Nếu tại giữa overlap α=0.5, mẫu của A là 0.8 và của B là 0.4 thì output là 0.6. Crossfade làm biên mượt hơn nhưng không chứng minh splice biến mất, cũng không tạo một cue phổ quát; nếu chỉ nối hard cut, discontinuity còn phụ thuộc pha/biên độ tại đúng hai điểm. PartialSpoof dùng căn điểm nối và overlap-add trong non-speech portions theo setup riêng. [S10]

## 4. Artifact claim: evidence có điều kiện

Không ghi bảng kiểu “GAN có artifact X”, “diffusion có artifact Y”, hay “codec always sounds Z” như sự thật cố định. Các paper đã đọc không thiết lập một fingerprint bất biến theo họ generator. Cần ghi rõ **đường sinh cụ thể** và **điều kiện quan sát**: acoustic model, feature frontend, vocoder/codec decoder, checkpoint, bitrate, sample rate, resampling, loudness normalization, post-processing, môi trường/channel, và source corpus.

LibriSeVoc là ví dụ thiết kế có kiểm soát: các vocoder nhận cùng mel được trích từ một bản ghi gốc để tạo self-vocoded waveform; paper huấn luyện task vocoder identification chung với binary detection và báo cáo kết quả trong tập này cùng hai bộ khác. Điều đó hỗ trợ claim rằng classifier trong protocol đó khai thác khác biệt của sáu vocoder; nó không chứng minh cue bất biến dưới đổi mel frontend, checkpoint, language, codec, channel hoặc generator mới. [S9]

PartialSpoof cho thấy ratio vùng giả trong clip và nhãn segment có ý nghĩa riêng; mô hình train với full-utterance spoof xuống hiệu năng trên partial spoof trong các thí nghiệm báo cáo. Điều này hỗ trợ cần khớp task/split/annotation khi dạy localization, nhưng không chứng minh detector nào cũng thất bại hay mọi splice đều tương tự dataset dựng. [S10]

Muốn củng cố một artifact hypothesis, ưu tiên paired design giữ nguyên source utterance và các bước khác, chỉ thay generator/component đang nghiên cứu; sau đó hold out speaker/content/source, đo transfer sang generator hoặc channel chưa thấy, và kiểm tra audio sau codec/resampling/post-processing. Nếu genuine và spoof đồng thời khác microphone, corpus hoặc pipeline lưu file, điểm số có thể dựa vào shortcut đó thay cho dấu sinh. Một confusion matrix tốt trên một benchmark không tách được các nguyên nhân này.

## 5. Sổ nguồn và phạm vi đọc

Ngày kiểm tra dưới đây là **11/10/2026**. “Đọc method” nghĩa đã mở và đọc phần toàn văn được liệt kê; không có nghĩa đọc toàn paper hoặc chạy mã. Mọi formula toy ở trên là diễn giải/đặt số để dạy, không phải claim paper dùng đúng số đó.

| ID | Nguồn primary, URL và phiên bản dùng | Phần toàn văn đã đọc | Claim có thể dựa vào | Giới hạn đã giữ |
|---|---|---|---|---|
| S1 | Kong et al., [HiFi-GAN](https://arxiv.org/abs/2010.05646v2), arXiv v2 (23/10/2020), NeurIPS 2020 | §2.1–2.4: generator/MRF, MPD/MSD, GAN/mel/feature-matching losses; xem ablation §4.2 | Mel→waveform generator; period/scale discriminators và loss cụ thể | Không phải TTS frontend; không đo forensic fingerprint hoặc detector transfer. |
| S2 | Kim et al., [VITS, ICML/PMLR 2021](https://proceedings.mlr.press/v139/kim21f.html), đối chiếu [arXiv v1](https://arxiv.org/abs/2106.06103v1) | §2.1–2.5: conditional ELBO, reconstruction/KL, MAS, duration, adversarial loss, architecture | Vì sao một TTS kết hợp VAE, normalizing flow, MAS, stochastic duration và HiFi-GAN decoder | Paper mô tả task TTS, không khẳng định forensic cue; không gộp các module thành một cơ chế. |
| S3 | Popov et al., [Grad-TTS](https://arxiv.org/abs/2105.06337v2), arXiv v2 (05/08/2021) | §2 forward/reverse diffusion và score loss; §3.1–3.3 inference/training/architecture | Text→MAS/duration→conditioned score decoder→mel; reverse ODE là sampler của diffusion model | Không gọi score matching là FM/NF; fidelity/speed claims phụ thuộc setup paper. |
| S4 | Chen et al., [F5-TTS](https://arxiv.org/abs/2410.06885v3), arXiv v3 (20/05/2025) | §2.1–2.2 CFM/CFG; §3.1–3.2 pipeline/DiT/ConvNeXt/Sway Sampling | Text-guided mel infilling, prompt conditioning và OT-CFM vector-field objective | TTS capability không bảo đảm mọi prompt; không có explicit duration/alignment trong thiết kế paper không có nghĩa alignment không được model học ngầm. |
| S5 | Défossez et al., [High Fidelity Neural Audio Compression / EnCodec](https://arxiv.org/abs/2210.13438v1), arXiv v1 (24/10/2022), TMLR 2023; [full-text HTML mirror](https://ar5iv.labs.arxiv.org/html/2210.13438) | Đọc toàn method §3.1–3.4 trong HTML render của bản arXiv (encoder/decoder, RVQ, optional LM, training objective); HTML render được truy cập qua ar5iv mirror | Waveform→latent→RVQ codes→decoder; 24 kHz/75 frames per sec; loss/reconstruction/perceptual design | Ghi rõ HTML đọc qua mirror vì arXiv HTML endpoint không mở được; codec là compression/reconstruction system, không tự đặt nhãn spoof. |
| S6 | Wang et al., [VALL-E](https://arxiv.org/abs/2301.02111v1), arXiv v1 (05/01/2023; paper ghi “working in progress”) | §3 speech quantization/EnCodec; §4.1–4.2 formulation, AR/NAR training/inference | Codec-conditioned zero-shot TTS; first RVQ level AR, levels 2–8 NAR; prompt từ enrollment audio | Chỉ claim trong model/data/protocol paper mô tả; không biến zero-shot thành bảo đảm universal. |
| S7 | Qian et al., [AutoVC](https://arxiv.org/abs/1905.05879v2), arXiv v2 (06/06/2019), ICML 2019 | §§3.1–3.3 task/framework/loss/bottleneck; §4 architecture, spectrogram inverter/WaveNet; selected §5.3 zero-shot setup | Source content code + target speaker embedding → converted mel → WaveNet; self-reconstruction/content-code losses | Theoretical result depends on assumptions; tested zero-shot uses about 20 seconds of reference speech per target speaker in the defined VCTK protocol. |
| S8 | Peng et al., [VoiceCraft](https://arxiv.org/abs/2403.16973v3), arXiv v3 (14/06/2024), ACL 2024 | §§3.1–3.4 causal masking, delayed stacking, AR modeling, inference; read §4 RealEdit construction | Codec token infilling with context and transcript for editing; same basis also supports zero-shot TTS | Editing is evaluated under named datasets/spans; codec decode and context can affect samples outside an abstract “token span.” |
| S9 | Sun et al., [AI-Synthesized Voice Detection Using Neural Vocoder Artifacts](https://arxiv.org/abs/2304.13085v2), arXiv v2 (27/04/2023), CVPRW 2023 | §3 detection/multi-task objective; §4.1 LibriSeVoc construction and relevant evaluation/perturbation discussion | Same-mel self-vocoding with six vocoders makes a controlled artifact/vocoder task; paper tests RawNet2 | Evidence is limited to its six vocoders, source corpus, preprocessing and train/eval settings; does not establish universal artifact. |
| S10 | Zhang et al., [An Initial Investigation for Detecting Partially Spoofed Audio](https://www.isca-archive.org/interspeech_2021/zhang21ca_interspeech.pdf), Interspeech 2021, DOI [10.21437/Interspeech.2021-738](https://doi.org/10.21437/Interspeech.2021-738) | §2 PartialSpoof construction; §3 utterance/segment modeling; selected §4.2–4.3 comparisons | Controlled partial replacement, overlap-add labeling; utterance and segment detection are distinct | Constructed benchmark from ASVspoof2019 LA; sample ratios, segment definitions and channel conditions delimit claims. |

## Gợi ý dùng hồ sơ khi biên soạn bài

1. Dạy một ví dụ full pipeline cho từng cơ chế, không dạy một “bản chất duy nhất” cho từng model: F5-TTS → vocoder; VITS → text prior/flow/VAE + GAN decoder; VALL-E → EnCodec + AR/NAR codec LM.
2. Bắt học viên gắn mỗi thuật ngữ vào đúng trục: TTS/VC/editing là task; AR/GAN/VAE/NF/diffusion/FM là modeling; mel/RVQ/codec là representation hoặc component.
3. Dùng AutoVC để giải thích VC và conditioning; dùng VALL-E/F5 cho voice cloning như reference conditioning; dùng VoiceCraft và PartialSpoof để tách inpainting khỏi waveform splice.
4. Khi nói forensic cue, đặt câu hỏi “đã giữ cố định những stage nào?” và “đã hold out điều kiện nào?” trước khi gọi cue là của generator family.

