Bài 4: học khử nhiễu và học trường vận tốc#
Bắt đầu · Trước: AR/GAN/VAE/flow · Tiếp: codec và audio LM
Mục tiêu và ký hiệu#
Bạn cần chỉ rõ data space, corruption/path, target, loss và sampler; tự tính một bước toy; giải thích quan hệ FM với normalizing flow mà không tách chúng thành hai thế giới không liên quan. là conditioning, là weights. Các biến ở đây có thể là một ô mel, vector latent hoặc waveform; tên objective chưa xác định representation.
Trong phần diffusion, là mức/bước nhiễu và là dữ liệu sạch. Trong phần FM, là tọa độ của path từ noise tới data. Cả k và τ không phải timestamp trong bản ghi âm. Một mel dài 3 s vẫn có thể được xử lý qua nhiều mức τ.
1. Diffusion: biết noise đã thêm để học dự đoán#
Lấy dạng DDPM phổ biến để có công thức rõ. Đặt là noise schedule, , . Với :
Training biết và noise draw, tạo được tại một k chọn ngẫu nhiên. Mạng hồi quy noise bằng simplified loss
Đây là noise-prediction parameterization, không phải mọi diffusion recipe đều dùng cùng target/loss weighting. DDPM có reverse transitions và Algorithms 1/2 phân biệt training/sampling. Ho et al., §2–3.
Toy biên soạn: , , . Khi đó . Nếu mạng dự đoán , squared noise error là . Suy một ước lượng clean sample:
Đây chưa phải một reverse sampling transition đầy đủ: transition còn phụ thuộc schedule, mean/variance và sampler. Nếu noise prediction chính xác trong cặp toy này thì estimate trả 2; ngoài toy, cùng có thể phù hợp nhiều , nên không có oracle biết noise của từng sample mới.
Sampling bắt đầu từ noise, lặp dùng mạng đã học; không được lấy thật hay noise draw training làm đáp án. Score-based versions có thể học — hướng tăng log-density — và dùng reverse SDE hoặc probability-flow ODE. Do đó “diffusion luôn sampling ngẫu nhiên, FM luôn ODE” là phân biệt quá mạnh.
2. Flow matching: path cho target vận tốc#
Đổi tên endpoints để không nhầm với diffusion: là noise sample, là data sample. Một conditional path tuyến tính toy:
là đạo hàm của path theo τ, cùng đơn vị với x trên một đơn vị τ. Học mạng bằng:
Đây là dạng conditional regression; chọn coupling endpoints/path khác thì target đổi. Paper FM §2–4 xây probability paths và giải thích vì sao conditional targets có thể huấn luyện marginal field. Ta không tuyên bố mọi independent pairing là globally optimal transport giữa hai phân phối. Lipman et al. v2.
Toy: , , → , target . Mạng trả 3 → loss 1. Với bước Euler , trạng thái mới . Nếu dùng đúng constant field của cặp toy thì tới 0,4. Sai số vừa có model error; với field tổng quát còn có numerical integration error.
Ở inference, b chưa biết. Giải từ a bằng ODE solver. Mạng đã học từ nhiều cặp; không được cố định của một mẫu train rồi gọi là generation mới. Hai đường conditional có thể đi qua cùng với vận tốc khác nhau; squared-loss optimum học conditional mean target tại state ấy. Marginal trajectory không bắt buộc là một đường thẳng của cặp đã train.
3. FM khác và liên quan normalizing flow ở đâu?#
Normalizing flow là họ phép biến đổi distribution; bài 3 dùng các maps khả nghịch hữu hạn và Jacobian cho density. FM là cách huấn luyện vector field bằng regression theo path. Paper FM dùng nó để học continuous normalizing flow (CNF). Với điều kiện regularity/uniqueness phù hợp, flow của ODE có map khả nghịch; vì vậy nói “FM không cần/có khả nghịch ở bất kỳ nghĩa nào” là sai.
Điểm thực hành: FM training có thể lấy noisy/interpolated state và target velocity trực tiếp, không cần giải ODE hay tính logdet mỗi training sample như likelihood training của nhiều flow models. Sampling vẫn giải ODE; density estimation là một việc khác. Cũng không lấy số bước solver ít hơn để suy quality hoặc forensic robustness tốt hơn cho mọi hệ.
4. Hai pipeline thật và một bẫy tên architecture#
Grad-TTS §3: text encoder + duration/alignment → điều kiện frame-wise → diffusion tạo mel → vocoder. Paper dùng reverse-time ODE/Euler cho acoustic sampling. Công thức toy DDPM ở trên dạy corruption; không phải chép nguyên Grad-TTS, nơi terminal Gaussian được condition theo encoder mean. Grad-TTS.
F5-TTS v3 §2–4: text-guided infilling trên mel, regression FM, audio/text prompt tại inference, ODE → generated mel → Vocos. DiT là tên backbone; từ “Diffusion Transformer” chưa thay objective FM thành DDPM. V1 và v3 được đọc theo section; metadata v3 revised 20/05/2025, repo còn có checkpoint gọi “F5-TTS v1 base” trong news 12/03/2025. Hai chữ “v1” không cùng namespace. Paper v3, metadata, repo tác giả.
Phản ví dụ biên soạn: diffusion chỉ sinh style latent, rồi decoder khác sinh waveform. Gọi waveform signature là “diffusion-on-waveform artifact” sẽ sai về data space. DFADD có những pipeline khác nhau; không dùng nhãn D/F làm substitute cho component trace. Hộ chiếu DFADD.
5. Liên hệ Audio-JEPA#
JEPA downstream không giải ODE hoặc denoise để tạo audio. Nó đọc log-mel từ waveform đã sinh/xử lý và học class score. Kết quả trên DFADD đo transfer tới tập gồm các hệ diffusion/FM cụ thể, không chứng minh encoder đã phát hiện target velocity, noise schedule hoặc một artifact phổ quát của family. Chương 06.
Bài tập#
- Diffusion toy , , . Tính và clean estimate khi predicted noise chính xác. Estimate ấy có tự là một generated sample không?
- FM toy . Tính state/target. Mạng trả −3; Euler h=0,2 tới đâu? Bây giờ có biết b tại inference thật không?
- “Cả hai dùng squared loss nên cùng objective.” Thiếu những gì? “FM không phải NF nên ODE map không thể invertible.” Sai ở đâu?
Đáp án có giải thích
- ; estimate . Đây là reconstruction calculation với clean/noise được cho; generation cần noise initialization và sampler đã học.
- State −1; target −4; next −1,6. b chỉ có trong training pair hoặc toy được cho, không có tại inference.
- Phải xét input distribution, path, target, time weighting, conditioning và sampling. Squared loss chỉ nói regression geometry. FM là training method, NF/CNF là family biến đổi; chúng có thể cùng xuất hiện, với invertibility dưới các điều kiện của ODE.
Đào sâu tự chọn#
Thử hai cặp (a,b)=(−1,1),(1,−1) cùng đi qua 0 ở τ=0,5 nhưng target +2/−2. Nếu mỗi cặp có probability 1/2 và condition không phân biệt, regression optimum tại đó là 0. Đây là conditional-mean calculation ở một state, không chứng minh distribution sampler “collapse”; muốn đánh giá flow phải xét field/path đầy đủ.