Bài 6 — Augmentation: nhãn được giữ, evidence có còn không?#
Điểm vào · Trước: loss · Tiếp: data/domain robustness.
Mục tiêu và tiền đề#
Xét một transform bằng label semantics, invariance và information loss; phân biệt waveform/feature augmentation và quan hệ với cache. Cần task/label, cue/confound, convolution. Mọi số dưới là toy tự biên soạn.
1. Nhãn giữ nguyên khác evidence giữ nguyên#
Gọi a_ω là transform có tham số ngẫu nhiên ω; task gán label Y(x). Recipe training thường giữ y khi tạo a_ω(x), tức giả định Y(a_ω(x))=Y(x). Đồng thời muốn model f(a_ω(x)) gần f(x) để bền trước nuisance. Hai giả định cần kiểm riêng: một label có thể vẫn đúng về provenance nhưng audio sau biến đổi đã không còn đủ thông tin phân biệt.
Toy x_B=(speech,cue=0), x_S=(speech,cue=1); codec transform bỏ cue, cả hai thành (speech,0). Provenance labels vẫn khác, observation bằng nhau. Không tồn tại audio-only deterministic classifier tách hai mẫu ấy. Giữ labels có thể là surrogate training hợp lệ, nhưng invariance tuyệt đối với mọi cue-erasing transform không tương thích với yêu cầu phân biệt collision. Không suy rằng codec thực tế luôn tạo collision; đây là phản ví dụ logic.
2. RawBoost và SpecAugment đổi các vị trí khác nhau#
RawBoost gốc gồm ba waveform processes: linear/nonlinear convolutive distortions, impulsive signal-dependent additive noise, stationary signal-independent colored noise. Có các cách kết hợp/order trong recipe; nó không là tên chung của mọi augmentation hoặc mask mel. Tak et al., v2 §3 và §4.
Một dạng nonlinear filter minh họa từ cơ chế ấy:
n,k là sample indices; j là polynomial order; x normalized amplitude, b_j FIR coefficients, g_j gains. J=1 chỉ linear filtering. x²/x³ có thể tạo harmonics, không đơn thuần “thêm background noise”. Đây là giải thích cơ chế, không đề xuất params cho Audio-JEPA.
SpecAugment gốc ASR dùng time warping, frequency masks và time masks trên acoustic features; paper mình chỉ dùng mask kiểu SpecAugment một band mỗi axis, không toàn bộ original policy. Feature zero sau log/normalization không mặc định tương ứng waveform silence. Park et al., §2.
| Transform | Vị trí/điều chỉnh | Có thể giúp | Có thể hỏng |
|---|---|---|---|
| Noise/reverb/filter | Waveform, SNR/IR/frequency response | Kênh/phòng/background diversity | Xóa hoặc tạo cues, reverberant tails khác nhãn |
| Codec | Encode/decode, bitrate/sample rate | Transmission coverage | Family overlap; genuine bị coi fake trong policy khác |
| Time/frequency mask | Feature bins/frames | Giảm phụ thuộc một vùng | Che đúng rare cue; mask pattern thành shortcut |
| Crop/shift | Observed interval | Vị trí đa dạng | Nhãn partial clip không còn đúng |
| Speed/time-stretch | Duration/pitch theo implementation | Timing variability | Đổi cues, label policy và token alignment |
| Feature dropout/noise | Encoder output/backend | Regularize readout | Không mô phỏng faithful waveform/channel shifts |
| Vocoder/resynthesis | Tạo audio bằng process | Attack diversity | Dễ học dấu pipeline; label semantics thay đổi |
Phần synthetic coverage cần ghi unique generator mechanisms/checkpoints/voices, nguồn input và overlap; không chỉ đếm số files sinh. Giữ transcript/speaker chưa bảo đảm channel/duration matching.
3. Crop partial fake: nhãn theo đơn vị quan sát#
Clip 4 s có fake interval I=[3,2;3,6] s, y_clip=S theo rule “có bất kỳ đoạn fake”. Crop C₁=[0;2,56] không giao I; C₂=[1,44;4] giao 0,4 s. Không thể giữ segment label S cho C₁ nếu target là audio trong crop có fake hay không. Nếu chỉ clip-level training weak label, C₁ vẫn nhận label clip nhưng đã có label noise theo observed content; cần MIL/coverage/relabel policy rõ.
C₂ dài 2,56 s có fake duration fraction 0,4/2,56=0,15625. Binary “any fake” label vẫn S, không 0,15625. Chọn threshold/labels theo duration fraction là task khác. Fully synthesized utterance cũng không bảo đảm mọi crop giàu evidence: silence hoặc câu quá ngắn có thể ít thông tin.
4. Mixup: soft target là surrogate#
Mixup tạo x̃=λx₁+(1−λ)x₂, ỹ=λy₁+(1−λ)y₂, λ∈[0,1]; thường λ sampled Beta. Với B y₁=1 và S y₂=0, λ=0,25 cho target B=0,25. Nó là interpolation objective; hai waveforms thường chồng lên nhau toàn duration, không “25% thời gian genuine,75% fake”. Zhang et al., §2.
Crossfade/cut-and-paste khác waveform mixup; gán soft label theo area/duration cần điều kiện task và actual evidence, không copy label policy của vision. Với clip có một đoạn fake rất ngắn, “any fake” binary label và duration fraction khác hẳn. Mixup ở log-mel/embedding cũng không tương đương mix waveform vì magnitude/power/log nonlinear.
5. Thứ tự transforms và caching không commute#
Toy filter F là causal two-tap y[n]=x[n]+x[n−1], zero ngoài audio; x=[1,0,0,0], crop C lấy indices 1..3. F(x)=[1,1,0,0]; C(F(x))=[1,0,0]. C(x)=[0,0,0]; F(C(x))=[0,0,0]. Reverb/filter tail từ ngoài crop đi vào crop chỉ trong cách đầu. Vì vậy “cùng transforms” chưa cùng recipe khi đổi order/boundary behavior.
Noise→peak normalization khác normalization→noise vì gain/SNR đổi. Speed→crop khác crop→speed vì physical coverage đổi. Codec có internal frame/context/state và sample-rate assumptions; phải ghi order với resample/crop. Paired robustness test dùng cùng original và cùng ω giúp giảm variability, nhưng transform vẫn có thể đổi nhiều cues đồng thời.
Cache encoder f(x) rồi augment features a'(f(x)) không bảo đảm bằng f(a(x)); chỉ có thể thay thế khi chứng minh equivalence cho transforms/encoder cụ thể. Cache fixed augmented views là finite view set, không fresh view distribution mỗi epoch. Bài adaptation nối gradient/cache paths.
6. Cân bằng transforms giữa lớp cần nhưng chưa đủ#
Nếu codec applied only S, model có thể học codec as label. Applying cùng probability cho B/S giảm association ấy, nhưng source content/channel và transform response vẫn có thể khác: cùng codec lên clean studio B và noisy web S không làm observed channels identically distributed. Need source×label support, paired controls và held-out channel ranges; không chỉ equal augmentation rate.
Assumption “a nuisance nên bỏ” phụ thuộc task. Replay/codec có thể là attack mechanism hoặc legitimate transmission. TTA/consistency không được ép score invariant với transform đã chuyển valid class theo operational label.
7. Paper và bài tập#
PDF §3.3 ghi mask mới mỗi spectrogram: time width≤16/256=6,25%, frequency width≤16/128=12,5%. Đây là axes maximums, không tổng masked area cộng đơn giản: với hai bands giao nhau, union fraction p_t+p_f−p_tp_f nếu full rectangular bands. Mask downstream khác patch removal pretraining để tạo prediction task. Không gán RawBoost, speed, mixup hay synthetic generation vào các runs đã báo.
- Crop không chứa fake, giữ S label có luôn hợp lý không?
- Mixup B/S với λ=0,7 có nghĩa 70% thời gian genuine không?
- Hai mask bands che 6,25% time và 12,5% frequency; union area tối đa bao nhiêu?
- Transform giống nhau hai lớp có tự loại source confound không?
- Vì sao perturbation làm detector kém chưa chứng minh model chỉ dùng nuisance?
Đáp án giải thích
- Phụ thuộc target unit: observed segment “any fake” thì không; weak clip supervision phải công bố coverage/noise assumptions.
- Không. Label là surrogate interpolation; waveform cộng chồng toàn duration, không segmentation.
- 0,0625+0,125−0,0625×0,125=0,1796875, khoảng 17,97%, nếu đạt cả maxs và masks kiểu full bands. Actual random sample có thể nhỏ hơn.
- Không. Conditional response/source support còn khác, labels/transform policy chưa giải quyết tất cả dependencies.
- Transform có thể đồng thời xóa forensic evidence, đổi duration/context hoặc gây OOD artifacts. Cần competing explanations và controls.