ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
11 phút đọc · Toàn văn
Mục lục bài · 9 mục

04 — Taxonomy kỹ thuật trong detector#

Bản đồ này có bộ chín bài sâu của lớp 4: cơ chế, ví dụ đã giải, phản ví dụ, bài tập và sổ nguồn có mức đọc method. Dùng chương này để định vị kỹ thuật; dùng bộ lớp 4 để tự trace và giải thích.

1. Một detector là chuỗi lựa chọn, không chỉ encoder#

x→preprocess→front-end/encoder→aggregation→head→score→decision.x\rightarrow\text{preprocess}\rightarrow\text{front-end/encoder}\rightarrow\text{aggregation}\rightarrow\text{head}\rightarrow\text{score}\rightarrow\text{decision}.

Cùng encoder nhưng khác crop, pooling hoặc score có thể đổi kết quả đáng kể. Khi đọc một phương pháp mới, đặt mỗi thành phần vào vị trí trong chuỗi này trước khi đánh giá novelty.

Adaptation là quy tắc cập nhật: chọn parameters/state nào học bằng loss/data nào. Frozen sang full fine-tune có thể giữ cùng sơ đồ forward và đổi đường gradient/update. Adapter/LoRA có thể thêm một module/nhánh forward thật; chế độ học các tham số của nó là một trục riêng. Xem hai bản đồ forward và update.

2. Taxonomy front-end#

HọVí dụƯu điểm/giả địnhRủi ro
Handcrafted acousticLFCC, CQCC, phase/group-delayFeature có ý nghĩa tín hiệu rõ hơnCần chọn resolution phù hợp, có thể thiếu context
Waveform networkRawNet2, waveform front-end của AASISTFixed Sinc filterbank trong recipe được đối chiếu, rồi learned feature hierarchyWaveform input không có nghĩa mọi bộ lọc đều học; phải ghi version/config
Spectrogram networkCNN/AST/ViTLocal time-frequency structureMất thông tin do representation, patch geometry
Speech SSLwav2vec2/XLS-R, HuBERT, WavLM, data2vecTận dụng pretraining speech lớnObjective speech-task có thể bỏ forensic details
General-audio SSLAudioMAE, Audio-JEPAAudio đa loạiDomain/resolution khác tiếng nói
Supervised foundation featuresWhisper và các model khácHọc từ labeled/weakly supervised corpus lớnWhisper không phải ví dụ thuần SSL theo cùng nghĩa với HuBERT
Forensics-oriented pretrained encoderCác recipe nhắm deepfake cuesTask alignmentData/compute/supervision khác, khó so trực tiếp
Multi-viewWaveform + magnitude + phase/prosodyComplementarityThêm params/data có thể giải thích lợi ích

LFCC-GMM mô hình hai lớp bằng density mixture. Với frame features vtv_t, một score có thể là:

s(x)=1T∑t[log⁡pB(vt)−log⁡pS(vt)].s(x)=\frac{1}{T}\sum_t[\log p_B(v_t)-\log p_S(v_t)].

Giả định độc lập giữa frame là một xấp xỉ. Baseline này giúp kiểm “model lớn hơn có thực sự giữ cue tốt hơn không”, nhưng phải cài đúng feature, số mixture và protocol.

AASIST dùng attention giữa thông tin phổ và thời gian trong một graph design cụ thể. Không phải bất kỳ graph head gắn lên bất kỳ embedding nào cũng tương đương AASIST. Nguồn: AASIST.

3. Taxonomy downstream adaptation#

Chế độTham số thay đổiCâu hỏi nó giúp trả lời
Frozen + linear probeAffine classifier trên readout cố địnhLabel information có truy cập tuyến tính được từ readout ấy không?
Frozen + nonlinear headPooling/MLP/backendRepresentation dùng được với head mạnh hơn thế nào?
Partial fine-tuneMột số blocks, norms, patch embedLayer nào cần thích nghi?
Full fine-tuneToàn encoder + headCó thể tối ưu hệ cho training distribution tới đâu?
AdaptersModule nhỏ thêm vàoThích nghi bằng pathway mới với budget nhỏ
LoRALow-rank weight updatesHạn chế không gian update, giảm số params học
DistillationStudent học teacher outputs/featuresGiảm model/compute; chất lượng phụ thuộc teacher
Continued SSLEncoder/predictor được học lại bằng SSLTarget/domain pretraining thay đổi có tác động gì?
Test-time adaptationCập nhật từ dữ liệu test theo protocolCó truy cập target; khác frozen deployment

Không nên xếp các chế độ thành thang “frozen < LoRA < full”. Full fine-tune có thể làm mất representation hữu ích; frozen có thể giữ domain mismatch. Kết quả phụ thuộc loss, LR, data diversity và target task.

PEFT giảm params học, nhưng encoder vẫn chạy. Cache frozen features giúp nhiều head trials rẻ hơn, song nếu augmentation tác động waveform online thì cache một feature/mẫu sẽ không tương đương recipe online đó.

4. Taxonomy layer aggregation và pooling#

Encoder cho Hl∈RN×DH_l\in\mathbb R^{N\times D} ở nhiều layer. Có thể dùng last layer, concatenate, learned weighted sum hoặc layerwise backend. Các layer có thể mang cue khác nhau; last layer không tự là tốt nhất.

Trong paper:

αl=softmax⁡(a)l,H=∑lαlHl.\alpha_l=\operatorname{softmax}(a)_l,\qquad H=\sum_l\alpha_l H_l.

Softmax weights là tham số phối hợp các representation, không trực tiếp là lượng thông tin nhân quả mỗi layer đóng góp. Các layer tương quan nên weight thay đổi không nhất thiết đồng nghĩa feature importance thay đổi.

PoolingCông thức/ý tưởngPhù hợp và giới hạn
MeanTrung bình token/frameRẻ; rare artifact bị pha loãng
MaxCực đại theo featureNhạy cue ngắn; nhạy outlier/noise
StatisticsConcat mean + stdGiữ mức và dispersion, mất thứ tự
Attentive mean/statisticsHọc weights trên tokenTập trung cue; attention có thể học shortcut
Multi-head poolingNhiều summary khác nhauCó thể đa cue nhưng không bảo đảm head diversity
Temporal sequence headTDNN/RNN/Transformer/state-spaceGiữ dynamics nhưng thêm model assumptions
Graph headNode/edge quan hệ tần số–thời gianPhải bảo toàn ý nghĩa topology của input
Multiple-instance learningClip fake nếu có segment fakeHợp partial-fake nhưng cần label/sampling phù hợp

Attentive statistics:

μ=∑iaihi,σ=max⁡(ϵ,∑iaihi2−μ2).\mu=\sum_i a_i h_i,\quad \sigma=\sqrt{\max(\epsilon,\sum_i a_i h_i^2-\mu^2)}.

Trong cơ chế có mask, attention weights aia_i chuẩn hóa trên valid positions. Template ASP của paper được đọc ở lớp 4 chuẩn hóa toàn fixed token grid, không có mask argument; chưa xác minh padding policy của một run. Padding, tiled silence hoặc fixed prefix có thể ảnh hưởng score nếu không được xử lý nhất quán. Nguồn pooling: Attentive Statistics Pooling; ví dụ mask/variance và giới hạn source.

Với 2D spectrogram patches, flatten rồi pool gộp cả hai trục. Nếu backend cần chuỗi thời gian, phải quyết định cách gộp/giữ frequency positions. 128 token trong paper tương ứng 32 temporal positions, không phải 128 time frames.

5. Taxonomy learning objectives của detector#

Nhóm lossMục tiêuĐiều cần kiểm
CE/BCE, weighted variantsBinary decision boundaryClass weights, priors, calibration
Focal lossTập trung ví dụ khóHard samples có thể là mislabeled/domain outliers
Margin/angular lossesCấu trúc separation embeddingKhông suy ra unseen generators cũng separated
Supervised contrastive/metricQuan hệ embedding theo labelFake gồm nhiều family; ép tất cả gần nhau có thể hại
Multi-taskDetection + speaker/source/segmentTask phụ hỗ trợ hay đưa thêm shortcut?
Domain adversarialLàm domain khó dự đoán từ featuresCó thể xóa cue liên quan cả domain và spoof
Group DROGiảm lỗi nhóm tệ nhấtCần group labels và group definition hợp lý
ConsistencyScores/features ổn định giữa viewsViews phải giữ thông tin/label mong muốn
DistillationMatch teacher scores/featuresTeacher error được truyền sang student
One-class density/distance/errorModeling genuine/anomalyUnusual genuine và natural fake gây lỗi

Class-balanced sampling và class-weighted loss khác nhau. Sampling đổi examples xuất hiện và batch statistics; weighting đổi gradient contribution. Dùng cả hai có thể tăng trọng số lớp quá mức nếu không tính mục tiêu tổng thể.

6. Taxonomy augmentation#

Augmentation không chỉ để tăng số mẫu. Nó dạy model những khác biệt nào nên bỏ qua và những điều kiện nào cần tiếp tục phân biệt.

NhómVí dụMục đíchRủi ro
Channel/filterBandpass, impulse response, reverbĐa dạng thiết bị/phòngXóa artifact; augmentation bất cân giữa lớp tạo shortcut
NoiseStationary, background, impulsiveChống nuisanceSNR cực thấp có thể xóa evidence
CodecMP3, AAC, Opus, telephonyTraining gần transmission thựcCodec có thể là label-relevant trong task khác
TemporalCrop, shift, speed perturbationChống phụ thuộc prefix/timingCrop có thể bỏ toàn vùng fake trong partial task
Spectral masksTime/frequency masksRegularize representationChe đúng artifact discriminative
Mixup/CutMixTrộn input và labelLàm mượt classifierSemantics label và boundary của forensics không hiển nhiên
Synthesis/vocoder augmentationSinh/resynthesize thêmTăng attack coverageCue synthetic pipeline quá dễ; family overlap với test
Feature-spaceDropout/noise/masking embeddingsRegularize backendKhông mô phỏng được mọi waveform-level shift

RawBoost kết hợp các loại nhiễu/biến dạng trên waveform để mô hình hóa nuisance. Nó khác SpecAugment che vùng feature. “RawBoost là chuẩn phổ biến” không có nghĩa nó đã giúp Audio-JEPA của mình; phần này chưa được kiểm trong lịch sử đã đọc.

Bốn câu hỏi trước khi tin augmentation#

  1. Biến đổi có giữ nhãn theo định nghĩa task không?
  2. Có áp dụng cân bằng giữa genuine và spoof không?
  3. Train transformations có overlap với evaluation generator/channel không?
  4. Improvement do diversity hay do tăng steps/compute?

Nếu xóa artifact làm hai lớp không thể phân biệt từ audio còn lại, accuracy tối đa cũng bị giới hạn. Không thể yêu cầu model vừa bất biến hoàn toàn với một biến đổi vừa dùng đúng cue mà biến đổi đó xóa.

7. Taxonomy data-centric techniques#

Kỹ thuậtCái thay đổiCần tránh
Multi-source genuineĐa dạng p(x∣B)p(x\mid B)Chỉ genuine đa nguồn, fake một nguồn làm source tương quan label
Multi-generator spoofCoverage của p(x∣S)p(x\mid S)Nhiều checkpoints cùng family không bằng nhiều cơ chế
Source/attack-balanced samplingWeight từng domain/familyĐánh đồng nhóm nhỏ ít tin cậy và nhóm lớn sạch
Quality filteringChọn duration, SNR, loudness, silenceBỏ genuine khó khiến triển khai dễ false reject
DeduplicationGiảm overlapChỉ hash file bỏ sót cùng audio encode khác
Curriculum/hard miningThứ tự và samplingChọn “hard” bằng test feedback
Scaling analysisSamples/data/compute tăngTăng giờ data và tăng optimization cùng lúc

Kỹ thuật “thêm data” cần taxonomy đủ cụ thể: thêm unique speakers, sources, languages, generators hay chỉ thêm utterances cùng loại? Nghiên cứu data-centric tại ACL 2026 là nguồn đọc cho câu hỏi diversity và sampling; nó không chứng minh cách trộn nào sẽ giúp checkpoint của mình.

8. Taxonomy inference và scoring#

Cách chấmÝ nghĩaKhác biệt protocol
Fixed cropMột đoạn cố định của clipEvidence ngoài crop bị bỏ
Sliding windowsScores nhiều cửa sổTăng compute; cách aggregation quyết định nhạy partial fake
Mean/max/top-k score poolingGộp score các đoạnĐo những giả định khác về fake coverage
Score fusionHợp nhất detector/view/seedCần fit weights/calibration trên dev
Embedding fusionGộp features trước headHead/params đổi; phải baseline cùng capacity
Prediction/reconstruction errorĐo mismatch với modelKhông tự là detection score đúng hướng
StreamingChấm khi audio đếnCausal context, latency, look-ahead phải công bố

Hai logits zB,zSz_B,z_S cho:

P(B∣x)=σ(zB−zS).P(B\mid x)=\sigma(z_B-z_S).

Logit difference bảo toàn thứ tự posterior của cùng model; một logit riêng không bảo đảm. Strictly increasing score transform giữ ranking/EER về nguyên tắc; scaling/clipping làm ties hoặc finite-precision saturation có thể đổi kết quả thực.

Calibration fit trên dev có thể giúp threshold deployment nhưng không tạo khả năng phân biệt mới nếu phép biến đổi chỉ tăng đơn điệu. Fusion nhiều scores có thể đổi ranking và cần kiểm riêng.

9. Taxonomy phân tích representation#

Phương phápCâu hỏiĐủ để kết luận chưa?
Label/domain/speaker probesThông tin nào truy cập được?Domain decodability chưa chứng minh detector dùng domain
Layerwise probesThông tin thay đổi qua depth thế nào?Cần head/compute/splits tương ứng
Controlled perturbationCue nào ảnh hưởng score?Perturbation phải tránh đổi nhiều yếu tố đồng thời
Feature ablationBỏ cue có mất performance?Retraining vs inference ablation đo khác nhau
CKA/spectrum/rankGeometry thay đổi thế nào?Chưa nói cue có ích hay nuisance
Attention/gradient saliencyVùng nào liên quan calculation?Cần perturbation evidence; heatmap không đủ causal
Counterfactual/paired resynthesisCùng source/content, process khácPair alignment và channel matching cần audit

Khi học một kỹ thuật mới, viết một câu: “Nó thay đổi ___, để giảm/tăng ___, dựa trên giả định ___; phép đo ___ sẽ kiểm tra giả định đó.” Nếu chưa viết được, hãy quay về cơ chế trước khi nghĩ tới ghép module.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.