ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
11 phút đọc · Toàn văn
Mục lục bài · 8 mục

06 — Đọc lại paper và đặt lịch sử nghiên cứu vào taxonomy#

Chương này là bản đồ. Học cơ chế qua mười bài lớp 6, đặc biệt waveform tới score, kết quả/uncertainty, lịch sử có version và claim–evidence. Sổ nguồn/root review tách reported result, code và unknown provenance.

1. Nguồn nào có thẩm quyền cho việc gì?#

Bản đã nộp: SOICT_2026_paper_4308.pdf, 14 trang, tiêu đề Audio-JEPA Representations for Speech Deepfake Detection. Đây là nguồn cho cấu hình và số liệu được báo cáo ở các mục 2–4 dưới đây.

Lịch sử nghiên cứu: các handoff và ghi chép preflight trong workspace dùng để hiểu nhánh đã thử, giả thuyết và việc chưa hoàn tất. Chúng chứa một số số liệu/kết luận cũ khác paper. Tài liệu ôn tập không coi chúng là kết quả mới tái lập.

Literature: nguồn primary được đối chiếu ngày 11/10/2026. Ngày nhận kết quả 12/10 là mốc do bạn cung cấp; việc học và đánh giá khoa học của đề tài độc lập với quyết định acceptance.

2. Đặt paper vào taxonomy#

TrụcPaper của mình
TaskAudio-only, utterance-level genuine/spoof detection
Downstream supervisionLabels thật/giả, weighted cross-entropy
Front-endContext encoder từ released Audio-JEPA checkpoint
Pretraining objectiveContinuous masked latent prediction, đã chạy bởi tác giả checkpoint
Pretraining corpusAudioSet-2M, paper ghi 5.338 giờ general audio
Kiến trúcViT-Base, 12 blocks, 768 width, 12 heads; 85,4 M encoder params
InputFixed 2,56 s crop, log-mel 256×128
Token geometry8 time frames × 32 mel bins → 32×4 grid, 128 tokens
Back-endWeighted layers + attentive statistics + MLP
AdaptationFrozen và full fine-tuning
Scorezbonafide−zspoofz_{bonafide}-z_{spoof}
ProtocolSpeech DF Arena toolkit; năm corpora
MetricEER %, mean ± sample SD khi có ba seeds
Main comparisonHai released checkpoints dưới common downstream recipe

Đây là JEPA representations used for a supervised detector. Paper không huấn luyện một JEPA pretraining objective mới và không dùng predictor error làm detection score.

3. Truy vết waveform tới score#

BướcShape / settingKiến thức cần nối
Toolkit input16 kHz, tile/truncate tới 64.600 samples (~4s)Sample rate, fixed-length protocol
Model preprocessingResample 32 kHz, lấy đầu 2,56 s; tile nếu cầnUpsampling không thêm bandwidth; crop bỏ evidence ngoài đoạn
Log-mel128 bands, 25ms window, 10ms hop, 20–8.000Hz; waveform mean subtractionResolution và invariance
Frame handlingPad/truncate tới 256 framesPadding behavior phải nhất quán
Patch projection8×32 patch, 128×768 token sequenceTime-frequency geometry
Checkpoint adaptationBicubic interpolate 16×16 patch weights thành 8×32; regenerate position embeddingShape equal chưa nghĩa semantics equal
Encoder readouts12 block outputs + final LN = 13 sequencesLayer information
Layer aggregationSoftmax-weighted sumLearned representation selection
Attentive statsWeighted mean + std = 1.536 dimsPooling mất thứ tự, giữ dispersion
ClassifierLN → 1.536→256 → GELU → Dropout0,2 → 256→2Nonlinear frozen-mode head
ScoreLogit differenceRanking và calibration khác nhau

Head có 495.632 parameters: 13 layer weights, 98.561 pooling và 397.058 classifier. Frozen mode học khoảng 0,5 M, nhưng toàn hệ vẫn khoảng 85,9 M parameters ở inference.

Training setup#

ASVspoof2019 LA train có 25.380 utterances: 2.580 genuine và 22.800 spoof. Giữ A05 và 600 genuine để theo dõi, còn 20.980 train samples. A05 không quyết định checkpoint main runs. Đây là attack holdout, không bảo đảm speaker/family disjoint.

Sáu epochs; batch 32; AdamW; weight decay 0,05; OneCycle 10% warm-up; AMP; encoder peak LR 3×10−53\times10^{-5}, head 10−310^{-3}. CE upweight genuine khoảng 9,6 theo training subset. Augmentation duy nhất là mask kiểu SpecAugment: một time band tới16 frames và một frequency band tới16 bins.

Seeds: 1234, 2, 3, trừ ô được đánh dấu n=1. Dùng final six-epoch checkpoint; exploratory variants trước đó đã ảnh hưởng configuration choices.

4. Bảng số liệu cần nhớ và cách đọc#

Table 2 của bản PDF#

CorpusGenuine sourceJEPA frozenJEPA fine-tunedAASIST re-run
DFADDVCTK8,47 ± 0,3510,75 ± 3,4841,87
ASVspoof2019 LA evalVCTK17,70 ± 1,447,39 ± 0,690,83
ADD2022 Track1MandarinChưa chạy44,10 ± 2,0447,92
LibriSeVocLibriTTS47,38 ± 4,1941,96 ± 2,9337,95
In-the-WildWeb sources47,55 ± 8,5552,00 (n=1)43,02

Không suy ra frozen tốt hơn fine-tune ngoài miền nói chung. DFADD ủng hộ frozen; LibriSeVoc mean ủng hộ fine-tune; In-the-Wild fine-tune chưa đủ seeds cho comparison ổn định.

Table 4: released checkpoint comparison#

Corpus/regimeJEPAAudioMAEGap MAE−JEPA theo PDF
ASV2019 fine-tune7,39 ± 0,6913,25 ± 0,57+5,87
ASV2019 frozen17,70 ± 1,4425,25 ± 0,68+7,55
DFADD frozen8,47 ± 0,3511,04 ± 0,75+2,57
ADD22-T1 fine-tune44,10 ± 2,0442,02 ± 2,85−2,08

Gap chép theo bảng báo cáo; trừ hai mean đã làm tròn có thể khác0,01. Ba ô JEPA tốt hơn có seed ranges không chồng; đó là descriptive evidence, không phải significance test.

Những kết luận đứng được#

  • Audio-JEPA là một front-end dùng được cho detection, đặc biệt DFADD trong recipe này.
  • Released Audio-JEPA checkpoint tốt hơn released AudioMAE checkpoint ở ba trong bốn comparisons đã chạy.
  • Frozen representation và fine-tuning tương tác khác nhau với corpus.
  • Generalization của hệ hiện tại yếu trên nhiều corpus khác source; đây là giới hạn rõ của setup.

Những kết luận chưa đứng được#

  • JEPA objective nhân quả tốt hơn reconstruction objective nói chung.
  • JEPA luôn giữ synthesis artifacts tốt hơn MAE.
  • Shared genuine source là nguyên nhân duy nhất của performance pattern.
  • Giảm trainable params thành0,5 M làm detector inference chỉ lớn0,5 M.
  • Hệ tổng quát hóa tốt chỉ vì đứng gần XLSR+SLS trên DFADD.

Published DFADD comparison có systems khác kiến trúc, pretraining, recipe và training subsets; Whisper-MesoNet khác downstream training data. Thứ hạng trong bảng có ý nghĩa trong điều kiện được nêu, không phải thứ hạng toàn lĩnh vực.

5. Những biến nào đã giữ giống, những biến nào còn khác?#

VariableJEPA vs MAE trong paper
Encoder family/scaleViT-Base cùng họ/scale
Pretraining data sourceCùng AudioSet-2M source
Downstream input/head/data/recipe/seedsDùng chung
Pretraining objectiveKhác
Pretraining masking/optimizer/sampling/budgetCòn khác
Native pretraining inputKhác frame count, sample rate và temporal patch span
Downstream displacement khỏi native configKhông đối xứng

AudioMAE nhận256 thay1024 frames; token count quartered so với native. Audio-JEPA giữ full token count nhưng temporal patch span danh nghĩa đổi625→80ms; AudioMAE160→80ms. Giữ input chung kiểm soát downstream input nhưng không tạo native setting chung cho cả hai.

Đây là bài học về estimand: comparison đang đo transfer performance của hai model dưới cùng deployment/training recipe, không riêng causal effect của objective.

6. Lịch sử kỹ thuật: dùng để học, không đóng dấu “vĩnh viễn thất bại”#

Nguồn các hàng: handoff nhánh ngoài miền, handoff nhánh tiền huấn luyện, ghi chép preflight và lịch sử tuyên bố đã rút.

NhánhGhi chép đã cóBài học taxonomy
JEPA + AASIST backendKhông cải thiện trong thử nghiệm đã ghiEncoder geometry và graph topology phải tương thích; nguyên nhân thất bại chưa được causal isolation
Match native mel configA05 tốt hơn, eval xấu hơnTask/input adaptation và validation representativeness khác nhau
Frozen encoderDFADD tốt, corpus khác không cùng patternAdaptation×corpus interaction
Ít epochsKhông giải quyết generalization trong các config đã thửLoss saturation/overtraining chưa phải nguyên nhân duy nhất
Fusion ba seedKhông hơn seed tốt nhất ở comparison ghi lạiEnsemble diversity và calibration phải đo
A05 dùng chọn hyperparametersNhiều lần chọn sai hướngMột attack holdout không đại diện toàn shift
Learning-rate sweepsOptimum phụ thuộc corpus trong exploratory runsTest-driven tuning tạo development contamination
Temporal patch sweep v40Handoff ghi patch (4,32) so với (8,32): DFADD 9,72 ± 1,07 so với 10,75 ± 3,48; LibriSeVoc 50,01 ± 0,61 so với 41,96 ± 2,93Trục này đã thử. Kết quả không bác bỏ mọi giả thuyết về fine-grained artifacts; ở lượt này chưa tái kiểm raw results
Speech continued-pretraining v41Preflight kỹ thuật và các số đo representationReadiness/preflight khác completed pretraining study

Một config thất bại không chứng minh cả họ kỹ thuật vô ích. Các chẩn đoán cũ như “chắc chắn do source” hoặc “không phải overfitting” mạnh hơn mức evidence cho phép; nên đọc chúng như working hypotheses lịch sử.

Một kết quả phụ đáng học: random frozen encoder#

Handoff ghi DFADD frozen: JEPA8,47±0,35; MAE11,04±0,75; random8,66±2,25. ASV2019 frozen: JEPA17,70±1,44; random14,25±1,48. Random fine-tune được ghi13,68 với n=1.

Các số này không nằm trong Table 4 của paper đã nộp và chưa tái lập ở lượt ôn tập. Chúng đặt câu hỏi quan trọng về inductive bias, random features, head capacity và source cues. Chúng chưa chứng minh pretraining “không có ích” hoặc JEPA đã collapse.

Một kết quả preflight về hình học representation#

Ghi chép v41/G4b báo các hàng speech batch B=64 dưới đây; đây là số trong handoff, chưa đo lại:

Input path được notes gọiCross-utterance token cosineCentered token effective rankNormalized utterance std
Native-style config0,6793263,10,0061
Detection config0,7192247,90,0060

Đọc collapse_metrics(H) cho thấy H[B,N,D] được reshape thành BN token rows rồi center; với B=64,N=128,D=768, bound là min(8192−1,768)=768, không phải 63. Effective rank dùng entropy của singular values σ, không σ². std_utt dùng mean raw tokens rồi L2-normalize từng utterance; đó là readout khác. Giải và phản ví dụ ở bài 8.

Code G4b mở stream riêng, lọc clips ≥10 s; G4 lọc ≥2,56 s, nên chưa đảm bảo cùng paired clip IDs. Native-style path cast audio 16 kHz rồi resample 32 kHz; fmax16k không tạo content trên8k. Đây chưa là isolation của input config. Có dấu anisotropy trong các speech batches được notes báo, nhưng speech khác AudioSet distribution; số này chưa chứng minh global checkpoint collapse hoặc anisotropy gây EER kém. Reference isotropic random vector không phải chuẩn khỏe phổ quát. Code/nguồn và unknowns.

Ghi chép cũng có random masks để khoảng90% target patches còn hàng xóm visible, và block masks giảm mạnh adjacency. Đây là đo task geometry; chưa chứng minh model thực sự chỉ dùng local interpolation.

7. Những khoảng mở trong taxonomy của chính dự án#

Các hàng dưới là trục học và câu hỏi chưa được kiểm hệ thống trong các nguồn đã đọc, không phải chọn đề tài hoặc khẳng định tuyệt đối chưa ai làm.

TrụcCâu hỏi để hiểu sâu
Context vs target encoderEMA branch có feature downstream khác context bao nhiêu?
Predictor useError giữ forensic evidence hay chỉ đo speech/channel difficulty?
MaskingTask difficulty và artifact retention liên hệ thế nào?
Pretraining domainSpeech/general audio khác ở domain, scale, quality hay exposure?
Source diversityDetector có dùng source cues và có giảm reliance được không?
Augmentation/CMVNInvariance nào có ích và invariance nào xóa evidence?
Parameter-efficient adaptationUpdate hạn chế giữ cue nào so full fine-tune?
Multi-view/phase/temporal cuesCue nào complementary với mel-ViT?
Localization/streamingPooling whole clip và fixed crop có giới hạn gì?
Calibration/open-worldThreshold và rejection policy transfer thế nào?
Causal objective comparisonCó thể tách objective khỏi masking/compute/input displacement ra sao?

8. Thử trình bày paper của mình trong 90 giây#

“Chúng tôi dùng encoder từ Audio-JEPA làm front-end cho supervised speech deepfake detection. Model xử lý log-mel patches, kết hợp nhiều layer rồi pooling và classification. Chúng tôi so hai released checkpoints JEPA/AudioMAE bằng cùng downstream recipe, ở frozen và fine-tuned regimes. JEPA tốt hơn ở ba trong bốn comparisons, nhưng chưa tách hết differences tiền huấn luyện nên chưa chứng minh objective effect. Hệ đạt kết quả tốt trên DFADD nhưng yếu ở nhiều corpus khác genuine source; đó là association cần được nghiên cứu tiếp.”

Nếu có thể tự giải thích từng giới hạn trong đoạn này, bạn đã nối được nền tảng với bài hiện tại và có cơ sở đọc các bài mới một cách chủ động.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.