ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
15 phút đọc · Toàn văn
Mục lục bài · 12 mục

03 — Học biểu diễn, self-supervised learning và JEPA#

Bản đồ lớp 3, cập nhật 11/10/2026. Phần dưới định vị các khái niệm; cơ chế tính tay, bài tập và kiểm chứng nguồn nằm trong bộ mười bài học sâu. Mức đọc nguồn của lớp được cập nhật ở sổ nguồn, thay cho trạng thái abstract-only cũ khi dùng các biến thể trong chương này.

Muốn hiểu sâuĐiểm đọc
Information, accessibility, sufficiency và invarianceBài 1
Target types, loss reduction và gradientBài 2
CPC, wav2vec2, HuBERT, WavLM, BEST-RQBài 3
AudioMAE và data2vecBài 4
BYOL, SimSiam, VICReg và Barlow TwinsBài 5
Một Audio-JEPA training step từ tensor đến EMABài 6
Geometry và uncertainty của maskingBài 7
Collapse, rank, variance và populationBài 8
Encoder downstream, latent error, energy/probabilityBài 9
Các biến thể mới và mức bằng chứngBài 10

1. Representation là gì, và “tốt” nghĩa là gì?#

Encoder fθf_\theta biến input xx thành h=fθ(x)h=f_\theta(x). Một representation tốt phải giữ thông tin giúp task và cho phép một downstream model truy cập thông tin đó với dữ liệu/compute phù hợp.

Ba câu hỏi riêng:

  1. Information: embedding có chứa cue không?
  2. Accessibility: classifier đơn giản có lấy cue đó ra được không?
  3. Stability: cue có tiếp tục hữu ích dưới domain shift không?

ASR muốn phân biệt từ và âm vị; speaker verification muốn identity; deepfake detection muốn quá trình tạo/biến đổi. Cùng một phép invariance có thể giúp task này và hại task kia.

Ví dụ: làm embedding bất biến với biến đổi phổ nhẹ có thể giúp nhận diện cùng câu qua micro khác. Nhưng nếu dấu synthesis là sai khác phổ nhẹ, ta có thể đang dạy encoder xóa bằng chứng cần dùng.

Invariance là đầu ra gần giữ nguyên dưới một biến đổi; equivariance là đầu ra biến đổi có cấu trúc tương ứng. Detection không nhất thiết cần bất biến với tất cả nuisance ở mọi layer; model có thể dùng thông tin channel để điều chỉnh cách đọc artifact.

2. Taxonomy SSL theo các trục độc lập#

SSL tạo supervision từ chính dữ liệu hoặc một quy trình tự động. “Không có human label” không có nghĩa không có inductive bias, target hay nguy cơ leakage.

TrụcCác lựa chọn
Target chứa gì?Signal values / discrete IDs / soft distributions / continuous features / relations
Target từ đâu?Input / quantizer / offline clustering / fixed teacher / EMA teacher / current encoder
Context thấy gì?Toàn input có mask / chỉ visible tokens / view augmentation / modality khác / quá khứ
Quan hệ học gì?Reconstruct / discriminate / match views / predict masked region / predict future
Loss gì?MSE / Huber / cosine / cross-entropy / KL / contrastive / distribution regularization
Điều gì chặn nghiệm hằng?Negatives / fixed informative targets / asymmetry / teacher dynamics / variance-distribution constraints
Dữ liệu và budget?Speech/general audio, giờ unique, samples seen, steps, model scale

“Contrastive” là cấu trúc loss/quan hệ mẫu; “discrete target” là kiểu target. Một model có thể thuộc cả hai. “Non-contrastive” cũng không đồng nghĩa “JEPA”.

3. Các họ quan trọng và quan hệ của chúng#

Họ / ví dụTarget và cách họcĐiểm phân biệt
Autoencoder / MAE / AudioMAEGiá trị input ở vùng bị cheLoss trong input space; decoder phục hồi signal representation
CPC / wav2vec2Chọn positive target giữa negatives; wav2vec2 dùng quantizationContrastive discrimination, thường kèm diversity term
HuBERTCluster ID ở vị trí bị cheHard pseudo-labels từ clustering; không cần contrastive negatives cho loss chính
WavLMMasked-unit prediction với denoising/mixingObjective và training recipe nhắm nhiều speech tasks
BYOLMatch representation giữa views, predictor và EMA targetSelf-distillation/invariance; không chỉ là masked region prediction
data2vecPredict contextualized continuous teacher features từ masked inputLatent prediction đã tồn tại trong speech trước Audio-JEPA
I-JEPA / Audio-JEPAPredict representations của target regions từ contextEncoder–predictor decomposition và thiết kế context/target
BEST-RQFixed random projection/codebook tạo hard IDs; masked CEQuantizer không học và không phải offline speech clustering
BEST-RQ-2Fixed random patch IDs; visible-only ViT → predictor → categorical headEncoder–predictor decomposition không bắt buộc continuous target hoặc EMA
HybridKết hợp nhiều target/lossCần ablation từng thành phần, không chỉ đặt tên hybrid

Nguồn cốt lõi: wav2vec2, HuBERT, WavLM, data2vec, BYOL, AudioMAE. Lượt lớp 3 đọc method primary trên web/PDF và ghi version/sections ở sổ nguồn; không suy rằng mọi paper đều có bản PDF local.

4. Bốn loss cần hiểu#

Reconstruction loss#

Lrec=1∣M∣∑i∈M∥D(f(xC),i)−xi∥2.\mathcal L_{rec}=\frac{1}{|M|}\sum_{i\in M}\|D(f(x_C),i)-x_i\|^2.

xix_i là giá trị patch input. Cần tách target normalization, masked/unmasked positions và khả năng decoder. Reconstruction tốt chưa bảo đảm detection tốt; reconstruction kém cũng chưa chứng minh representation vô ích.

Contrastive loss#

Một dạng InfoNCE:

LNCE=−log⁡exp⁡(s(q,k+)/τ)exp⁡(s(q,k+)/τ)+∑k−exp⁡(s(q,k−)/τ).\mathcal L_{NCE}=-\log\frac{\exp(s(q,k^+)/\tau)}{\exp(s(q,k^+)/\tau)+\sum_{k^-}\exp(s(q,k^-)/\tau)}.

k+k^+ là positive, k−k^- là negative; τ\tau là temperature. Cách tạo positive/negative quyết định invariance. Nếu negative khác channel còn positive cùng channel, một nghiệm dễ là nhận ra channel.

Hard-unit và soft-target prediction#

Hard target: L=−log⁡pθ(ci∣xC)\mathcal L=-\log p_\theta(c_i\mid x_C). Soft target distribution qiq_i: có thể dùng DKL(qi∥pθ)D_{KL}(q_i\|p_\theta). Soft assignment giữ uncertainty giữa cluster, nhưng cluster vẫn có thể mã hóa nuisance.

Latent regression#

Llatent=1∣M∣∑i∈Md(h^i,sg⁡(hitarget)).\mathcal L_{latent}=\frac{1}{|M|}\sum_{i\in M}d(\hat h_i,\operatorname{sg}(h_i^{target})).

dd có thể là squared distance, normalized MSE hoặc cosine-related loss. Công thức “MSE” trên paper không đủ để biết target centering, scale, dimensions hay gradients trong implementation.

5. Giải phẫu JEPA từng bước#

JEPA là một họ kiến trúc dự đoán trong embedding space. Dưới đây là teacher–student EMA formulation của I-JEPA/Audio-JEPA, không phải định nghĩa bắt buộc cho mọi biến thể mang tên JEPA.

  1. Chuyển input thành patch tokens, chọn context CC và target positions MM.
  2. Context encoder thấy context, tạo hC=fθ(xC)h_C=f_\theta(x_C).
  3. Predictor nhận hCh_C và thông tin vị trí cần dự đoán, tạo h^M=gϕ(hC,M)\hat h_M=g_\phi(h_C,M).
  4. Target encoder thấy full input, tạo htarget=fθˉ(x)h^{target}=f_{\bar\theta}(x); chỉ lấy output ở MM để tính loss.
  5. Backprop cập nhật θ,ϕ\theta,\phi; stop-gradient chặn gradient qua target branch.
  6. Cập nhật target weights bằng EMA:
θˉt+1=τtθˉt+(1−τt)θt+1.\bar\theta_{t+1}=\tau_t\bar\theta_t+(1-\tau_t)\theta_{t+1}.
flowchart LR
    X[Spectrogram] --> C[Chọn visible patches]
    C --> E[Context encoder]
    E --> P[Predictor + target positions]
    X --> T[Target encoder: full input]
    T --> S[Chọn target embeddings + stop-gradient]
    P --> L[Latent loss]
    S --> L
    L -. gradient .-> P
    L -. gradient .-> E
    E -. EMA weights .-> T
Xem mã sơ đồ
flowchart LR
    X[Spectrogram] --> C[Chọn visible patches]
    C --> E[Context encoder]
    E --> P[Predictor + target positions]
    X --> T[Target encoder: full input]
    T --> S[Chọn target embeddings + stop-gradient]
    P --> L[Latent loss]
    S --> L
    L -. gradient .-> P
    L -. gradient .-> E
    E -. EMA weights .-> T

Nguồn formulation và masking: I-JEPA và Audio-JEPA.

Formulation khác implementation. Paper I-JEPA viết squared L2 nhưng pinned official train code dùng target LayerNorm + Smooth-L1. Audio-JEPA v2 viết squared vector L2, còn pinned release chọn target standardization + normalized MSE/cosine-related loss. Latest LR/WD scheduler values cũng khác paper; config/card mới hơn checkpoint file không chứng minh recipe training checkpoint. Bài 6 và crosswalk ghi function/config/commit và giới hạn provenance. Audio-JEPA callback cập nhật EMA ở batch end, nên không đồng nhất batch với optimizer step khi chưa biết accumulation/trainer limits.

Stop-gradient, EMA và predictor làm những việc khác nhau#

Thành phầnVai tròKhông tự bảo đảm
Stop-gradientTarget không chạy theo gradient trực tiếp của lossTarget luôn chứa thông tin
EMATarget thay đổi chậm, làm reference ổn định hơnKhông có collapse với mọi data/loss/config
PredictorTách representation của context khỏi nhiệm vụ dự đoánPredictor lớn hơn luôn tạo encoder tốt hơn
MaskingXác định thông tin bị thiếu và context được phép dùngKhông có local shortcut

Teacher thấy full input là một phần thiết kế target, không phải label leakage theo nghĩa sử dụng test labels. Nhưng target contextualized có thể chứa thông tin từ cả input; phải đọc đúng định nghĩa khi giải thích model đang predict cái gì.

EMA τ\tau gần 1 làm target chậm hơn. Với τ\tau cố định, đóng góp cũ giảm theo τk\tau^k, half-life là log⁡(0.5)/log⁡(τ)\log(0.5)/\log(\tau) steps. Đây là thang động lực học, không phải “memory length” tuyệt đối vì lịch EMA và encoder thay đổi liên tục.

6. Masking là thiết kế task, không chỉ phần trăm#

Trục maskingLựa chọnĐiều nó thay đổi
GeometryRandom patches / contiguous blocks / time bands / frequency bandsContext dễ nội suy hay cần hiểu quan hệ xa
ScaleMột frame / phoneme-like / đoạn dàiMức thông tin cần dự đoán
CoverageTỉ lệ visible/target, số target blocksĐộ khó và lượng supervision
SeparationKhoảng cách context–target, neighborhood removedKhả năng dùng hàng xóm làm shortcut
ScheduleFixed / curriculum / adaptiveTask thay đổi khi representation trưởng thành
Axis semanticsTime-aware / frequency-awareBias phù hợp hoặc không với audio
Train locationInput / token / intermediate-layer masksModel thấy bao nhiêu signal trực tiếp

SpecAugment của downstream và masking pretraining có thể giống hình thức che, nhưng mục đích khác: một bên regularize classifier; một bên định nghĩa target prediction task. Patch removal khỏi encoder cũng không giống điền zero vào spectrogram.

Mask khó hơn không tự tốt hơn. Nếu context không còn đủ thông tin, task chủ yếu đo bất định không thể giảm. Nếu task quá dễ, encoder có thể chỉ học local interpolation. Cần đo task difficulty cùng downstream utility.

7. Collapse, anisotropy và task mismatch#

Hiện tượngMô tảQuan sát nên dùng
Complete collapseMọi input gần cho cùng embeddingVariance gần 0, cosine gần 1, probes kém
Dimensional collapseBiến thiên chỉ nằm trong ít chiềuSpectrum/rank, variance từng chiều
AnisotropyNhiều vector tập trung quanh hướng chungCross-sample cosine, mean direction, spectrum
Token/position shortcutToken phân biệt vị trí nhưng không phân biệt utteranceToken variance cao, utterance variance thấp
Task mismatchCó thông tin cho task A, yếu cho task BNhiều probes và matched downstream evaluation

Anisotropy xuất hiện trong nhiều representation hữu ích. So với vector ngẫu nhiên isotropic chỉ là một reference hình học, không phải tiêu chuẩn “khỏe” của mọi model.

Một counterexample cho loss: nếu context encoder và target encoder luôn tạo cùng vector vv, predictor luôn trả vv, latent matching loss có thể rất thấp. Không có thông tin về utterance mà vẫn thắng objective. Loss giảm không đủ để đánh giá representation.

Các họ cơ chế chống collapse#

  • Contrastive negatives: tạo incentive phân biệt positive và negatives; equal logits cho loss log⁡K\log K, nhưng không tự là bằng chứng mọi optimizer tránh được stationary collapse.
  • Informative fixed targets: labels/quantizer/teacher không tự trôi theo student; vẫn cần kiểm target có thông tin gì.
  • Architectural/training asymmetry: predictor, stop-gradient, normalization, teacher update; là recipe cần kiểm chứng.
  • Variance/covariance regularization: kiểm soát spread và redundancy.
  • Distribution regularization: ràng buộc phân phối theo projection/statistics.
  • Auxiliary tasks/anchors: thêm mục tiêu giữ một loại thông tin.

VICReg tách invariance, variance và covariance thành các term. Nó giúp hiểu khác biệt giữa “match views” và “giữ representation có biến thiên”. Áp dụng một regularizer vào forensic task vẫn cần kiểm nó có giữ cue hay chỉ làm spectrum đẹp hơn.

Bộ đo hợp lý hơn một scalar#

Theo dõi token variance, utterance variance, cross-utterance cosine, spectrum/rank (centered và uncentered), cùng probes/task performance trên dữ liệu tách riêng. Ghi layer, pooling, normalization, sample count và dataset. Rank tối đa còn bị chặn bởi số hàng quan sát; không dùng rank của utterance batch 64 để mong đủ 768 chiều sau centering.

8. JEPA để học feature và JEPA để chấm anomaly là hai cách dùng#

Cách dùng trong manuscript SOICT#

Pretraining JEPA đã làm trước. Downstream dùng context encoder, bỏ predictor và target encoder, học head bằng nhãn genuine/spoof. Vì vậy detection score không phải latent-prediction loss.

Frozen setting vẫn học layer weights, attentive statistics pooling và MLP nên không phải linear probe. Paper Audio-JEPA gốc dùng target encoder cho downstream evaluation; đó là convention khác với context encoder trong manuscript. Bài 9 truy dấu head, weighted CE và logit-difference score từ PDF.

Predictor-error scoring#

Một ý tưởng scoring là:

serr(x)=EM[1∣M∣∑i∈Md(h^i,hitarget)].s_{err}(x)=\mathbb E_{M}\left[\frac{1}{|M|}\sum_{i\in M}d(\hat h_i,h_i^{target})\right].

Error cao không bảo đảm fake: noise, accent, disfluency hoặc kênh lạ cũng tăng error; synthesis sạch và đều có thể dễ đoán hơn genuine. Error còn phụ thuộc mask, scale, target geometry và predictor calibration. Error âm học không tự là likelihood ratio.

Nếu fine-tune encoder cho CE rồi dùng predictor cũ, predictor đang dự đoán trong latent space đã thay đổi. Đây là compatibility problem; cần mô tả rõ cả encoder, target và predictor dùng từ checkpoint nào.

One-class, unsupervised scoring và supervised detector dùng error features là ba setup riêng, với baseline và claim khác nhau.

9. Bản đồ các nhánh JEPA hiện nay#

NhánhBài học về taxonomyGiới hạn khi liên hệ detection
I-JEPALatent regions, context/target geometryImage semantics không bằng audio forensics
V-JEPA / video JEPAFeature prediction qua không gian–thời gianAudio masked-region prediction không tự là world model hành động
A-JEPACurriculum và time-frequency-aware maskingKhác paper Audio-JEPA dùng trong dự án
Audio-JEPAGeneral-audio ViT, random spectrogram maskingĐây là checkpoint downstream của paper mình
GMM-Anchored JEPAContinuous prediction được hỗ trợ bởi clustering anchorClustering cue có thể khác forensic cue
S-JEPAJEPA-style encoder–predictor với soft GMM posterior targetKhông gộp với EMA regression formulation cho mọi JEPA
GLaS-JEPACurrent-encoder targets và SIGReg, không separate EMA teacherBằng chứng speech-task chưa là bằng chứng deepfake-task
BEST-RQ-2Discrete targets nhưng decomposition contextualize–predictCần phân loại cả target và architecture

Nguồn mới: A-JEPA, GMM-Anchored JEPA, S-JEPA, GLaS-JEPA, BEST-RQ-2. Lượt lớp 3 đã đọc các method sections được ghi trong sổ nguồn: S-JEPA dùng single KL với GMM target đổi qua hai pha, GLaS-JEPA dùng shared current encoder + SIGReg, BEST-RQ-2 dùng masked CE trên random IDs. Resource existence, checkpoint provenance và forensic utility là các mức kiểm chứng riêng; không có kết quả detection được tái lập ở đây. Xem bài 10.

10. Các cặp khái niệm phải phân biệt#

ABKhác nhau ở đâu?
Continuous targetContinuous audio inputKiểu supervision khác kiểu dữ liệu
Non-generative objectiveKhông dùng decoder/predictorPredictor vẫn có thể là một network lớn
Latent predictionDensity estimationMatching error chưa là xác suất
EMA target encoderFrozen teacherMột bên đổi theo student, một bên cố định
Self-distillationHuman-supervised knowledge distillationNguồn target khác nhau
Good ASR featureGood forensic featureTask-relevant information khác nhau
Frozen encoderLinear probeHead frozen-mode có thể phi tuyến và khá mạnh
Joint embeddingJoint embedding predictiveMatching embeddings chưa đủ mô tả task prediction

11. Tự kiểm tra#

  1. Vẽ các nhánh của JEPA và đánh dấu tham số nhận gradient.
  2. Nếu bỏ EMA nhưng thêm distribution regularizer, còn có thể là một JEPA variant không?
  3. Vì sao AudioMAE encoder không nhất thiết thiếu artifact chỉ vì reconstruction làm mượt?
  4. Khi nào mask random có thể làm nhiệm vụ quá dễ?
  5. Có thể có anisotropy cao mà linear probe rất tốt không?
  6. Vì sao ASR improvement của S-JEPA/GLaS-JEPA không đủ chứng minh lợi ích detection?

Hiểu JEPA là hiểu thiết kế thông tin: context được phép thấy gì, target phải chứa gì, predictor được phép bỏ gì, và điều gì ngăn nghiệm vô nghĩa.

12. Ba ý niệm lý thuyết để học tiếp#

Sufficiency và bottleneck. Representation hh đủ cho label yy khi nó giữ thông tin cần để dự đoán yy từ xx. Nén input không tự giúp: nếu bottleneck bỏ cue phân biệt genuine/spoof thì classifier mạnh hơn cũng không khôi phục được. Ngược lại, giữ toàn bộ channel information không bảo đảm classifier biết dùng nó đúng cách. Information-bottleneck là một lăng kính cho trade-off này, không phải giải thích tự động cho mọi neural encoder.

Predictability và identifiability. Một target khó predict có thể do context thiếu thông tin, target nhiều nhiễu, hoặc predictor chưa đủ năng lực. Chỉ nhìn error không biết nguyên nhân nào. Tương tự, task có thể có nhiều nghiệm representation cùng loss nhưng khác usefulness. Đây là lý do phải kiểm probes/downstream và các đối chứng, không chỉ tối ưu pretraining loss.

Energy và probability. Latent distance có thể xem như một compatibility energy cho context–target. Nó chưa là normalized density của waveform hoặc xác suất genuine. Muốn dùng error như score detection, cần chứng minh distributions và threshold behavior. Có encoder–predictor không tự biến Audio-JEPA thành một world model có hành động, planning hoặc temporal dynamics; các khả năng đó cần task và evidence riêng.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.