ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
9 phút đọc · Toàn văn
Mục lục bài · 5 mục

Sổ nguồn lớp 1: nội dung đã đọc và phạm vi xác nhận#

Bắt đầu · Báo cáo

Đối chiếu ngày 11/10/2026. “Đọc” ở đây chỉ các mục ghi cụ thể, không có nghĩa đọc trọn sách/paper. Hai subagent tìm nguồn; agent chủ trì đọc lại các phần cơ chế dùng trong bài học, tự dẫn xuất và tính lại ví dụ. Danh sách không dùng số nguồn làm thước đo độ sâu.

Quy ước bằng chứng: định nghĩa/thuật toán từ nguồn → dẫn xuất và ví dụ biên soạn → liên hệ có điều kiện với paper. Một công thức đúng không tự chứng minh model thực tế đã sử dụng cơ chế đó. Nguồn web dùng phiên bản ghi rõ; chưa xác nhận version phần mềm của run trong paper.

Tiếng nói và tín hiệu#

ID, nguồn trực tiếpPhần agent chủ trì đã đọcDùng cho / điều kiện
S1 — Aalto, Speech production and acoustic propertiesPhysiological speech production, Acoustic properties, Physiological modellingBài 1: nguồn dao động/nhiễu, vocal tract và giới hạn mô hình vật lý. Source-filter tuyến tính là xấp xỉ cục bộ.
S2 — Aalto, Fundamental frequencyIntroduction, quan hệ chu kỳ–F0 và ước lượng từ tín hiệu tuần hoànBài 1: F0, pitch, chu kỳ. Âm vô thanh không cần có F0 ổn định.
S3 — Smith, DSP Guide, chương 6Delta function, impulse response; input/output-side convolutionBài 1–2: phân rã theo xung và suy ra convolution của LTI. Không áp cho clipping hoặc filter thay theo input.
S4 — Smith, DSP Guide, chương 8Basis functions; analysis/synthesis DFTBài 2: phân tích/tái dựng phổ. Bài học khai báo convention DFT phức unnormalized riêng để tránh lẫn hệ số real DFT của sách.
S5 — Smith, DSP Guide, chương 9Convolution theorem, circular convolution và zero-paddingBài 2: boundary vòng; FFT length đủ lớn khi tính linear convolution. Shift và Parseval được dẫn nguồn riêng S25/S26.
S6 — Smith, DSP Guide, chương 3Quantization; The Sampling Theorem, trang sách 39–44Bài 3: aliasing, band-limit và sampling khác quantization. Điều kiện fs>2B an toàn; boundary Nyquist cần phase/giả định.
S7 — Torchaudio 2.8, Audio ResamplingResampling Overview; Lowpass filter width; Rolloff; Window function; đối chiếu functional.resampleBài 3: bandlimited sinc và trade-off filter. Không suy cutoff/kernel của run paper từ mặc định API.
S8 — Aalto, Short-time analysisWindowing functions; Spectrogram, thuật toán/code và AccuracyBài 4: phân tích cục bộ, window/hop/zero-extension. Trang Spectrogram and the STFT riêng bị timeout khi mở lại; chỉ đọc công thức/code qua chỉ mục tìm kiếm. Bài học dùng trang Short-time analysis đã mở được và S9.
S9 — torch.stft, PyTorch 2.9Công thức, Parameters, Returns và frame countBài 4: window padding lên n_fft, centering, one-sided shape. Bảng 253/254/257 là minh họa theo convention, không xác nhận output của paper.
S25 — Julius O. Smith, Shift TheoremĐịnh lý, chứng minh và linear phaseBài 2: circular shift nhân phase factor, giữ magnitude. Crop/dịch thật với boundary khác cần kiểm lại.
S26 — Julius O. Smith, Rayleigh/ParsevalCông thức và normalization DFTBài 4: energy time/frequency với hệ số 1/N. Squared magnitude chưa mặc nhiên là PSD hay watt.
S27 — John Coleman, Oxford, source-filter theoryTrang lý thuyết, periodic và turbulence sourcesNguồn đọc thêm cho bài 1; không cần chọn voiced pulse train cho mọi âm.

Mel, cepstrum và normalization#

ID, nguồn trực tiếpPhần agent chủ trì đã đọcDùng cho / điều kiện
S10 — librosa 0.11, filters.mel, source codeParameters/Returns; xây triangle weights; Slaney area normalizationBài 5: gộp power thành bands, shape và các quy ước filterbank. W 2×3 trong bài là đồ chơi tự xây.
S10b — librosa, hz_to_melHTK flag, ví dụ và liên kết conversionBài 5: HTK và Slaney khác nhau. Công thức HTK trong bài không được dùng để khẳng định recipe paper.
S11 — Aalto, cepstrum/MFCCThe cepstrum; MFCC và chuỗi bước trích featureBài 5: log source-filter và đổi basis; cần phân biệt real cepstrum với DCT trên log-mel, cùng việc truncate.
S12 — LayerNorm, PyTorch 2.9Công thức, normalized_shape, chiều thống kê, train/evalBài 5/8: input statistics trên các chiều cuối; variance biased. Ví dụ bỏ epsilon khi variance dương.
S13 — BatchNorm1d, PyTorch 2.9Per-channel statistics, running estimates, track_running_statsBài 5/8: mode và state khác LayerNorm. Recipe mặc định có ngoại lệ nếu tắt running stats.
S28 — Kaldi, transforms — CMVNCepstral mean and variance normalization; compute-cmvn-stats/apply-cmvnBài 5: utterance/speaker statistics. Ví dụ valid mask là quy ước học, chưa xác nhận paper dùng CMVN.
S31 — LFCC, Torchaudio 2.8Definition, n_filter, DCT/norm, log_lf và chú ý dBNhánh bài 5: filter tuyến tính; log và dB không phải một recipe duy nhất.
S32 — Todisco et al. (2016), CQCC§§3.3–3.4, §4.2 và Figure 3, trang 3–5 của PDFNhánh bài 5: constant-Q, window thay theo frequency và uniform resampling trước DCT. Không chuyển các kết quả ASVspoof 2015 thành claim cho Audio-JEPA.

Xác suất, hình học và deep learning#

ID, nguồn trực tiếpPhần agent chủ trì đã đọcDùng cho / điều kiện
S14 — Deep Learning, chương 3Chọn lọc §§3.3, 3.5, 3.8, 3.11 và entropy/CEBài 6–7: distribution, expectation, variance/covariance, Bayes. Weighted posterior và threshold được tự dẫn xuất trong bài, không trích thành kết quả của sách về detector này.
S15 — CrossEntropyLoss, PyTorch 2.9Class-index formula, weight và mean reductionBài 6: raw logits, tổng weights trong denominator. Population derivation không luôn trùng random ratio của minibatch mean.
S16 — Deep Learning, chương 2Norms, eigendecomposition/SVD §§2.7–2.8 và PCA §2.12Bài 7: ma trận, spectrum và reconstruction. Phản ví dụ variance/nuisance và rank-bound sau center là tính toán biên soạn.
S17 — Roy & Vetterli (2007), Effective Rank§2.1 Definition và §2.2 Properties, PDF 5 trangBài 7: singular-value entropy; matrix khác zero; scale invariance. Link EPFL/Zenodo không tải được ở lần kiểm; dùng bản EURASIP mở được. Không claim đã đọc toàn bộ §3–4 bằng mức đọc của subagent.
S18 — Kornblith et al. (2019), CKAChọn lọc §§2–3, Table 1 và §5Bài 7: Gram/HSIC và linear CKA; centering, invariances. Không dùng similarity để xác nhận usefulness hoặc causal reliance.
S19 — Deep Learning, chương 6Chọn lọc output/softmax §6.2.2.3, computational graphs/chain rule §§6.5.1–6.5.3; trích HTML bằng Python do trang quá lớn với web toolBài 8: reverse chain rule. Affine composition và các gradient toy được tính lại, không phải training run. Không claim đọc hết chương.
S20 — Conv1d, PyTorch 2.9Formula, cross-correlation, stride/dilation/paddingBài 8: không đảo kernel trong CNN toy. DSP convolution ở bài 2 dùng convention khác.
S21 — Vaswani et al. (2017), Attention Is All You Need§§3.2.1–3.2.2; vị trí/kiến trúc §§3.3, 3.5Bài 8: row softmax, scaling và heads. Dùng cơ chế, không chuyển kết quả dịch máy thành bằng chứng detection.
S22 — Loshchilov & Hutter, AdamW§2, Algorithm 2 và Proposition 2Bài 8: tách decay khỏi adaptive gradient. Hệ số công thức cập nhật của bài học theo API S23.
S23 — AdamW, PyTorch 2.9Pseudocode algorithm, bias correction, weight_decayBài 8: cập nhật từng tọa độ, hệ số eta×lambda. Toy bỏ epsilon chỉ khi denominator khác zero.
S24 — Hu et al., LoRA§4.1: factorization, scaling, initialization và mergeBài 8: rank update và parameter count. Không claim paper đã dùng LoRA hoặc LoRA giữ cùng EER.
S29 — Mahajan, McGill, MMSE estimation§6.1, proof/decomposition và vector extensionBài 6: finite second moment, conditional expectation tối ưu prediction. Không phải định lý xóa thông tin trong encoder.

S30 — Các cơ chế train PyTorch#

Đọc định nghĩa/algorithm của Dropout, clip_grad_norm_, OneCycleLR, và mục Gradient Scaling của AMP. Dùng ở bài 8 để giải thích train/eval, clipping, lịch learning rate và underflow. Chưa kiểm recipe runtime hoặc benchmark tốc độ. AMP có thể overflow tùy model; scaling không bảo đảm mọi run ổn định.

P1 — Paper đã nộp#

Nguồn: SOICT_2026_paper_4308.pdf. Agent chủ trì trích text cả 14 trang để tra cứu, đọc lại Method §§3.1–3.3 và Figure 1 ở trang 3–5, đồng thời xem render ba trang ấy. Việc trích text cả file không đồng nghĩa đọc sâu lại toàn bộ Results/Discussion trong lượt enrich lớp 1.

Đối chiếu: 16→32 kHz, 2,56 s, 128 mel, window/hop 25/10 ms, pad/truncate 256 frames; patch 8×32, grid 32×4, 128 token, width 768, 12 blocks/12 heads, no CLS; 13 readouts, attentive mean/std 1.536 chiều, head 495.632 parameters; CE có bona-fide weight, score z_B−z_S, frozen encoder eval/no-gradient. Đây là số liệu được paper báo cáo, không phải tensor/log đã tái chạy. n_fft, centering, mel convention và floor std không được xác nhận đầy đủ chỉ từ đoạn Method.

Hồ sơ nghiên cứu của subagent và phần chưa kiểm lại#

  • Nguồn tiếng nói/DSP: Oxford, Jurafsky/Martin, Smith/JOS, Shannon, thư viện và các lỗ hổng. Mức đọc rộng trong hồ sơ là báo cáo của subagent.
  • Nguồn toán/deep learning: sách, MMSE, rank, CKA, attention, AdamW và LoRA. Subagent dẫn docs PyTorch 2.14; bài học chủ trì dùng docs 2.9 đã đối chiếu riêng.

Chưa đọc lại trọn các chương phụ về RNN, toàn bộ experiments CKA/LoRA/AdamW, toàn sách DSP, hay paper Shannon bản publisher. Shannon trong hồ sơ DSP có mirror để đọc và publisher để định danh, không được ghi thành “đã đọc toàn văn publisher”. Các nguồn này là nhánh đọc thêm; không lấy abstract/trang giới thiệu làm chứng cứ cho cơ chế chưa đọc.

Nhận định như “resampling history có thể là shortcut”, “rank không chứng minh usefulness”, “attention weights chưa là causal evidence” được ghi là suy luận/ phản ví dụ có điều kiện. Không có kết quả mới về cue retention, calibration, EER hay collapse của checkpoint.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.