ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
4 phút đọc · Toàn văn
Mục lục bài · 4 mục

Đối chiếu trọng yếu của root — 11/10/2026#

Đọc dossiers của hai agent là một bước tổng hợp. Root kiểm trực tiếp PDF Method, snippets source và các method/API trọng yếu dưới đây; không audit toàn bộ repository/checkpoint/runtime. Sổ nguồn ghi riêng phần agent đọc và phần root kiểm.

Paper nội bộ và template#

  • PDF gốc C:/Users/LENOVO/Downloads/SOICT_2026_paper_4308.pdf: trích lại trang 3–6 bằng pypdf vào soict-method-verified.txt, xem render trang 4 để kiểm Figure 1/kiến trúc. Nội dung recipe/pooling/optimization/score dựa vào Method, không inferred từ title. Không tạo/sửa PDF.
  • Template notebook v38: đọc JSON cell index 3 (zero-based) chứa _layers, ASP, Net, loss và scorer. Không execute notebook, không tải model. Source có 12 block readouts + norm, softmax layer weights, ASP scalar token weights, no_grad/eval/detach frozen branch và B−S scorer. ASP không có mask argument; std clamp min variance 10⁻⁸ tạo floor std 10⁻⁴. Counts ns/nb chưa được lấy từ corpus trong lượt này. Kiểm JSON bốn notebooks v38–v41: lần lượt 7/6/6/11 code cells, cả bốn có 0 output items; không dùng điều này làm bằng chứng chưa từng có run ở nơi khác.
  • Pretraining provenance không được thay bằng current upstream defaults. Đối chiếu lớp 3 giữ các unresolved checkpoint/version questions. Notebook là template, không evidence đã chạy.

Pinned implementation checks#

Source/versionRoot đọcKết luận dùng trong bài
ASVspoof 2021 SHA 9b33f5eca887bd3bf629e3fb79428cd9bb7ac972Full LFCC/CQCC MATLAB scripts; RawNet2 YAML, phần model có liên quanGMM settings là recipe riêng; LFCC spoof-training loop có index bonafideIdx(i) dù đang đi spoof loop. Không suy ra released pretrained GMM bị lỗi; mặc định pretrained=true bỏ nhánh ấy
AASIST SHA a04c9863f63d44471dde8a6abcb3b082b07cd1Model forward/node construction + main.py scorerSpectral nodes max qua time, temporal nodes max qua spectral axis sau learned feature stack; scorer xuất batch_out[:,1] raw logit, model head không softmax
LoRA SHA c4593f060e6a368d7bb5af5273b8e42810cdef90Agent đọc loralib; root đọc paper v2 §4.1–4.2ΔW=(α/r)BA, B zero init, A random; merge fixed linear branch có điều kiện, không mọi PEFT đều merge được

Các URLs file/config và phạm vi đọc chi tiết nằm trong architecture dossier. Không lấy line numbers của web renderer làm GitHub source lines.

Method/API kiểm trực tiếp#

  • RawNet2 v3 §3/Table 1 so với official 2021 config; AASIST §§2–3; AST §2.1: phân biệt paper architecture, challenge implementation và image-supervised initialization.
  • LoRA v2 §§4.1–4.2; Houlsby adapters §2/2.1; Hinton distillation §2; Tent v3 §§2–3: chỉ phương thức update/assumptions, không claim efficacy audio.
  • ASP Okabe §3 equations 3–6; ECAPA §3.1 channel-dependent attention; ELMo §3.2 scalar layer mixture; MIL §2.3. Population weighted variance được phân biệt với sample estimator.
  • Focal v2 §3.2; ArcFace v3 §2.1; OC-Softmax 2010.13995v2 §II.B/eq. 3; DANN §4; Group DRO v2 §§2–3. Không dùng một method cụ thể làm synonym cho toàn họ loss/adaptation. OC-Softmax này còn dùng spoof examples với margin riêng; “one-class” không mặc định training chỉ bona fide.
  • DOSS arXiv 2512.18210v3 §§3–4/Algorithms 1–2 + ACL final landing metadata. ACL final PDF không đọc được qua web ở lượt kiểm root; agent đọc thêm bản final bằng temporary extraction. Không khẳng định toàn bộ số liệu arXiv/final giống nhau.
  • RawBoost v2 §3; PartialSpoof v2 §§2–3; calibration Guo §4; attention Jain–Wallace §4.2; saliency Adebayo §§3–4; CKA §§2–3/Table 1. Probes/control tasks được agent đọc method; root web fetch PDF bị lỗi, nên không nâng thành full root method read.
  • PyTorch stable URL ở lượt tra cứu dẫn đến docs 2.14: autograd, CE/BCE, BatchNorm1d, Dropout, WeightedRandomSampler và STFT center. Đây là version docs đọc ngày 11/10/2026, không version runtime của notebook. Agent độc lập đối chiếu docs 2.9; bài dùng semantics nêu rõ contract.

Corrections trước khi phát hành học liệu#

  1. “Adaptation” không phải khối forward bắt buộc; vẽ forward và update riêng.
  2. Fixed Sinc filters trong RawNet2/AASIST không gọi thành mọi waveform filters đều learned.
  3. Frozen + nonlinear backend không gọi linear probe; no_grad khác eval và buffer updates.
  4. Agent architecture draft ban đầu ghi AASIST log-probability; đã sửa sau root kiểm raw scorer. Học liệu dùng raw class-1 logit observation và không suy ra performance effect.
  5. Link PartialSpoof phải 2104.02518, không 2204.05125; OC-Softmax phải 2010.13995, không 2010.03865 (hai links cũ trỏ paper khác). Method pointers Houlsby §2, ECAPA §3.1, ArcFace v3 §2.1 được sửa.
  6. Temperature scaling là σ(d/T), T>0; thêm intercept b là affine/Platt-style extension.
  7. Weighted hard-target CE mean chia tổng valid target weights; singleton positive weight bị triệt tiêu ở reduction này. Soft-target CE/BCE reductions khác. Population prior toy không đồng nhất expected gradient của mọi finite minibatch.

Các tính toán, plot và structural/hash checks được tái tạo bằng script. Chúng kiểm học liệu/toys, không xác minh EER/checkpoint hay causal behavior của detector thực.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.