ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
3 phút đọc · Toàn văn

Lớp 1: nền tảng để tự đọc và chất vấn Audio-JEPA#

Biên soạn và kiểm tra: 11/10/2026. Học liệu đã bổ sung; người học chưa được đánh dấu hoàn thành.

Bạn không cần học hết toán trước khi bắt đầu. Đi theo luồng chính, làm ví dụ bằng giấy hoặc máy tính, rồi mới mở nhánh đào sâu. Ký hiệu mới được giải thích ngay nơi xuất hiện. Một bài có thể chia thành nhiều lượt hỏi đáp; thứ tự dưới đây là thứ tự phụ thuộc kiến thức, không phải thời hạn.

Thứ tựBàiCầu nốiTự làm được sau bài
1Tiếng nói và source-filterChu kỳ, Hz, tổng có trọng sốTách F0/harmonics/formants và nêu giới hạn mô hình
2Tín hiệu rời rạc, convolution, FourierSố phức, vector, tích vô hướngTính một convolution và DFT; nói đúng phần mất khi bỏ phase
3Sampling, aliasing, resamplingSin/cos và thời gian mẫu từ bài 2Chứng minh hai tần số có cùng mẫu; phân biệt sample rate và bandwidth
4STFT, magnitude, power, phaseDFT và samplingTính frame count theo giả định; phân biệt window/hop/FFT/patch span
5Mel, cepstrum, chuẩn hóa, tokenPower và log từ bài 4Truy vết thông tin và shape từ waveform tới 128 token
6Xác suất và loss cho detectionLog, kỳ vọng, đạo hàm cơ bản tại chỗSuy ra weighted posterior; biết giới hạn MSE conditional mean
7Hình học biểu diễn và phép đoVector/ma trận từ bài 2, variance từ bài 6Tính covariance/rank và đưa phản ví dụ cho usefulness
8Mạng nơ-ron, attention, tối ưu, adaptationGradient từ bài 6, tích ma trận từ bài 7Đi một bước backprop; nối attention, frozen mode và fine-tuning

Trong mỗi bài: đọc mục tiêu → trực giác → ví dụ đã giải → thử bài tập trước khi mở đáp án. Khi không hiểu công thức, hỏi theo dạng “ở bước này, đại lượng nào được giữ cố định?” hoặc “hãy tính với hai số cụ thể”. Phần Đào sâu tự chọn không chặn luồng chính.

Ba nhãn bằng chứng dùng xuyên suốt:

  • Lý thuyết: định nghĩa/định lý hoặc hành vi thư viện, có nguồn và điều kiện áp dụng.
  • Paper: cấu hình được báo cáo trong PDF đã nộp, không có nghĩa được tái chạy trong lượt này.
  • Minh họa/suy luận biên soạn: ví dụ số, đồ thị giả lập, phản ví dụ và liên hệ forensic do chúng ta xây; không phải kết quả thực nghiệm dự án.

Mốc neo về paper: context encoder Audio-JEPA ViT-Base đã được tác giả checkpoint tiền huấn luyện trên AudioSet; downstream học bona fide/spoof bằng weighted cross-entropy. Predictor/target branch không tham gia downstream. Chúng ta học cơ chế để đọc thiết kế này; chưa chọn phương pháp mới hay cấu hình GPU.

Tham khảo sổ nguồn đã đối chiếu, báo cáo bổ sung và giới hạn, tiến độ gia sư. Bài tập ở đây phát triển các ví dụ mới; chương 08 tổng thể vẫn là bộ câu hỏi nối cả sáu lớp.

Quay về bản đồ nền tảng.

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.