# Sổ nguồn lớp 1: nội dung đã đọc và phạm vi xác nhận

[Bắt đầu](00-BAT-DAU-LOP-01.md) · [Báo cáo](10-BAO-CAO-ENRICH.md)

Đối chiếu ngày 11/10/2026. “Đọc” ở đây chỉ các mục ghi cụ thể, không có nghĩa đọc trọn sách/paper. Hai subagent tìm nguồn; agent chủ trì đọc lại các phần cơ chế dùng trong bài học, tự dẫn xuất và tính lại ví dụ. Danh sách không dùng số nguồn làm thước đo độ sâu.

**Quy ước bằng chứng:** định nghĩa/thuật toán từ nguồn → dẫn xuất và ví dụ biên soạn → liên hệ có điều kiện với paper. Một công thức đúng không tự chứng minh model thực tế đã sử dụng cơ chế đó. Nguồn web dùng phiên bản ghi rõ; chưa xác nhận version phần mềm của run trong paper.

## Tiếng nói và tín hiệu

| ID, nguồn trực tiếp | Phần agent chủ trì đã đọc | Dùng cho / điều kiện |
|---|---|---|
| S1 — [Aalto, Speech production and acoustic properties](https://speechprocessingbook.aalto.fi/introduction/speech-production-and-acoustic-properties/) | Physiological speech production, Acoustic properties, Physiological modelling | Bài 1: nguồn dao động/nhiễu, vocal tract và giới hạn mô hình vật lý. Source-filter tuyến tính là xấp xỉ cục bộ. |
| S2 — [Aalto, Fundamental frequency](https://speechprocessingbook.aalto.fi/representations/fundamental-frequency-f0/) | Introduction, quan hệ chu kỳ–F0 và ước lượng từ tín hiệu tuần hoàn | Bài 1: F0, pitch, chu kỳ. Âm vô thanh không cần có F0 ổn định. |
| S3 — [Smith, DSP Guide, chương 6](https://www.dspguide.com/CH6.PDF) | Delta function, impulse response; input/output-side convolution | Bài 1–2: phân rã theo xung và suy ra convolution của LTI. Không áp cho clipping hoặc filter thay theo input. |
| S4 — [Smith, DSP Guide, chương 8](https://www.dspguide.com/CH8.PDF) | Basis functions; analysis/synthesis DFT | Bài 2: phân tích/tái dựng phổ. Bài học khai báo convention DFT phức unnormalized riêng để tránh lẫn hệ số real DFT của sách. |
| S5 — [Smith, DSP Guide, chương 9](https://www.dspguide.com/CH9.PDF) | Convolution theorem, circular convolution và zero-padding | Bài 2: boundary vòng; FFT length đủ lớn khi tính linear convolution. Shift và Parseval được dẫn nguồn riêng S25/S26. |
| S6 — [Smith, DSP Guide, chương 3](https://www.dspguide.com/CH3.PDF) | Quantization; The Sampling Theorem, trang sách 39–44 | Bài 3: aliasing, band-limit và sampling khác quantization. Điều kiện fs>2B an toàn; boundary Nyquist cần phase/giả định. |
| S7 — [Torchaudio 2.8, Audio Resampling](https://docs.pytorch.org/audio/2.8.0/tutorials/audio_resampling_tutorial.html) | Resampling Overview; Lowpass filter width; Rolloff; Window function; đối chiếu [functional.resample](https://docs.pytorch.org/audio/2.8.0/generated/torchaudio.functional.resample.html) | Bài 3: bandlimited sinc và trade-off filter. Không suy cutoff/kernel của run paper từ mặc định API. |
| S8 — [Aalto, Short-time analysis](https://speechprocessingbook.aalto.fi/representations/short-time-analysis/) | Windowing functions; Spectrogram, thuật toán/code và Accuracy | Bài 4: phân tích cục bộ, window/hop/zero-extension. Trang Spectrogram and the STFT riêng bị timeout khi mở lại; chỉ đọc công thức/code qua chỉ mục tìm kiếm. Bài học dùng trang Short-time analysis đã mở được và S9. |
| S9 — [torch.stft, PyTorch 2.9](https://docs.pytorch.org/docs/2.9/generated/torch.stft.html) | Công thức, Parameters, Returns và frame count | Bài 4: window padding lên n_fft, centering, one-sided shape. Bảng 253/254/257 là minh họa theo convention, không xác nhận output của paper. |
| S25 — [Julius O. Smith, Shift Theorem](https://dsprelated.com/freebooks/mdft/Shift_Theorem.html) | Định lý, chứng minh và linear phase | Bài 2: circular shift nhân phase factor, giữ magnitude. Crop/dịch thật với boundary khác cần kiểm lại. |
| S26 — [Julius O. Smith, Rayleigh/Parseval](https://dsprelated.com/freebooks/mdft/Rayleigh_Energy_Theorem_Parseval_s.html) | Công thức và normalization DFT | Bài 4: energy time/frequency với hệ số 1/N. Squared magnitude chưa mặc nhiên là PSD hay watt. |
| S27 — [John Coleman, Oxford, source-filter theory](https://www.phon.ox.ac.uk/jcoleman/source_filter.htm) | Trang lý thuyết, periodic và turbulence sources | Nguồn đọc thêm cho bài 1; không cần chọn voiced pulse train cho mọi âm. |

## Mel, cepstrum và normalization

| ID, nguồn trực tiếp | Phần agent chủ trì đã đọc | Dùng cho / điều kiện |
|---|---|---|
| S10 — [librosa 0.11, filters.mel](https://librosa.org/doc/0.11.0/generated/librosa.filters.mel.html), [source code](https://librosa.org/doc/0.11.0/_modules/librosa/filters.html) | Parameters/Returns; xây triangle weights; Slaney area normalization | Bài 5: gộp power thành bands, shape và các quy ước filterbank. W 2×3 trong bài là đồ chơi tự xây. |
| S10b — [librosa, hz_to_mel](https://librosa.org/doc/0.11.0/generated/librosa.hz_to_mel.html) | HTK flag, ví dụ và liên kết conversion | Bài 5: HTK và Slaney khác nhau. Công thức HTK trong bài không được dùng để khẳng định recipe paper. |
| S11 — [Aalto, cepstrum/MFCC](https://speechprocessingbook.aalto.fi/representations/melcepstrum/) | The cepstrum; MFCC và chuỗi bước trích feature | Bài 5: log source-filter và đổi basis; cần phân biệt real cepstrum với DCT trên log-mel, cùng việc truncate. |
| S12 — [LayerNorm, PyTorch 2.9](https://docs.pytorch.org/docs/2.9/generated/torch.nn.LayerNorm.html) | Công thức, normalized_shape, chiều thống kê, train/eval | Bài 5/8: input statistics trên các chiều cuối; variance biased. Ví dụ bỏ epsilon khi variance dương. |
| S13 — [BatchNorm1d, PyTorch 2.9](https://docs.pytorch.org/docs/2.9/generated/torch.nn.BatchNorm1d.html) | Per-channel statistics, running estimates, track_running_stats | Bài 5/8: mode và state khác LayerNorm. Recipe mặc định có ngoại lệ nếu tắt running stats. |
| S28 — [Kaldi, transforms — CMVN](https://kaldi-asr.org/doc/transform.html) | Cepstral mean and variance normalization; compute-cmvn-stats/apply-cmvn | Bài 5: utterance/speaker statistics. Ví dụ valid mask là quy ước học, chưa xác nhận paper dùng CMVN. |
| S31 — [LFCC, Torchaudio 2.8](https://docs.pytorch.org/audio/2.8.0/generated/torchaudio.transforms.LFCC.html) | Definition, n_filter, DCT/norm, log_lf và chú ý dB | Nhánh bài 5: filter tuyến tính; log và dB không phải một recipe duy nhất. |
| S32 — [Todisco et al. (2016), CQCC](https://www.isca-archive.org/odyssey_2016/todisco16_odyssey.pdf) | §§3.3–3.4, §4.2 và Figure 3, trang 3–5 của PDF | Nhánh bài 5: constant-Q, window thay theo frequency và uniform resampling trước DCT. Không chuyển các kết quả ASVspoof 2015 thành claim cho Audio-JEPA. |

## Xác suất, hình học và deep learning

| ID, nguồn trực tiếp | Phần agent chủ trì đã đọc | Dùng cho / điều kiện |
|---|---|---|
| S14 — [Deep Learning, chương 3](https://www.deeplearningbook.org/contents/prob.html) | Chọn lọc §§3.3, 3.5, 3.8, 3.11 và entropy/CE | Bài 6–7: distribution, expectation, variance/covariance, Bayes. Weighted posterior và threshold được tự dẫn xuất trong bài, không trích thành kết quả của sách về detector này. |
| S15 — [CrossEntropyLoss, PyTorch 2.9](https://docs.pytorch.org/docs/2.9/generated/torch.nn.CrossEntropyLoss.html) | Class-index formula, weight và mean reduction | Bài 6: raw logits, tổng weights trong denominator. Population derivation không luôn trùng random ratio của minibatch mean. |
| S16 — [Deep Learning, chương 2](https://www.deeplearningbook.org/contents/linear_algebra.html) | Norms, eigendecomposition/SVD §§2.7–2.8 và PCA §2.12 | Bài 7: ma trận, spectrum và reconstruction. Phản ví dụ variance/nuisance và rank-bound sau center là tính toán biên soạn. |
| S17 — [Roy & Vetterli (2007), Effective Rank](https://eurasip.org/Proceedings/Eusipco/Eusipco2007/Papers/a5p-h05.pdf) | §2.1 Definition và §2.2 Properties, PDF 5 trang | Bài 7: singular-value entropy; matrix khác zero; scale invariance. Link EPFL/Zenodo không tải được ở lần kiểm; dùng bản EURASIP mở được. Không claim đã đọc toàn bộ §3–4 bằng mức đọc của subagent. |
| S18 — [Kornblith et al. (2019), CKA](https://proceedings.mlr.press/v97/kornblith19a/kornblith19a.pdf) | Chọn lọc §§2–3, Table 1 và §5 | Bài 7: Gram/HSIC và linear CKA; centering, invariances. Không dùng similarity để xác nhận usefulness hoặc causal reliance. |
| S19 — [Deep Learning, chương 6](https://www.deeplearningbook.org/contents/mlp.html) | Chọn lọc output/softmax §6.2.2.3, computational graphs/chain rule §§6.5.1–6.5.3; trích HTML bằng Python do trang quá lớn với web tool | Bài 8: reverse chain rule. Affine composition và các gradient toy được tính lại, không phải training run. Không claim đọc hết chương. |
| S20 — [Conv1d, PyTorch 2.9](https://docs.pytorch.org/docs/2.9/generated/torch.nn.Conv1d.html) | Formula, cross-correlation, stride/dilation/padding | Bài 8: không đảo kernel trong CNN toy. DSP convolution ở bài 2 dùng convention khác. |
| S21 — [Vaswani et al. (2017), Attention Is All You Need](https://arxiv.org/html/1706.03762v7) | §§3.2.1–3.2.2; vị trí/kiến trúc §§3.3, 3.5 | Bài 8: row softmax, scaling và heads. Dùng cơ chế, không chuyển kết quả dịch máy thành bằng chứng detection. |
| S22 — [Loshchilov & Hutter, AdamW](https://arxiv.org/html/1711.05101v3) | §2, Algorithm 2 và Proposition 2 | Bài 8: tách decay khỏi adaptive gradient. Hệ số công thức cập nhật của bài học theo API S23. |
| S23 — [AdamW, PyTorch 2.9](https://docs.pytorch.org/docs/2.9/generated/torch.optim.AdamW.html) | Pseudocode algorithm, bias correction, weight_decay | Bài 8: cập nhật từng tọa độ, hệ số eta×lambda. Toy bỏ epsilon chỉ khi denominator khác zero. |
| S24 — [Hu et al., LoRA](https://arxiv.org/html/2106.09685v2) | §4.1: factorization, scaling, initialization và merge | Bài 8: rank update và parameter count. Không claim paper đã dùng LoRA hoặc LoRA giữ cùng EER. |
| S29 — [Mahajan, McGill, MMSE estimation](https://adityam.github.io/probability-and-random-signals/mmse-estimation.html) | §6.1, proof/decomposition và vector extension | Bài 6: finite second moment, conditional expectation tối ưu prediction. Không phải định lý xóa thông tin trong encoder. |

<a id="s30--cac-co-che-train-torch"></a>

### S30 — Các cơ chế train PyTorch

Đọc định nghĩa/algorithm của [Dropout](https://docs.pytorch.org/docs/2.9/generated/torch.nn.Dropout.html), [clip_grad_norm_](https://docs.pytorch.org/docs/2.9/generated/torch.nn.utils.clip_grad_norm_.html), [OneCycleLR](https://docs.pytorch.org/docs/2.9/generated/torch.optim.lr_scheduler.OneCycleLR.html), và mục Gradient Scaling của [AMP](https://docs.pytorch.org/docs/2.9/amp.html). Dùng ở bài 8 để giải thích train/eval, clipping, lịch learning rate và underflow. Chưa kiểm recipe runtime hoặc benchmark tốc độ. AMP có thể overflow tùy model; scaling không bảo đảm mọi run ổn định.

## P1 — Paper đã nộp

Nguồn: [SOICT_2026_paper_4308.pdf](<C:/Users/LENOVO/Downloads/SOICT_2026_paper_4308.pdf>). Agent chủ trì trích text cả 14 trang để tra cứu, **đọc lại Method §§3.1–3.3 và Figure 1 ở trang 3–5**, đồng thời xem render ba trang ấy. Việc trích text cả file không đồng nghĩa đọc sâu lại toàn bộ Results/Discussion trong lượt enrich lớp 1.

Đối chiếu: 16→32 kHz, 2,56 s, 128 mel, window/hop 25/10 ms, pad/truncate 256 frames; patch 8×32, grid 32×4, 128 token, width 768, 12 blocks/12 heads, no CLS; 13 readouts, attentive mean/std 1.536 chiều, head 495.632 parameters; CE có bona-fide weight, score z_B−z_S, frozen encoder eval/no-gradient. Đây là **số liệu được paper báo cáo**, không phải tensor/log đã tái chạy. n_fft, centering, mel convention và floor std không được xác nhận đầy đủ chỉ từ đoạn Method.

## Hồ sơ nghiên cứu của subagent và phần chưa kiểm lại

- [Nguồn tiếng nói/DSP](research/nguon-tieng-noi-dsp.md): Oxford, Jurafsky/Martin, Smith/JOS, Shannon, thư viện và các lỗ hổng. Mức đọc rộng trong hồ sơ là báo cáo của subagent.
- [Nguồn toán/deep learning](research/nguon-toan-deep-learning.md): sách, MMSE, rank, CKA, attention, AdamW và LoRA. Subagent dẫn docs PyTorch 2.14; bài học chủ trì dùng docs 2.9 đã đối chiếu riêng.

Chưa đọc lại trọn các chương phụ về RNN, toàn bộ experiments CKA/LoRA/AdamW, toàn sách DSP, hay paper Shannon bản publisher. Shannon trong hồ sơ DSP có mirror để đọc và publisher để định danh, không được ghi thành “đã đọc toàn văn publisher”. Các nguồn này là nhánh đọc thêm; không lấy abstract/trang giới thiệu làm chứng cứ cho cơ chế chưa đọc.

Nhận định như “resampling history có thể là shortcut”, “rank không chứng minh usefulness”, “attention weights chưa là causal evidence” được ghi là suy luận/ phản ví dụ có điều kiện. Không có kết quả mới về cue retention, calibration, EER hay collapse của checkpoint.
