# Root source review — lớp 6

11/10/2026. Root tổng hợp hai dossiers, kiểm các điểm quyết định và viết học liệu. File này giúp người đọc phân biệt direct verification với kết quả delegated và unresolved provenance.

## Direct checks của root

1. Đọc full text PDF14 trang; khi combined tool output bị cắt đã đọc riêng pp.7–8. Render14 trang ở tmp; trực tiếp nhìn pp.3/4/5/7/9/10 để kiểm Fig. 1, caption, Tables1–4, dagger/“—”/n/ranges. Chưa chạy các experiments được PDF báo.
2. Đọc chương 06 và navigation00, chapters 07/08 để định vị curriculum; đọc starts/reports/progress lớp 1–5, các prerequisites/dossiers liên quan. Không đánh dấu đã học chỉ vì học liệu có sẵn.
3. Đọc static JSON/code của v38/v40/v41/v32; đối chiếu encoder builder, fbank, 13 readouts, ASP/classifier, freeze/CE/loader ở v38. Notebook snapshot có zero execution counts/outputs; không suy trials chưa chạy ngoài workspace.
4. Đọc `collapse_metrics.py`, v41 `encode_fixed`/G4/G4b và replacement: token reshape/SVD entropy, pooled-utterance std, filtering/casting. Đây là source semantics, không measurement mới.
5. Online: đọc method/setup relevant sections của Audio-JEPA v2 và AudioMAE v2; Arena v1 training/input/Table 2; ASVspoof2019 v4 A05/A06/reuse; DFADD v1 D3 và author repo correction. Đọc official JEPA config/mel source/HF card và Arena metric source, pinned torchaudio API. Xem [sổ nguồn](../11-SO-DANG-KY-NGUON.md) để biết version và read level.

## Hai dossiers và quyết định tích hợp

- [Pipeline sources](pipeline-sources.md): tiếp nhận parameter crosswalk, upstream setup và pinned official artifacts. Root kiểm arithmetic/input axes, method và điểm version mismatch. Weight files chỉ metadata; không tải/load/hash.
- [Evidence sources](evidence-sources.md): tiếp nhận corpus/score authority, baseline identities và history. Root kiểm Tables1–4 trực tiếp, Arena score/training scope, ASV attack details, DFADD correction và v41 semantics. Những baseline original papers chỉ agent đọc selected sections/abstract vẫn ghi đúng mức đó, không tuyên bố root đọc full text tất cả.
- Table 3 authority là Arena v1 Table 2. Original baseline citations hỗ trợ identity, không riêng DFADD scores. Composite WavLM/HuBERT–ECAPA có component references; không invent một original paper cho exact composite.

## Corrections có tác động tới cách học

| Điểm | Kiểm tra | Tích hợp |
|---|---|---|
| Effective rank 263,1 với 64 clips | Rows là 64×128 tokens; centered bound 768; entropy trênσ | Bài 8 và map 06 sửa units; không gọi bug/rank≤63 |
| “Same batch/native input” G4b | Stream/filter≥10s khác G4≥2,56s; cast 16 kHz rồi32k | Ghi chưa paired IDs; fmax 16 kHz không tạo content>8k |
| Frame count256 | P pad/truncate; C/API snip_edges; conditional 254 | Bài2 tách framing assumption khỏi runtime observation |
| Head0,5 M | Compute13+98.561+397.058=495.632 | Tách trainable và≈85,9 M inference total |
| A05 family/vocoder holdout | A05 VAE+WORLD, A02/A03 WORLD; A06 VC khác thuật toán | Holdout ID, không family/vocoder/speaker disjoint |
| DFADD author/copy | Author isjwdu/DFADD; benchmark HF copy khác;04/2025 correction | Không dùng sai repo; old39,05 chưa thay main41,87 |
| MAE–JEPA gap ASV FT | P 5,87; subtraction rounded13,25−7,39=5,86 | Giữ reported/derived riêng |
| DFADD seed variation | SampleSD frozen 0,351615;FT 3,482332 | Round đúng; ratio≈9,90, không≈9,91 hoặc CI |
| Current JEPA code/card vs weights | Revisions 2026 sau weight-file 2025 | Không gán source config hiện tại cho exact run |
| Common recipe và objective | Native grids/budgets/masks/data realization khác | Transfer contrast, objective attribution là hypothesis |

Trong biên tập đã bỏ các câu/spacing nén gây khó đọc, sửa literal newline trong dossier và kiểm Unicode/Markdown. Học liệu root được đọc lại; structural QA hỗ trợ phát hiện lỗi nhưng chưa thay semantic review.

Root cũng đọc PyTorch CrossEntropyLoss2.14, class-index target/reduction sections: weighted hard-label mean dùng sum target weights ở denominator; probability-target reduction có semantics khác. Lessons chỉ áp dụng công thức cho hard labels được source detector dùng, chưa gán version docs cho runtime main run.

## Unknowns giữ nguyên

Exact dataset/checkpoint hashes, score manifests, environment/main-run toolkit revisions và run-to-checkpoint linkage chưa khóa. Notebook missing outputs không chứng minh never-run. Three-seed SD/ranges chưa significance/CI; baseline uncertainty chưa có. Historical sweeps/random-feature/preflight có scope H/C, chưa completed continued-pretraining result. Source/cleanliness association chưa causal decomposition; output MSE theory chưa encoder-retention proof. Không tra hoặc suy acceptance, không mở hướng nghiên cứu/GPU/venue tiếp theo.

## Boundary và QA

Allowed output trong lớp 6; map 06 có links và corrections nêu trên; global 00 chỉ thêm một paragraph lớp 6. [Baseline snapshot](baseline-hashes.json) lưu 259 protected files từ đầu lượt; **không gồm coordinator 09**, allowed 00/06 hoặc tmp/output. Snapshot bao phủ PDF, manuscript, notebooks, raw local research folders và lớp 1–5/chapters 07–08 có mặt khi chụp. Coordinator không được công cụ viết của lớp 6 chạm tới; không claim hash verification cho file đó. [Validation](validation.json) kiểm hashes sau biên soạn và exact global 00 single-paragraph delta.
