# Lớp 5 — Đánh giá, thực nghiệm và sức mạnh bằng chứng

Ngày 11/10/2026. **Học liệu hoàn tất; người học chưa được đánh giá.** Đích học: tự định nghĩa đại lượng muốn đo, tính metric với score nhỏ, chọn thiết kế phù hợp và giới hạn claim theo evidence. Chưa chọn đề tài, GPU hoặc hội nghị; không chạy lại detector.

## Quy ước và cách học

B=bona fide, S=spoof; score cao nghiêng B; accept B nếu $s\ge\tau$. Error rates là fractions trong [0,1]; EER bảng paper ghi %. “Giảm 2 điểm phần trăm” khác “giảm 2% tương đối”. Các bài dùng cùng convention này, riêng SASV accept **target speaker**, localization dùng spoof-positive và đổi dấu rõ.

Đi theo thứ tự dưới. Mỗi lượt chat học một cơ chế, tính một ví dụ rồi trả lời một câu vì sao. Mở đáp án sau khi tự thử. Những nhánh đào sâu là tùy chọn. Lớp 1–4 có học liệu sẵn, không được coi người học đã hoàn thành; link prerequisite đưa về đúng điểm còn vướng.

| Bài | Câu hỏi trung tâm | Năng lực tự kiểm |
|---|---|---|
| [1. Quyết định và estimand](01-QUYET-DINH-VA-ESTIMAND.md) | Đo cho ai, trên đơn vị nào, ở rule nào? | Tính rates/risk và viết measurement contract |
| [2. Ranking và threshold metrics](02-RANKING-ROC-PR-EER.md) | Một finite list tạo đường cong thế nào? | Ties, AUC, AP, EER interpolation, low-FPR |
| [3. DCF, LLR và calibration](03-DCF-LLR-CALIBRATION.md) | Ranking tốt có đủ cho threshold thật? | Bayes derivation, min/act, Cllr và score scale |
| [4. Tandem, SASV và localization](04-TANDEM-SASV-LOCALIZATION.md) | Task khác đổi trial/rate/denominator nào? | Three-class cost, tandem assumptions, intervals |
| [5. Pooled, macro và nhóm](05-POOLED-MACRO-NHOM.md) | Một trung bình đã thay population/rule gì? | Score-offset toy, shared threshold/reference |
| [6. Split, access và model selection](06-SPLIT-LEAKAGE-SELECTION.md) | Holdout bảo vệ claim nào? | Group components, search optimism, history scope |
| [7. Uncertainty và so sánh thống kê](07-UNCERTAINTY-SO-SANH.md) | Đang ngẫu nhiên hóa run, clip hay domain? | Paired/group draws, recompute metrics, matched tests |
| [8. So sánh, ablation và cơ chế](08-SO-SANH-ABLATION-CO-CHE.md) | Contrast nào cho phép causal claim nào? | Fixed vs tuned recipe, decodability vs reliance |
| [9. Provenance và reproducibility](09-PROVENANCE-REPRODUCIBILITY.md) | Từ file tới số có truy vết được không? | ID-label join, manifests, gates và scope |
| [10. Efficiency và claim nghiên cứu](10-EFFICIENCY-CLAIM.md) | Chất lượng với chi phí và scope nào? | RTF/cache/exposure/frontier; viết claim năm phần |

~~~mermaid
flowchart LR
 A[1 Population và quyết định] --> B[2 Ranking và threshold]
 B --> C[3 Cost và calibration]
 C --> D[4 Task-specific protocol]
 B --> E[5 Aggregation]
 A --> F[6 Split và selection]
 E --> G[7 Uncertainty]
 F --> G
 G --> H[8 Contrast và mechanism]
 H --> I[9 Provenance]
 I --> J[10 Cost và claim]
~~~

## Bằng chứng được ghi thế nào?

- **Lý thuyết/định nghĩa:** công thức cùng assumptions và nguồn primary; không tự trở thành empirical evidence.
- **Reported paper:** PDF đã nộp/chương 06; số liệu được báo cáo, không tái chạy. JEPA là checkpoint encoder tiền huấn luyện AudioSet, downstream weighted CE và nonlinear frozen head; không predictor-error detection.
- **Verified source/code:** đã mở section/code đúng version; khác với runtime checkpoint.
- **Toy tự biên soạn:** scores/groups/plots/scripts mô phỏng dùng để học; không kết quả dự án.

[Sổ nguồn](11-SO-DANG-KY-NGUON.md), [báo cáo enrich](12-BAO-CAO-ENRICH.md), [tiến độ/handoff](13-TIEN-DO-HOC-VA-BAN-GIAO.md), [root review](research/root-source-review.md), [QA](research/validation.json). Gia sư bắt đầu bằng bài 1; không cần đọc toàn bộ mười bài trước khi trả lời.

Quay về [chương 05 map](../05-DANH-GIA-VA-THUC-NGHIEM.md).
