Sổ đăng ký nguồn — Lớp 5#
Ngày đối chiếu: 11/10/2026. Đây là ledger của học liệu, không chứng nhận tái lập mô hình. “Đọc mục liên quan” nghĩa là đã kiểm đoạn phương pháp/công thức được dùng; không có nghĩa đã đọc toàn paper. R=root đọc trực tiếp, M=agent metrics đọc, E=agent evidence đọc. Root đã phản biện và giới hạn các claims trước khi đưa vào bài.
Hồ sơ metrics · Hồ sơ evidence · Root review.
Nguồn tại workspace#
| Nguồn | Vị trí đã kiểm | Mức đọc và cách dùng |
|---|---|---|
| PDF đã nộp SOICT 4308 | §3.1 p4; §4.1 p6; phương pháp/kết quả p6–10; §8 p12 | R đọc các đoạn liên quan, xem render p9–10 và hai bảng. Không tuyên bố đọc lại toàn PDF ở lượt lớp 5. Reported pipeline/parameter counts/EER/seed/development history; không rerun. |
| Chương 06 | Toàn chương; đặc biệt Tables 2/4, recipe và historical notes | R đọc để giữ scope và liên kết evidence; các ghi chép v38–v41 vẫn là history, không tự thành verified runtime. |
| Bản đồ 00, chương 05, literature 07, tự kiểm 08 | Map và phần liên quan | R dùng để phân tích lỗ hổng và giữ ranh giới lớp 5. |
| Start/report/progress lớp 1–4; tiền đề xác suất, protocol, SSL/scoring | Links cụ thể trong mỗi bài | R đọc phần tiền đề cần nối; không đánh dấu người học đã đạt lớp 1–4. |
| Scorer snapshot | ASVspoof 5 commit dưới đây | R lưu file văn bản, SHA-256 được QA ghi. Chỉ gọi ba hàm trên toy; không checkpoint/corpus. |
Metrics, costs và tasks#
| Nguồn primary | Version/vị trí | Đã đọc | Claim dùng và giới hạn |
|---|---|---|---|
| Fawcett, ROC analysis | PRL 2006, §§5–7, Fig 6 | R mục ties/AUC; M toàn bài/mục liên quan | Nhóm tie, finite pair credit và ROC area. Không suy AUC tốt ở mọi low-FPR region. |
| Davis–Goadrich, ROC–PR relationship | ICML 2006, §§3–4 | R PDF/phần ROC–PR | PR interpolation cần giữ count/prevalence; nối thẳng PR là một area convention, không identity với AP. |
| scikit-learn AP docs, ranking code | Docs 1.9.1; commit afe5bcd80ce17fd8ca88c33beb17534bd36423bc | R AP definition; M docs/code functions | AP không nội suy; distinct thresholds/ties. Docs stable có thể đổi; code commit đã pin. Không khẳng định toàn environment dự án chạy version này. |
| Saito–Rehmsmeier | PLOS ONE 2015, theoretical background | M HTML/mục liên quan | PR và prevalence; superiority framing có bối cảnh mất cân bằng, không luật mọi task. Công thức prevalence trong bài được tự suy từ Bayes/counts. |
| Martin et al., DET | Eurospeech 1997, p1 và special points | R mục liên quan | Normal-deviate axes, endpoint infinities. Plot toy clip 1%/99% chỉ để vẽ, không đổi metric; curve thẳng không được xem như proof distribution. |
| ASVspoof 5 Phase 2 Evaluation Plan | v0.6, 28/06/2024, §§4.1–4.3, Appendices 11.1–11.2 | R sections/appendices; M plan 14 p; E phần protocol | Track 1 minDCF, supplementary EER/actDCF/Cllr; Track 2 min aDCF, optional tandem metrics. Priors/costs/score convention thuộc phiên bản này. |
| Official calculate_modules.py | Commit fe23d3053a0889b305d98c9e4cadf418c213d972 | R/M thân DET/EER/actDCF/Cllr/tDCF và legacy | Stable per-trial tie handling, nearest-average EER, threshold predicate khác rank-step label; modern/legacy tDCF khác. Không coi toy tie-aware scorer là official identical implementation. |
| BOSARIS Toolkit | arXiv v1, §§2.2–2.7, PAV 3.2 | R Bayes/DCF/proper cost/calibration sections; M toàn bài | LLR calibration và empirical optimal mapping. ROCCH-EER của toolkit khác adjacent-point EER interpolation dùng trong toy; không đánh đồng. |
| Brümmer–du Preez, PAV | v1, §2, §4.5, §5/Theorem 12 | R method/theorems liên quan; M toàn bài | Tối ưu regular binary proper scoring rules trên sample với monotonicity/weights. Không bảo đảm calibration unseen domain. |
| Guo et al. | ICML 2017, §4.2 temperature scaling | R method/Eq 9 ở p6; identity trong bài được tự suy | Temperature posterior calibration không tự chuyển weighted-CE output thành deployment LLR. Không đọc lại toàn paper ở lượt này. |
| Kinnunen et al., t-DCF | v1, §§2–5, đặc biệt §5 joint probabilities | R method; M plan/code liên quan | Product rates cần conditional independence. Bản 2018 có costs khác; toy chung target miss cost khớp dạng rút gọn modern scorer dưới assumptions nêu rõ. |
| PartialSpoof | v2, dataset/labels §§2–3 | R sections về construction/segment labels | Utterance và segment labels; không đọc lại toàn paper ở lớp 5, không gán multi-resolution claims của bản sau cho bản này. |
| Range-Based EER | v1, §§2–4, Eqs 1–7 | R §§2–3 overlaps/denominators; M toàn bài | Point/frame vs duration/range và resolution; không cung cấp collar phổ quát. |
Thiết kế và uncertainty#
| Nguồn primary | Version/vị trí | Đã đọc | Claim dùng và giới hạn |
|---|---|---|---|
| Cawley–Talbot | JMLR 2010, §§4.1,5 | R mục bias–variance/selection | Noisy criterion có thể bị overfit. Toy winning error 9% là phép liệt kê riêng, không số liệu bài gốc. |
| Kapoor–Narayanan | arXiv 2022 v1, §2.4; journal 2023 khác version | R taxonomy; E taxonomy/recommendations | Separation, nonindependence và mismatch test population. Không có proof exact overlap của corpus dự án. |
| Bouthillier et al. | v1, §§2–3, AppendixC.2 | R sections và pairing caveat; E benchmark recommendations | Data/init/augmentation/search sources of variance; same seed number chưa shared experimental path. |
| Field–Welsh, PDF đã mở | JRSS B2007, §§2–3,5 | E method/consistency/conclusions; R đọc dossier, PDF endpoint root không mở được | Cluster bootstrap theo sampling model; không cite theorem như blanket guarantee cho EER với ít groups. |
| Owen–Eckles | v3, crossed models/product weighting §§2–4, discussion§9 | R sections và scope; E method | Mean-variance theory cho crossed effects. Seed×group EER procedure là design proposal, coverage chưa chứng minh. |
| Shalizi bootstrap lecture | Author lecture 2018, procedure/block bootstrap | R phần liên quan | Empirical approximation, dependence và estimator assumptions; không nominal-coverage guarantee cho toy 2 groups. |
| NIST mean CI | Handbook t interval | R trang formula | t-CI cho mean dưới assumptions; ba seed không tự thỏa assumptions, không population/domain interval. |
| Fagerland et al. | BMC 2013, Methods exact conditional và Discussion | R/E mục liên quan | McNemar matched binary pairs; exact conservative, methods có tradeoffs. Không test EER và không sửa cluster dependence. |
| Lakens | 2017, TOST/equivalence bounds/dependent means | R/E phương pháp | Prespecified margin; corresponding 90%CI ở alpha 0.05 dưới phù hợp t model. Không cắm mọi metric vào t-test. |
| Holm | 1979, §2 scheme/Theorem 1 | R/E scheme/union-bound argument | FWER với valid p-values; không cần independence. Không cứu test feedback làm base p invalid. |
Cơ chế, provenance và cost#
| Nguồn primary | Version/vị trí | Đã đọc | Claim dùng và giới hạn |
|---|---|---|---|
| Hewitt–Liang | EMNLP 2019, §§2–3 control/selectivity | R sections; E intro/control framing | Probe capacity/decodability cần control. Audio reliance counterexample là toy tự biên soạn, không empirical finding của paper NLP. |
| Pineau et al. | JMLR 2021, §5/checklist appendix | R checklist/reporting và discussion; E reproducibility program | Transparency về metrics/error bars/code/data. Không bảo đảm correctness hay acceptance. |
| PyTorch Benchmark tutorial | Web docs 2.14.0+cu 130, CPU/CUDA timing/warm-up | R mục thực thi timing | Thread count/warm-up/sync matters. Chưa đo detector, chưa xác nhận projecttorch version. |
| MLPerf Inference Rules | master, ngày 11/10/2026, chưa pin commit | E scenario/system boundary/timing sections | Ví dụ quality gắn workload/cost; chỉ framing, không compliance claim. |
DeLong 1988 chỉ author-hosted summary, Dietterich 1998 chỉ abstract tin cậy vì OCR lỗi, Geirhos 2020 chỉ abstract/perspective. Chúng được định vị trong dossier evidence; không dùng công thức/theorem chưa đọc. Journal Cllr 2006 chỉ publisher preview: bài 3 dùng formula plan và PAV/BOSARIS, không gán decomposition provenance cho toàn văn chưa tiếp cận.
Các bằng chứng còn thiếu#
Không có raw per-ID scores của paper được audit ở lượt này, không tái chạy checkpoint/baseline, không audit toàn lineage/split, không latency/memory measurement trên model. Vì vậy không mới tuyên bố significance, calibration ngoài miền, objective causality, leakage cụ thể, detector localization hoặc cost frontier thật.
Script và machine QA chỉ kiểm toys, tài liệu và ranh giới file. Source URL stable/master có thể trôi; hai code commits và snapshot local giúp khóa phần implementation được dùng.