Hồ sơ nguồn evidence — Lớp 5 Audio-JEPA#
Cập nhật: 11/10/2026. Phạm vi: nguồn thống kê/phương pháp gốc và hướng dẫn tác giả để củng cố quyết định về uncertainty, comparison, leakage, mechanism, provenance và cost. Đây là hồ sơ bằng chứng, không phải khẳng định rằng một phương pháp đã được chạy trên corpus của dự án.
Cách đọc hồ sơ#
Mỗi mục ghi rõ phiên bản/đoạn thực sự đã mở. “Đọc toàn văn” ở đây nghĩa là đã mở và đọc những đoạn liên quan của toàn bài, không có nghĩa đã kiểm từng dòng hoặc tái lập thí nghiệm. Các DOI/URL là link nguồn; ngày truy cập của hồ sơ là 11/10/2026. Khi nguồn chỉ mở được abstract, hồ sơ ghi như vậy và giới hạn claim theo abstract.
1. Bootstrap phải khớp với thiết kế và estimand#
Nguồn đã đọc.
- Field & Welsh, “Bootstrapping clustered data,” JRSS B 69 (2007), 369–390, toàn văn PDF. Đã đọc Summary, §1, mô tả các chiến lược bootstrap, các kết quả consistency/Corollary về cluster bootstrap, simulation và §5 Conclusions (PDF 22 trang; trang tạp chí 369–388).
- Owen & Eckles, “Bootstrapping data arrays of arbitrary order,” Annals of Applied Statistics 6(3) (2012), 895–927, arXiv v3, 27/09/2012. Đã đọc abstract và các phần mô hình crossed random effects, product reweighting, kết quả dưới heteroscedastic crossed random effects và giới hạn kết luận. Đây là bản v3; journal reference và DOI được xác nhận ở trang arXiv.
Claim có thể dùng. Field–Welsh chứng minh tính phù hợp của cluster bootstrap dưới hai mô hình one-way cụ thể với số cluster tăng; bài cũng cho thấy lựa chọn resampling/model ảnh hưởng consistency. Owen–Eckles nghiên cứu crossed/multifactor arrays: resample/reweight riêng từng factor rồi nhân các weights, không lấy từng cell độc lập. Phương pháp được chứng minh cho ước lượng variance của mean dưới các điều kiện random-effects được nêu; không có bootstrap “chính xác” chung cho mọi crossed structure.
Áp dụng thận trọng cho Audio-JEPA.
- Bootstrap utterance IID chỉ mô tả biến thiên theo utterance nếu utterance thật sự độc lập cho mục tiêu suy luận. Nhiều crop của cùng recording, nhiều recording của cùng speaker, hay nhiều attack của cùng generator tạo cụm; phải resample đơn vị độc lập phù hợp với claim (thí dụ speaker/source/generator), giữ nguyên toàn bộ quan sát con của cụm được chọn.
- Training seed và evaluation group thường là hai factor bắt chéo: mỗi seed được chấm trên cùng test groups. Bootstrap seed hoặc test utterance riêng lẻ chỉ ước lượng một mặt của uncertainty. Mục tiêu đề xuất là
Δ = E_{seed, group}[M_A(seed, group) − M_B(seed, group)]với M xác định rõ cách pool/macro. Trong mỗi replicate, draw seed(s) và group(s) theo thiết kế; dùng cùng group draw cho A và B. Chỉ pair seed giữa hai hệ nếu seed thật sự ghép các nguồn ngẫu nhiên chung (data order, augmentation, mask draws) theo protocol; cùng số seed nhưng khác stochastic path không tự tạo pair hợp lệ. - Bản Owen–Eckles bảo đảm mean dưới crossed random-effects assumptions; nó không chứng minh percentile CI cho EER là chính xác. Với EER, tính lại đường ROC/EER cho từng replicate, không bootstrap các lỗi nhị phân tại một threshold rồi gọi đó là CI của EER. Nêu rõ chọn pooled EER hay macro EER vì hai estimand khác nhau.
- EER cần cả bona fide và spoof. Replicate không có một lớp làm EER không xác định. Không âm thầm loại các replicate lỗi sau khi xem kết quả. Nếu thiết kế cho phép, chọn/resample cluster unit chứa cả hai lớp; nếu cluster chỉ thuộc một lớp thì có thể stratify theo lớp ở cấp cluster và ghi estimand/điều kiện. Với cluster lồng/chéo không thể stratify sạch, cần nêu tỉ lệ replicate không ước lượng được và chốt cách xử lý trước khi chạy; không có quy tắc sửa phổ quát được chứng minh trong hai bài trên.
- Với tuyên bố về unseen generator, generator/family mới có thể là đơn vị suy luận chính. Hàng nghìn utterance từ rất ít generators không thay cho nhiều independent generators. CI hẹp ở cấp utterance không tự bảo đảm generalization qua generator.
2. Seed SD, CI và nguồn biến thiên của pipeline#
Nguồn đã đọc. Bouthillier et al., “Accounting for Variance in Machine Learning Benchmarks,” MLSys 2021. Đã đọc phần giới thiệu và mô hình benchmark (§2), discussion/recommendations (§3–5 theo cấu trúc bài), và đoạn tái lập thực nghiệm về software/seed/RNG (Appendix). Bài mô hình hóa biến thiên từ data sampling, initialization, augmentation và hyperparameter optimization; các tác giả cảnh báo rằng lặp initialization đơn thuần bỏ các nguồn biến thiên đáng kể.
Claim và giới hạn. Hiệu năng của pipeline là đại lượng ngẫu nhiên do data, optimization, augmentation, seed và chọn hyperparameter. Lặp vài seed của config thắng không đo hết biến thiên của toàn quy trình, đặc biệt khi config đã được chọn bằng cùng development data. Bài chủ yếu khảo sát supervised benchmark; mô hình xác suất của họ là hướng dẫn để nhận diện sources of variance, không phải một công thức bắt buộc cho detector Audio-JEPA.
Quy tắc báo cáo. Với n=3, ghi từng seed, mean và sample SD s; không gọi mean ± SD là 95% CI. Nếu giả định độc lập và gần chuẩn trên run-level score được chấp nhận, t-interval cho mean là mean ± t(0.975,n−1)·s/√n; với n=3, t(0.975,2)=4.303, nên khoảng rất rộng và phụ thuộc mạnh vào giả định. Bootstrap ba seed không tạo thêm thông tin về đuôi phân phối. Báo seed uncertainty riêng với sample/group uncertainty; không dùng score bootstrap của một checkpoint để thay seed variation.
Toy số học. Ba EER của A là [6, 8, 10]%: mean 8%, sample SD 2 pp, t-interval minh họa khoảng [3.0, 13.0]%. Đây là CI của mean run-level theo giả định trên, không phải khoảng “mọi run mới sẽ nằm trong đó”, và không phải CI sample-level. Với ba seed, nên trình bày số thô và tránh kết luận chắc từ overlap/không-overlap CI.
3. Comparison phải trùng metric, pairing và null hypothesis#
Nguồn đã đọc.
- Dietterich, “Approximate Statistical Tests for Comparing Supervised Classification Learning Algorithms,” Neural Computation 10(7) (1998), trang MIT Press. Đã đọc abstract của tác giả/publisher và metadata; bản PDF mirror mở được nhưng extraction/OCR công thức không đủ tin cậy để trích chi tiết theorem. Abstract báo cáo so sánh Type-I error/power của năm test: test hai tỷ lệ và paired t trên repeated random splits có Type-I error cao trong tình huống nghiên cứu; McNemar có Type-I error thấp cho một lần chạy; 5×2 CV test đề xuất khi có thể train nhiều lần. Không khái quát kết quả này thành quy tắc đúng cho mọi clustered benchmark.
- Fagerland, Lydersen & Laake, “The McNemar test for binary matched-pairs data: mid-p and asymptotic are better than exact conditional,” BMC Medical Research Methodology 13, 91 (2013), toàn văn PMC. Đã đọc abstract, phần định nghĩa matched pairs/McNemar, exact conditional, simulation và Discussion/Conclusions. Kết quả mô phỏng: exact conditional rất bảo thủ; mid-p gần exact unconditional trong các kịch bản đã xét nhưng không bảo đảm level như exact; asymptotic không correction mạnh hơn nhưng có thể vi phạm nominal level nhẹ. Kịch bản của bài là paired binary proportions, không phải nhiều crop phụ thuộc trong cùng speaker.
- DeLong, DeLong & Clarke-Pearson, Biometrics 44(3) (1988), 837–845. Đã đọc metadata và author-hosted summary tại Duke Scholars, không đọc được toàn văn trên endpoint công khai. Summary nói rõ phương pháp nonparametric dùng generalized U-statistics để ước lượng covariance giữa các AUC tương quan. Claim ở đây giới hạn ở việc chọn paired DeLong cho AUC khi cùng đơn vị test chấm bởi các score systems; không trích công thức hoặc theorem chưa đọc.
- Ojala & Garriga, “Permutation Tests for Studying Classifier Performance,” JMLR 11 (2010), 1833–1863, PDF. Đã đọc abstract, §1 và §3 (hai test, pp. 1833–1836) và phần mô phỏng/thảo luận. Label permutation kiểm tra quan hệ X–y; restricted permutation các features trong lớp hỏi classifier có dùng dependency giữa feature để cải thiện classification hay không. Đây không phải một phép paired permutation tổng quát để so hai EER.
Chọn phép so.
| Câu hỏi | Phép so phù hợp hơn | Điều kiện/giới hạn |
|---|---|---|
| Hai detector có khác tỷ lệ dự đoán đúng ở một threshold cố định không? | McNemar trên cặp output đúng/sai cho cùng sample; xem exact/mid-p/asymptotic phù hợp số discordant pairs | Threshold phải được chọn theo dev/protocol; không đổi thành test-EER. McNemar bỏ qua mọi cặp đồng kết quả; không tính correlation giữa nhiều utterance cùng speaker/group. |
| Hai score systems có khác ROC-AUC không? | DeLong cho correlated ROC/AUC trên cùng test cases | AUC, không phải EER/minDCF; các trường hợp clustered hoặc hệ thống được train/search ngẫu nhiên cần thêm cách xử lý group/seed. Nguồn gốc chỉ đọc summary, nên xem đây là hướng chọn method, không là bản thẩm định theorem. |
| Hai hệ khác nhau trên một metric tùy ý (EER/minDCF, v.v.)? | Paired cluster bootstrap cho interval; hoặc paired randomization/swap test nếu null exchangeability hợp lý | Swap toàn bộ output A/B trong từng independent unit/group; giữ nguyên pair. Không swap độc lập từng utterance khi speaker/source có dependence. Chốt statistic, grouping và null trước. |
| Có class association hay model đang dùng feature dependency? | Ojala–Garriga label permutation hoặc restricted within-class feature permutation | Đây là hai null khác nhau; không được gọi “shortcut reliance” chỉ từ label-permutation p-value. |
Degenerate comparisons. McNemar không có thông tin nếu không có discordant pairs (n12+n21=0); bài Fagerland nêu rõ asymptotic test undefined khi cả hai count bằng 0. DeLong/ROC metrics cần có cả lớp. Report số pair/group hữu dụng và replicate không ước lượng được, không biến p undefined thành zero.
4. “Không có khác biệt” cần margin, không phải p > .05#
Nguồn đã đọc. Lakens, “Equivalence Tests: A Practical Primer for t Tests, Correlations, and Meta-Analyses,” Social Psychological and Personality Science 8(4) (2017), 355–362, toàn văn PMC. Đã đọc abstract, phần giới thiệu, định nghĩa TOST/SESOI, công thức independent/Welch và các phần về equivalence bounds/diễn giải.
Claim. p > .05 trong test khác biệt chỉ cho thấy dữ liệu chưa bác bỏ null zero; nó không chứng minh hiệu ứng nhỏ. TOST đặt trước lower/upper bounds dựa trên smallest effect size of interest rồi test hai null một phía: Δ ≤ −ΔL và Δ ≥ ΔU. Chỉ khi bác bỏ cả hai mới hỗ trợ equivalence theo bounds/estimand ấy.
Áp dụng. Nếu muốn nói Audio-JEPA và baseline tương đương về EER, chọn trước một margin ±δ (ví dụ mức chênh EER mà sẽ không làm thay quyết định sử dụng; con số phải do decision context xác lập, không ước lượng sau khi thấy scores), thực hiện paired TOST cho difference trên estimand được khai báo. Cần CI tương ứng nằm trọn trong bounds. TOST primer trực tiếp bàn về t-tests; áp dụng sang EER/seed×cluster phải chọn estimator/test có assumptions phù hợp, không cắm raw EER vào paired t mà không kiểm tra.
5. Search, nhiều comparisons, leakage và ancestry#
Nguồn đã đọc trong lượt này. Kapoor & Narayanan, “Leakage and the Reproducibility Crisis in ML-based Science,” Patterns 4 (2023), 100804, arXiv v1 (14/07/2022), toàn văn 29 trang. Đã đọc abstract, §1, taxonomy §2.4 (đặc biệt L1 split/dedup, L3.1 temporal, L3.2 nonindependence, L3.3 test sampling), §2.2 và model-info-sheet recommendations/appendix. Paper survey 17 fields/329 affected papers (bản v1; journal article là 2023), và nói kết quả là lower bound của các vấn đề họ phát hiện, không phải prevalence estimate phổ quát.
Claim quan trọng cho split. Mục L3.2 nói train/test nonindependence là leakage khi scientific claim nói về phân phối khác dependency structure; một ví dụ là các sample khác nhau nhưng cùng người/đơn vị. Họ khuyến nghị split theo dependency structure. Điều này hỗ trợ audit speaker/source/recording ancestry. Nó không chứng minh chỉ dùng hai dataset có ancestry chung đồng nghĩa có exact leakage; overlap, shared entity, pretraining exposure, cùng generator family và intended in-domain claim là các câu hỏi tách biệt cần inventory riêng.
Search winner’s curse. Root đã trực tiếp đọc Cawley & Talbot, JMLR 11 (2010), 2079–2107, đặc biệt §4.1 và §5. Họ chỉ ra tối ưu selection criterion có noise sẽ overfit criterion và tạo selection bias; kết luận áp dụng cho mọi selection trên finite sample, không chỉ CV. Hồ sơ này ghi nguồn theo lượt đọc của root, không gán là phần tôi đã mở.
Nhiều giả thuyết. Holm, “A Simple Sequentially Rejective Multiple Test Procedure,” Scandinavian Journal of Statistics 6 (1979), 65–70, bản PDF đã đọc. Đã đọc abstract, §1 và §2/theorem. Holm step-down bảo vệ family-wise Type-I error cho mọi tập hợp giả thuyết đúng theo điều kiện của bài và cho phép từng test statistic có dạng khác nhau miễn tính được p-level hợp lệ. Xác định trước family (ví dụ các objective-vs-baseline confirmatory tests) rồi điều chỉnh; không gom tuỳ tiện những comparisons có estimand khác nhau. Kết quả sau nhiều metric/domain/head sweep nên mang nhãn exploratory nếu không kiểm soát multiplicity.
Quy tắc cho nghiên cứu. Khóa primary metric, primary domain/group split, contrasts, margin, và analysis plan trước khi mở final holdout. Mọi cấu hình/hypothesis được chọn sau khi nhìn thấy holdout đều mở rộng search space và làm holdout thành development data; cần test mới hoặc ghi đúng trạng thái exploratory. Common downstream recipe đo transfer trong recipe; mỗi model được tune cùng budget đo attainable performance; neither alone isolates objective causally. Muốn claim effect của objective, cố định data, architecture/capacity, updates/tokens, optimizer policy, augmentation and downstream protocol càng nhiều càng tốt; ghi mọi thứ đổi đồng thời. Seed đồng nhất chỉ có ý nghĩa pair nếu randomness thực sự ghép.
6. Probe decodability không chứng minh detector reliance#
Nguồn đã đọc. Hewitt & Liang, “Designing and Interpreting Probes with Control Tasks,” EMNLP-IJCNLP 2019, 2733–2743, PDF. Đã đọc abstract và introduction (PDF pp. 1–2) và control-task/selectivity framing. Họ hỏi probe accuracy có phản ánh representation hay probe học task; dùng control tasks và selectivity để kiểm probe capacity. Scope thực nghiệm là linguistic properties/ELMo; bài không đưa theorem về audio spoof cues.
Nguồn bổ sung đã đọc ở mức abstract/perspective. Geirhos et al., “Shortcut learning in deep neural networks,” Nature Machine Intelligence 2 (2020), 665–673. Đã đọc abstract/publisher summary, không đọc full text. Claim chỉ dùng ở mức khái niệm: rule có thể thắng benchmark chuẩn nhưng không chuyển sang điều kiện test khó hơn.
Bậc bằng chứng đề xuất. Probe đoán source/domain từ representation chỉ cho thấy cue có thể truy cập (decodability); control/small probe giúp giới hạn probe capacity nhưng vẫn không chứng minh decision head thực sự dùng cue. Reliance cần can thiệp cue/source–label relation, đo thay đổi score/decision/performance và kiểm soát thay đổi content, transcript, codec, speech quality, generator và class prevalence. OOD evaluation theo held-out source/generator/domain kiểm transfer; một perturbation làm cả speech hỏng chưa cô lập forensic cue. Đây là nguyên tắc thiết kế suy luận từ hai nguồn trên và chương 05, không phải một bài báo đã chứng minh Audio-JEPA dùng shortcut.
7. Metric/protocol provenance và reproducibility#
Nguồn đã đọc.
- Pineau et al., “Improving Reproducibility in Machine Learning Research,” JMLR 22(164) (2021), PDF. Đã đọc abstract, đoạn triển khai reproducibility program/checklist, và câu hỏi checklist về định nghĩa metric, mô tả error bars, central tendency/variation (PDF §§4–5, pp. 9–11). Báo cáo nêu reproducibility là cùng code/data đạt kết quả tương tự; checklist là trợ giúp transparency, không phải proof/reproducibility score.
- ASVspoof 5 Evaluation Plan, Phase 2, Document Version 0.6 (28/06/2024). Đã đọc trang bìa/version, §1–4, bảng metrics, phần evaluation metrics appendix (PDF pp. 1–4, 13–14). Plan ghi track, polarity/positive score convention, priors/costs cho a-DCF/t-DCF, metric definitions và reference implementation/evaluation package. Nó tự nói plan còn evolve; đây là phiên bản challenge cụ thể, không phải định nghĩa metric áp dụng cho mọi detector.
Ghi provenance tối thiểu cho mỗi hàng kết quả. Metric name + implementation/version/hash; score direction; positive class; pooling/macro rule; threshold-selection source; class priors/costs; utterance/group IDs and labels; dataset/release/protocol hash; exact split lineage/pretraining exposure audit; checkpoint/hash; preprocessing/crop/valid-length; seed/RNG and run config; raw per-ID scores and software/hardware. Report cần cho phép từ raw score tái tính metric và xác định chính xác cái gì đã được xem trong model selection.
8. Efficiency: đo hệ thống đã định nghĩa và nối quality–cost#
Nguồn đã đọc.
- MLPerf Inference Rules,
master, truy cập 11/10/2026. Đã đọc §§1.1–2, §3 scenarios, §5 Load Generator, §7.1 timing of pre/post-processing, và Appendix A early-stopping/confidence rule. Đây là nhánhmaster, có thể thay đổi; không lưu commit SHA trong lượt này. Rules định nghĩa system under test gồm cả phần cứng và phần mềm, một run gồm processing + latency + quality theo scenario; quy định consistency/replicability và timing pre/post processing. Không xem đây là protocol cứng bắt buộc cho paper Audio-JEPA. - Ren et al., “FastSpeech 2,” ICLR 2021 / arXiv:2006.04558, author research page. Đã đọc abstract và phần tác giả mô tả RTF, inference latency, hardware và batch size trong author report. Họ định nghĩa RTF là thời gian (giây) hệ thống cần để tạo một giây waveform; công thức đó có thể dùng làm ratio cho thời gian phân tích so với thời lượng audio, nhưng task gốc là TTS, không phải detector.
Recipe đo đề xuất. Định nghĩa trước system boundary: waveform vào hay feature vào; có tính load/decode/resample/log-mel và transfer không; thiết bị/precision/thread count/batch/clip length; warm-up và cache; số lần lặp, median và tail latency (p95 nếu đủ runs), throughput dưới batch/load rõ ràng. Báo RTF = end-to-end processing seconds / input audio seconds; thấp hơn 1 nghĩa xử lý nhanh hơn thời gian audio theo ratio này, nhưng không thay được per-clip latency hoặc tail latency, và không đo startup/streaming delay đầy đủ. Dùng cùng hardware/software boundary giữa hệ; tách inference cost khỏi training cost.
Không báo mỗi parameter count: ghi total/trainable params, peak memory, latency/RTF, throughput/batch, training wall-clock/accelerator-hours, sample exposures/steps. Vẽ quality–cost curve theo metric đã chọn (ví dụ EER/actDCF theo threshold rule) và cost tại operating setup; một checkpoint thắng chất lượng nhưng chậm hơn không tự động “tốt hơn”. MLPerf làm rõ đo speed phải gắn với quality target và workload/system scenario.
Toy worked-case đề nghị cho lớp#
Mục đích là dạy mỗi phép kiểm trả lời câu hỏi nào; số liệu sau là đồ chơi, không phải kết quả dự án.
- So checkpoint cố định trên cùng tập. Có raw scores của A/B cho mỗi ID; lập bảng
ID, speaker/source group, label, score_A, score_B. Chọn trước EER hoặc AUC. Resample speaker/source groups với replacement; mỗi draw dùng y hệt group IDs cho A/B, giữ mọi utterance trong group, tính lại metric đầy đủ rồi lấyΔ = metric(A) − metric(B). Ghi bootstrap CI, B (số replicate), group unit và class-degenerate policy. Nếu một group chứa cả bona/spoof thì whole-group draw giữ hai lớp; nếu group/class structure không cho điều đó thì chốt stratified/constrained design trước, không vứt replicate sau khi nhìn Δ. - Tách seed. Cho EER A theo 3 runs
[6,8,10]%, B[7,8,9]%. Báo hai hàng mean/SD cùng các giá trị thô; đây chưa là evidence equivalence. Nếu các seed được ghép bởi common random stream, tínhd_seedtrên từng cặp và trình bày paired seed CI; nếu không, coi training seeds độc lập. Với n=3, nhấn mạnh khoảng bất định rộng và fragility; sample bootstrap vẫn chỉ lấy lại ba điểm đã quan sát. - Chọn test đúng. Threshold cố định từ dev → so binary decisions trên cùng IDs bằng McNemar. AUC → paired DeLong cho cùng independent cases. EER/actDCF → paired group bootstrap / cluster-level randomization có null ghi trước. Không dùng McNemar làm test của EER, cũng không dùng DeLong cho EER.
- Không-significance vs equivalence. Chốt
δcó ý nghĩa thực tế (the decision maker specifies it before test), chạy paired TOST choΔvới bounds[-δ,+δ]; yêu cầu cả hai one-sided tests qua và CI nằm trong bounds.p>.05của superiority test thôi không chứng minh tương đương. - Selection và mechanism. Nếu thử 4 SSL objectives × 3 heads × 5 metrics × 4 domains, khai báo một contrast/metric primary, lập family hypotheses và điều chỉnh multiplicity (Holm là baseline đơn giản) hoặc đặt phần còn lại là exploratory; final holdout chỉ mở một lần. Probe source từ encoder là decodability. Chỉ sau đó can thiệp source cue/label relation và kiểm held-out source/generator mới có bằng chứng gần hơn về reliance/robustness.
- Quality-cost. Trên cùng device, cùng clip-length mix, batch 1: warm up, chạy nhiều lần, ghi p50/p95 latency, RTF, peak memory và EER/actDCF theo fixed rule. Lặp batch lớn riêng như throughput operating point; không gộp số này với batch-1 interactive latency.
Facts chưa hoàn tất#
- Tôi chưa đọc full DeLong 1988; chỉ có metadata + author-hosted summary. Mọi câu về DeLong trong hồ sơ bị giới hạn ở mục tiêu correlated AUC/covariance; cần toàn văn trước khi dùng theorem/chi tiết implementation.
- Dietterich full PDF mirror bị OCR lỗi; chỉ abstract có thể đọc tin cậy. Dùng abstract cho lựa chọn test/Type-I error ở setting tác giả nghiên cứu, không trích công thức hoặc khẳng định phổ quát.
- MLPerf link là
master, không pin commit. Nếu biến thành benchmark protocol chính thức của paper, pin tag/commit và workload cụ thể. - Không có nguồn nào ở đây chứng minh ancestry/shared pretraining overlap của một corpus cụ thể trong dự án; đó cần metadata, source genealogy và audit data riêng. Không chạy corpus/model trong lượt nghiên cứu này.