Bài 2 — ROC, DET, AUC, PR và EER từ finite scores#
Mục tiêu và notation#
Tính sweep có endpoints/ties, phân biệt ranking với rule, biết EER/AP cần convention. Tiền đề bài 1. B-positive: TP=accepted B, FN=rejected B, FP=accepted S, TN=rejected S. . Accuracy/F1 ở threshold cụ thể vẫn hợp lệ; cho B-positive.
1. Sweep decision sets#
Toy B=[0,9;0,6;0,4], S=[0,8;0,4;0,1]. Tied 0,4 chuyển cùng nhau để là deterministic threshold rule. accept-all, reject-all cho finite scores. NaN/invalid scores phải xử lý trước metric.
| Miss | FA | TPR | B precision | B recall | |
|---|---|---|---|---|---|
| −∞ | 0 | 1 | 1 | 3/6 | 1 |
| 0,4 | 0 | 2/3 | 1 | 3/5 | 1 |
| 0,6 | 1/3 | 1/3 | 2/3 | 2/3 | 2/3 |
| 0,8 | 2/3 | 1/3 | 1/3 | 1/2 | 1/3 |
| 0,9 | 2/3 | 0 | 1/3 | 1 | 1/3 |
| +∞ | 1 | 0 | 0 | Undefined | 0 |
ROC vẽ FPR–TPR; DET vẽ FA–miss trên trục normal quantile . Rates 0/1 cho vô hạn trên DET; plot toy dùng clipping được ghi trên hình, không thay rates thật. Martin et al.1997 DET.
2. ROC-AUC và cặp ranking#
Empirical AUC với half-credit cho ties:
Toy: B0,9 thắng 3; B0,6 thắng 2; B0,4 thắng 1 và hòa 1=1,5. Tổng 6,5/9=13/18≈0,722222. ROC nối tuyến tính tie-block points cho cùng area. Đây là ranking summary, chưa likelihood/calibration. Fawcett 2006 §§5–7; official ROC-AUC.
Strictly increasing global transform giữ pair comparisons/attainable decision sets khi threshold map thành trong exact arithmetic. Fixed numerical threshold không tự đổi. Sign reversal đảo polarity; clipping/rounding/saturation tạo ties. Sample-dependent offsets không có guarantee global ranking. Không chọn polarity bằng eval labels cho đẹp số.
AUC trung bình mọi FPR nên không tự kiểm vùng FPR 0,001. thì một FA đã 0,01; thiếu empirical resolution 0,001. 0/100 không chứng minh population FA 0. Low-FPR claim cần population/interval và miss tại rule phù hợp.
Nếu một rule đã chốt trước eval và các S trials là iid Bernoulli với cùng FA probability p, quan sát0FA trong n trials có likelihood . One-sided95% upper bound ở zero count giải : . n=100 cho≈0,029513; n=10.000 cho≈0,000299528 (xấp xỉ3/n). Đây là inversion cho fixed rule và iid trials, không CI của EER, không áp nguyên nếu threshold được chọn trên chính test hoặc clips cùng speaker phụ thuộc. Đây là derivation tự biên soạn, không số detector thật.
3. EER không luôn có exact equality#
Toy chính có equality ở : EER 1/3=33,333%. Đây là descriptive eval sweep, chưa threshold từ dev để vận hành.
Toy không equality: B=[0,9;0,5], S=[0,8;0,7;0,1]. Points kẹp equality: ở và ở . Interpolation rate space cho 0,5. Trong exact rational arithmetic, nearest có tie; floating-point có thể phá equality số học. Nếu chủ động dùng hai tie choices: chọn first rồi average rates cho 7/12≈0,583333; chọn second cho 5/12≈0,416667. Phải khóa routine/tie-breaking, không gọi mọi scorer cùng một EER chuẩn.
Interpolation rate-space có thể là randomized mixture hai rules, không đảm bảo numerical threshold nào cho rates ấy trên finite list. Numerical-threshold interpolation còn tùy scale. Một số official code sort từng sample/cumulative sum: mixed-label ties tạo intermediate points không realizable bằng deterministic threshold. Tái lập challenge cần pinned scorer; để học rule ở đây dùng tie blocks. Hồ sơ code ghi behavior/version. Không khẳng định routine toy là Arena routine paper.
4. PR prevalence và AP khác trapezoid#
Cùng TPR 0,9/FPR 0,1: positive prevalence 0,5 cho precision 0,9; prevalence 0,01 cho 0,009/(0,009+0,099)=1/12. Nếu positive là fake hiếm, đổi label và score ; recall_S là rejected-S fraction tại corresponding rule. Không dùng B-precision rồi gọi fake precision.
Non-interpolated AP=, descending scores và ties theo block. Toy có recall increments 1/3 tại B0,9 (P1), B0,6 (P2/3), block 0,4 (P3/5): AP=. Trapezoidal PR area nối points với no-prediction precision 1 cho 133/180≈0,738889. AP và PR trapezoid không đồng nghĩa. ROC randomization maps sang PR bằng count ratios nên nói chung tạo đường cong phi tuyến; diện tích hình thang ở đây chỉ là phép tổng hợp được khai báo, không achievable PR interpolation mặc định. Official AP definition; Davis–Goadrich 2006 §4.

5. Paper, counterexample và tự kiểm#
Paper báo EER%/B−S, chưa PR/calibration/low-FPR deployment. EER 52% n=1 không cho phép đảo dấu rồi thay số paper; convention phải fixed. Chương 06 Table 2.
Counterexample: B=[3;4], S=[1;2] có EER 0/AUC 1. Dời tất cả+100 giữ ranking nhưng threshold 2,5 accept-all, FA 1. Bài 3 sẽ tính cost.
- F1 B-positive toy chính tại 0,6?
- Vì sao tie 0,4 không được chia theo file order để tạo threshold mới?
- 10.000 S có 0 FA chứng minh zero population FA chưa?
- Trừ offset riêng từng domain có bảo toàn pooled AUC không?
Đáp án reasoning
- TP 2,FP 1,FN 1 nên 4/6=2/3.
- Cùng score có cùng decision theo ≥. Chia block dùng order/identity ngoài score; nếu scorer làm thì là summary convention, cần disclosed.
- Chưa; sampling uncertainty và generator/population scope còn giới hạn.
- Không; within-domain order có thể giữ nhưng cross-domain comparisons đổi, bài 5 tính cụ thể.
Đào sâu: chứng minh sign-reversed half-tie AUC=1−AUC; tìm hai ROC cùng area nhưng low-FPR miss khác. Script chỉ kiểm toy, không metric dự án.