Bài 5 — Đọc Tables 2–4 bằng chênh lệch có điều kiện#
Mục tiêu và tiền đề#
Tính contrasts và đọc đúng uncertainty. Cần EER/ranking, pooled/group, uncertainty. Bảng dưới là P, kiểm từ render PDF trang 9–10 gồm captions/footnotes/ranges; pp là điểm phần trăm EER.
1. Table 2: regime effect tùy corpus#
| Corpus | Frozen EER % | Fine-tuned EER % | AASIST | ΔFT−Frozen từ rounded means (pp) |
|---|---|---|---|---|
| DFADD | 8,47 ± 0,35 | 10,75 ± 3,48 | 41,87 | +2,28 |
| ASV2019 LA eval | 17,70 ± 1,44 | 7,39 ± 0,69 | 0,83 | −10,31 |
| ADD2022 T1 | — | 44,10 ± 2,04 | 47,92 | Không tính |
| LibriSeVoc | 47,38 ± 4,19 | 41,96 ± 2,93 | 37,95 | −5,42 |
| In-the-Wild | 47,55 ± 8,55 | 52,00 (n=1) | 43,02 | +4,45; n khác nhau |
“—” là chưa chạy. ± là sample SD qua ba training seeds, không phải CI của population utterances. Ô n=1 chưa đo seed variation.
Worked case: fine-tuning giảm 10,31 pp trên ASV nhưng tăng 2,28 pp trên DFADD. Chưa có kết luận fine-tuning luôn tốt/xấu. Trên Libri, fine-tuned tốt hơn frozen dù cả hai kém AASIST; “frozen tốt ngoài miền” cần corpus scope.
2. Mean và SD khi biết raw seed results#
P §5.1 trang 8: DFADD frozen 8,74/8,59/8,07; fine-tuned 7,57/10,20/14,47.
T: frozen mean≈8,4667, SD≈0,3516; fine-tuned mean≈10,7467, SD≈3,4823. Round thành 8,47±0,35 và 10,75±3,48. SD ratio≈9,90 mô tả các runs này; chưa giải thích nguyên nhân hoặc xác suất run tương lai thắng. Không khôi phục seed triplets còn thiếu từ mean±SD/ranges.
3. Table 4: reported gap và derived gap#
| Corpus/regime | JEPA | MAE | Gap MAE−JEPA P | Gap từ rounded means T | Ranges P, JEPA / MAE |
|---|---|---|---|---|---|
| ASV fine-tuned | 7,39±0,69 | 13,25±0,57 | +5,87 | +5,86 | 6,78–8,13 / 12,61–13,70 |
| ASV frozen | 17,70±1,44 | 25,25±0,68 | +7,55 | +7,55 | 16,18–19,04 / 24,47–25,74 |
| DFADD frozen | 8,47±0,35 | 11,04±0,75 | +2,57 | +2,57 | 8,07–8,74 / 10,18–11,54 |
| ADD fine-tuned | 44,10±2,04 | 42,02±2,85 | −2,08 | −2,08 | 41,75–45,29 / 39,00–44,65 |
Làm tròn mỗi mean có thể làm phép trừ lệch 0,01; giữ reported 5,87 và derived 5,86 riêng. Ranges không chồng nhau ở ba hàng đầu là descriptive observation. Min/max ba runs chưa là mean±SD interval, CI hoặc significance test; evaluation-sampling uncertainty cũng chưa được đo.
DFADD MAE→JEPA giảm 2,57 pp, relative reduction 2,57/11,04≈23,28%. Own AASIST 41,87→8,47 giảm 33,40 pp, tương ứng≈79,77%. Luôn nêu denominator/reference.
P §5.2 trang 9: seed đầu ADD có JEPA tốt hơn 0,67 pp nhưng mean ba seed có MAE tốt hơn 2,08 pp. Một draw chưa đại diện chắc chắn mean qua runs; seed đầu vẫn là observation hợp lệ.
4. Table 3: thứ hạng kèm phạm vi#
DFADD: XLSR+SLS 7,54; JEPA frozen 8,47; TCM 8,88; XLSR-Mamba 10,69; JEPA fine-tuned 10,75. Frozen JEPA cách best listed system 0,93 pp. Total params 85,9 M so 340 M, ratio≈3,96. Chưa có latency/input/hardware/batch chung để suy tốc độ. Published scores đến từ Arena v1 Table 2; training recipe/seed accounting khác.
Phản ví dụ: AASIST 0,83 tốt hơn JEPA fine-tuned 7,39 trên ASV, nhưng 41,87 kém JEPA frozen 8,47 trên DFADD. Không có thứ hạng toàn cầu nếu chưa định nghĩa metric/population/weights. Average per-corpus EER cũng chưa bằng pooled EER.
5. Polarity và EER > 50#
Paper cố định high=B; ITW fine-tuned EER 52,00 n=1 là kết quả ở convention đó. Flip sau nhìn test labels là model selection; rule cần chốt trên development data rồi đánh giá độc lập. EER > 50 chưa chứng minh mọi score pair đảo chiều. Scoring lớp 4.
Arena metric code ở revision trong sổ nguồn chọn điểm có |FAR−FRR| nhỏ nhất rồi lấy trung bình, không nội suy. Revision code đọc hiện tại chưa là exact main-run revision. Không hứa finite-sample score flip luôn cho chính xác 100−EER.
6. Tự kiểm#
- “Cải thiện 2,57% trên DFADD” thiếu gì? Viết hai câu đúng.
- Ranges không chồng đủ paired CI chưa?
- Có thể gán EER 50 cho frozen ADD “—” để tính mean năm corpora không?
- Table 3 có chứng minh reliability ở deployment threshold cố định không?
Đáp án và reasoning
- “Giảm 2,57 pp so với MAE 11,04% EER”; hoặc “giảm tương đối≈23,28% so với MAE ở DFADD frozen”.
- Chưa: cần outcomes, pairing, group structure/raw scores và inferential design. Cùng seed ID chưa tự đảm bảo valid pairing.
- Không: chưa chạy không phải observation; imputation thêm assumption và đổi estimand.
- Chưa: cần dev threshold, operational prior/cost, calibration và independent evaluation.
Đào sâu: viết observation cho một ô với corpus copy, recipe, regime, n, metric, SD unit, baseline source và development access. Xem claim–evidence.