# Bài 5 — Đọc Tables 2–4 bằng chênh lệch có điều kiện

[Trước](04-DU-LIEU-PROTOCOL-BASELINE.md) · [Tiếp](06-JEPA-AUDIOMAE-DOI-CHIEU.md).

## Mục tiêu và tiền đề

Tính contrasts và đọc đúng uncertainty. Cần [EER/ranking](../lop-05-danh-gia-thuc-nghiem/02-RANKING-ROC-PR-EER.md), [pooled/group](../lop-05-danh-gia-thuc-nghiem/05-POOLED-MACRO-NHOM.md), [uncertainty](../lop-05-danh-gia-thuc-nghiem/07-UNCERTAINTY-SO-SANH.md). Bảng dưới là **P**, kiểm từ render PDF trang 9–10 gồm captions/footnotes/ranges; `pp` là điểm phần trăm EER.

## 1. Table 2: regime effect tùy corpus

| Corpus | Frozen EER % | Fine-tuned EER % | AASIST | ΔFT−Frozen từ rounded means (pp) |
|---|---:|---:|---:|---:|
| DFADD | 8,47 ± 0,35 | 10,75 ± 3,48 | 41,87 | +2,28 |
| ASV2019 LA eval | 17,70 ± 1,44 | 7,39 ± 0,69 | 0,83 | −10,31 |
| ADD2022 T1 | — | 44,10 ± 2,04 | 47,92 | Không tính |
| LibriSeVoc | 47,38 ± 4,19 | 41,96 ± 2,93 | 37,95 | −5,42 |
| In-the-Wild | 47,55 ± 8,55 | 52,00 (n=1) | 43,02 | +4,45; n khác nhau |

“—” là **chưa chạy**. ± là **sample SD qua ba training seeds**, không phải CI của population utterances. Ô n=1 chưa đo seed variation.

Worked case: fine-tuning giảm 10,31 pp trên ASV nhưng tăng 2,28 pp trên DFADD. Chưa có kết luận fine-tuning luôn tốt/xấu. Trên Libri, fine-tuned tốt hơn frozen dù cả hai kém AASIST; “frozen tốt ngoài miền” cần corpus scope.

## 2. Mean và SD khi biết raw seed results

P §5.1 trang 8: DFADD frozen 8,74/8,59/8,07; fine-tuned 7,57/10,20/14,47.

$$\bar e=\frac{\sum_{k=1}^3e_k}{3},\qquad s=\sqrt{\frac{\sum_k(e_k-\bar e)^2}{2}}.$$

T: frozen mean≈8,4667, SD≈0,3516; fine-tuned mean≈10,7467, SD≈3,4823. Round thành 8,47±0,35 và 10,75±3,48. SD ratio≈9,90 mô tả các runs này; chưa giải thích nguyên nhân hoặc xác suất run tương lai thắng. Không khôi phục seed triplets còn thiếu từ mean±SD/ranges.

## 3. Table 4: reported gap và derived gap

| Corpus/regime | JEPA | MAE | Gap MAE−JEPA P | Gap từ rounded means T | Ranges P, JEPA / MAE |
|---|---:|---:|---:|---:|---|
| ASV fine-tuned | 7,39±0,69 | 13,25±0,57 | +5,87 | +5,86 | 6,78–8,13 / 12,61–13,70 |
| ASV frozen | 17,70±1,44 | 25,25±0,68 | +7,55 | +7,55 | 16,18–19,04 / 24,47–25,74 |
| DFADD frozen | 8,47±0,35 | 11,04±0,75 | +2,57 | +2,57 | 8,07–8,74 / 10,18–11,54 |
| ADD fine-tuned | 44,10±2,04 | 42,02±2,85 | −2,08 | −2,08 | 41,75–45,29 / 39,00–44,65 |

Làm tròn mỗi mean có thể làm phép trừ lệch 0,01; giữ reported 5,87 và derived 5,86 riêng. Ranges không chồng nhau ở ba hàng đầu là descriptive observation. Min/max ba runs chưa là mean±SD interval, CI hoặc significance test; evaluation-sampling uncertainty cũng chưa được đo.

DFADD MAE→JEPA giảm **2,57 pp**, relative reduction **2,57/11,04≈23,28%**. Own AASIST 41,87→8,47 giảm 33,40 pp, tương ứng≈79,77%. Luôn nêu denominator/reference.

P §5.2 trang 9: seed đầu ADD có JEPA tốt hơn 0,67 pp nhưng mean ba seed có MAE tốt hơn 2,08 pp. Một draw chưa đại diện chắc chắn mean qua runs; seed đầu vẫn là observation hợp lệ.

## 4. Table 3: thứ hạng kèm phạm vi

DFADD: XLSR+SLS 7,54; JEPA frozen 8,47; TCM 8,88; XLSR-Mamba 10,69; JEPA fine-tuned 10,75. Frozen JEPA cách best listed system 0,93 pp. Total params 85,9 M so 340 M, ratio≈3,96. Chưa có latency/input/hardware/batch chung để suy tốc độ. Published scores đến từ Arena v1 Table 2; training recipe/seed accounting khác.

**Phản ví dụ:** AASIST 0,83 tốt hơn JEPA fine-tuned 7,39 trên ASV, nhưng 41,87 kém JEPA frozen 8,47 trên DFADD. Không có thứ hạng toàn cầu nếu chưa định nghĩa metric/population/weights. Average per-corpus EER cũng chưa bằng pooled EER.

## 5. Polarity và EER > 50

Paper cố định high=B; ITW fine-tuned EER 52,00 n=1 là kết quả ở convention đó. Flip sau nhìn test labels là model selection; rule cần chốt trên development data rồi đánh giá độc lập. EER > 50 chưa chứng minh mọi score pair đảo chiều. [Scoring lớp 4](../lop-04-ky-thuat-detector/08-INFERENCE-SCORING-FUSION.md).

Arena metric code ở revision trong [sổ nguồn](11-SO-DANG-KY-NGUON.md) chọn điểm có |FAR−FRR| nhỏ nhất rồi lấy trung bình, không nội suy. Revision code đọc hiện tại chưa là exact main-run revision. Không hứa finite-sample score flip luôn cho chính xác 100−EER.

## 6. Tự kiểm

1. “Cải thiện 2,57% trên DFADD” thiếu gì? Viết hai câu đúng.
2. Ranges không chồng đủ paired CI chưa?
3. Có thể gán EER 50 cho frozen ADD “—” để tính mean năm corpora không?
4. Table 3 có chứng minh reliability ở deployment threshold cố định không?

<details>
<summary>Đáp án và reasoning</summary>

1. “Giảm 2,57 pp so với MAE 11,04% EER”; hoặc “giảm tương đối≈23,28% so với MAE ở DFADD frozen”.
2. Chưa: cần outcomes, pairing, group structure/raw scores và inferential design. Cùng seed ID chưa tự đảm bảo valid pairing.
3. Không: chưa chạy không phải observation; imputation thêm assumption và đổi estimand.
4. Chưa: cần dev threshold, operational prior/cost, calibration và independent evaluation.

</details>

**Đào sâu:** viết observation cho một ô với corpus copy, recipe, regime, n, metric, SD unit, baseline source và development access. Xem [claim–evidence](09-CLAIM-DONG-GOP.md).
