# Bài 7 — Lịch sử có version và mức bằng chứng

[Trước](06-JEPA-AUDIOMAE-DOI-CHIEU.md) · [Tiếp](08-CO-CHE-HYPOTHESES.md).

## Mục tiêu và tiền đề

Đọc một trial bằng config, population, n và provenance; cập nhật kết luận khi evidence đổi. Cần [selection lớp 5](../lop-05-danh-gia-thuc-nghiem/06-SPLIT-LEAKAGE-SELECTION.md), [provenance](../lop-05-danh-gia-thuc-nghiem/09-PROVENANCE-REPRODUCIBILITY.md). Nguồn **H**: [handoff ngoài miền](../../toi-uu-ngoai-mien/00-DOC-TRUOC-toi-uu.md), [handoff pretraining](../../tien-huan-luyen-tieng-noi/00-DOC-TRUOC-tien-huan-luyen.md), [preflight](../../tien-huan-luyen-tieng-noi/02-preflight-ket-qua.md), [claims đã rút](../../chung/lich-su-thay-doi-va-tuyen-bo-da-rut.md). Code **C** và read scope: [dossier](research/evidence-sources.md).

## 1. Bốn tầng của một câu lịch sử

“v40 thử patch nhỏ và fail” thiếu bốn tầng: notebook là artifact mẫu; handoff báo một outcome; fail tương đối với mục tiêu; fine-grained cue là explanation cần kiểm. Local notebooks đã đọc không lưu outputs/execution counts. Điều đó chưa chứng minh trials chưa chạy ở Colab/Drive. Version order và ngày notes không tự là execution timestamps.

## 2. Bảng config–evidence

| Version/artifact | Config được ghi | Dataset/metric/n | Số H/P | Conflict hoặc giới hạn |
|---|---|---|---|---|
| Legacy v10/v11; claims-rút A1 | Mel JEPA vs waveform AASIST | CodecFake mirror; EER; n chưa khóa | 32,78 vs 36,80; leave-F03-out 36,02 vs 34,12 | H; mirror nhỏ, F03/F06 được notes báo trùng; không dùng làm main result |
| v19; claims-rút A2 | Sửa cepgmm MFCC thành LFCC-GMM | ASV; finished run chưa xác minh | 23,78 cũ bị rút; notes kể RAM failure | Tên baseline chưa khóa feature; template sửa chưa chứng minh rerun |
| v17/v18; claims-rút A3 | LR 3e−6/1e−5/3e−5/1e−4 | A05/old mirror; n chưa khóa | A05 30,80/30,37/23,40/14,65; mirror 32,78/38/40,58/41,18 | H; ranks đảo trong grid này; mirror đã rút |
| v20–v26 | Arena/gates/multi-seed JEPA–MAE | Main comparisons; n=3 trừ flagged | ADD seed đầu JEPA hơn 0,67; means MAE hơn 2,08 | P §5.2; exact score/checkpoint lineage chưa audit |
| v27 | AASIST graph backend thay ASP | ASV/ITW; n chưa khóa | 8,76 vs 6,78; 65,78 vs 52,00 | H; graph sparsity chưa là isolated cause |
| v30/v32 | Native-style mel 10 s/hop≈39 ms/fmax 16 kHz | A05/ASV/ITW; n chưa khóa | A05 2,46 vs≈12; ASV 9,41 vs6,78; ITW 55,18 vs52 | H; nhiều input axes cùng đổi |
| v35/epoch notes | 2/3/4 vs6 epochs | DFADD/Libri; n từng arm chưa khóa | Libri best 40,82 ở epoch3, AASIST37,95 | H; chưa proof overfitting không tồn tại |
| Fusion notes | Z-score ba seed | ASV; ba constituent systems | Fusion7,17 vs best6,78 | H; best seed có selection, calibration/diversity chưa kiểm |
| v36/v37, Table 2 | Frozen/full, basic backend chung | Năm corpora; n=3, ITW FT n=1 | DFADD8,47 vs10,75; Libri47,38 vs41,96 | P; regime effect tùy corpus |
| v38 | Frozen JEPA/MAE/random, nonlinear head | DFADD/ASV; H n=3 | Random DFADD8,66±2,25 vs8,47±0,35; ASV14,25±1,48 vs17,70±1,44 | H+C; không equivalence/collapse proof; random FT13,68 n=1 |
| v39 | ASV2021 LA gate | EER; JEPA n=3 theo notes | AASIST8,15 vs11,46; JEPA30,76±1,03 | H; gate mismatch chưa giải; không đưa vào main tables |
| v40, notes 09/09/2026 | Patch4×32 vs8×32 | DFADD/Libri; H n=3 | 9,72±1,07 vs10,75±3,48; Libri50,01±0,61 vs41,96±2,93 | H+C; N 128→256, init/compute/optimization cùng đổi |
| v41/preflight+replacement | Input diagnostics, AMP/storage/restore gates | Speech batches, token metrics | Rank263,1/247,9; cos0,6793/0,7192; notes báo7 gates xanh | H+C; filters khác, không khóa paired IDs; chưa completed SSL study |
| Submitted PDF, Tables1–4 | Final reported recipe | DFADD AASIST gate | 41,87 ours/41,86 published | P; old39,05 chưa nối exact run-to-audio lineage |

[v38 notebook](../../notebook/audio_jepa_v38_ablation_dongbang_dfadd.ipynb), [v40](../../notebook/audio_jepa_v40_quet_patch_thoi_gian.ipynb), [v41](../../notebook/audio_jepa_v41_preflight_tien_huan_luyen.ipynb) là code references. Tên checkpoint Drive trong notes chỉ là history pointer; chưa xác nhận file local hoặc exact weights được load.

## 3. Worked case: A05 từng chọn LR ngược target

Bốn LR configs có A05 EER giảm đơn điệu nhưng mirror EER tăng đơn điệu. Spearman giữa hai vectors là −1, không ties. Bài học có scope: development objective có thể chưa đại diện target shift. Bốn configs trên mirror đã rút chưa tạo luật “A05 vô dụng”. Main paper dùng final checkpoint và công bố exploratory access.

**Phản ví dụ:** dev có nhiều families/source/channel giữ ngoài train có thể tương quan tốt với target khác. Representativeness là quan hệ giữa dev và estimand, chưa là thuộc tính tuyệt đối của một attack name.

## 4. Worked case: 39,05 khác 41,87

[Audio/version check](../../chung/kiem-chung-cong-va-ban-audio.md) ghi rendition discrepancy; author DFADD repo xác nhận từng có correction. Nhưng exact earlier audio bytes/revision và run checksums chưa khóa. Hai con số không được trung bình hoặc thay lẫn nhau. Câu đúng: “Notes cũ báo 39,05; submitted PDF báo 41,87; exact executed lineage giữa snapshots chưa được khóa trong lớp này.”

## 5. Tự kiểm

1. Notebook không outputs có cho phép nói trial chưa xảy ra không?
2. v40 Libri tệ hơn 8,05 pp có bác bỏ mọi fine-grained cue hypothesis không?
3. Gates pass có chứng minh continued pretraining cải thiện detector chưa?
4. Câu “chưa thử RawBoost” cần giới hạn scope thế nào?

<details>
<summary>Đáp án và reasoning</summary>

1. Không: chỉ biết trạng thái bản lưu local.
2. Chưa: tokens/init/compute/optimization cùng đổi; observation giới hạn config ấy.
3. Chưa: readiness/restore/timing chưa là pretraining trajectory và downstream results.
4. “Không tìm thấy kiểm hệ thống RawBoost trong paper, handoffs và templates đã đọc.” Scope tìm kiếm chưa là absolute never.

</details>

**Đào sâu:** chọn một hàng; viết observation, explanation và unknown. Rút claim khi evidence đổi là kỹ năng nghiên cứu; negative trial riêng chưa tự thành đóng góp.
