# Vì sao cổng `aasist` lệch trên DFADD và ASVspoof21 LA

Ghi ngày 07/09/2026, sau notebook v39. **Thay thế cách giải thích cũ ("protocol khác"), vốn đã được chứng minh là sai.**

---

## Kết luận

Trên hai tập DFADD và ASVspoof2021 LA, `aasist` của ta cho kết quả **dễ hơn** số công bố. Không phải do tập con, không phải do nhãn. Nguyên nhân là **bản ghi âm khác nhau**.

| tập | ta chấm | arena công bố | lệch |
|---|---|---|---|
| DFADD | 39,05 | 41,86 | **−2,81** |
| ASVspoof21 LA | 8,15 | 11,46 | **−3,31** |
| ADD22-T1 | 47,9161 | 47,91 | +0,006 |
| ASVspoof19 | 0,83 | 0,82 | +0,01 |
| In-the-Wild | 43,02 | 43,00 | +0,02 |
| LibriSeVoc | 37,95 | 37,65 | +0,30 |

Ba tập cuối khớp gần tuyệt đối. Hai tập đầu lệch âm và lớn.

---

## Cách đã loại trừ từng khả năng

**Tập con khác — LOẠI.** Ghép danh sách tệp trong file điểm arena với dữ liệu của ta: DFADD 3 755/3 755, ASVspoof21 LA 148 176/148 176. Trùng khít.

**Nhãn khác — LOẠI.** Tính lại EER từ **chính file điểm arena công bố**, dùng nhãn của ta:

| tập | tính lại từ điểm arena | arena công bố | lệch |
|---|---|---|---|
| DFADD | **41,8272** | 41,86 | 0,03 |
| ASVspoof21 LA | **11,4644** | 11,46 | 0,004 |

Nhãn của ta tái lập đúng số công bố. Vậy tập con và nhãn đều đúng.

*Nhãn DFADD suy được thẳng từ tên tệp, không cần tải dữ liệu:* `p227_164_GradTTS.wav` → người nói VCTK, số câu, tên hệ TTS. Không có hậu tố hệ nghĩa là giọng thật. Phân bố: 755 thật · GradTTS 600 · matcha 600 · NaturalSpeech2 600 · StyleTTS2 600 · pflow 600.

**Lỗi ghép nhãn lúc chấm — LOẠI.** So điểm từng utterance giữa ta và arena trên ASVspoof21 LA: **Spearman 0,8866 · Pearson 0,2042**. Nếu chỉ sai ghép nhãn thì thứ tự phải giống hệt (Spearman ≈ 1) vì EER bất biến với biến đổi đơn điệu. Ví dụ lệch mạnh: `LA_E_1000450` ta +2,80 · arena −6,78.

**Bản audio khác — KHÔNG LOẠI ĐƯỢC, và là lời giải thích duy nhất còn lại.** Đường dẫn trong file điểm arena cho DFADD là `/gpfs/.../DFADD/test_converted2/wav/…` — bản do họ tự chuyển đổi. Ta lấy DFADD qua HuggingFace `SpeechAntiSpoofingBenchmarks/DFADD`. Hai lần chuyển đổi khác nhau cho hai dạng sóng khác nhau, nên cùng mô hình ra điểm khác.

---

## Hệ quả cho bài báo

**Không được so trực tiếp EER của ta với cột công bố của arena.** Chúng được đo trên hai bản ghi âm khác nhau.

**Bảng chuẩn hoá vẫn đúng, và giờ có căn cứ vững hơn.** `aasist` của ta và hệ của ta chạy trên **cùng một bản audio, cùng một đường ống**, nên tỉ số giữa chúng nhất quán nội tại. Đây chính là lý do tồn tại của bảng chuẩn hoá.

**Chưa có bằng chứng nào cho thấy đường ống thiên vị mô hình của ta.** Trên ASVspoof21 LA, bản audio của ta làm `aasist` dễ đi 3,3 điểm, trong khi mô hình của ta vẫn ra 30,76 — tệ nhất bảng 13 hệ. Nếu có lỗi hệ thống kiểu thổi phồng, nó phải thổi cả hai.

**Câu để viết trong mục Experimental setup:**

> We evaluate on the DFADD copy distributed through HuggingFace, which is a different rendition of the audio from the one used for the published leaderboard (`test_converted2`). Re-running the AASIST baseline through our pipeline gives 39.05 % EER against the published 41.86 %, on an identical 3,755-utterance file list with identical labels — we verified this by recomputing EER from the leaderboard's released score file with our own labels, which reproduces 41.83 %. Absolute EERs are therefore not directly comparable across renditions, and all cross-system comparisons in this paper use ratios against our own AASIST run.

---

## Quy tắc mới cho lần sau

Khi cổng lệch quá 1,5 điểm, **đừng ghi "protocol khác" rồi đi tiếp**. Chạy ba bước, tổng cộng chưa tới năm phút và không cần GPU:

1. Đếm utterance trong file điểm arena, so với số của ta.
2. Tính lại EER từ file điểm arena bằng nhãn của ta. Khớp số công bố nghĩa là tập con và nhãn đều đúng.
3. So điểm từng utterance giữa ta và arena. Spearman ≈ 1 là lỗi ghép; Spearman 0,7–0,95 là khác bản audio; gần 0 là ghép sai tệp.

Gói điểm arena có **đủ 14 tập × 11 hệ**, tải một lần bằng `gdown --id 1pI-tvCZt4U__gGGLsCQMdZqLv_QBe4NW`, dùng lại được cho mọi tập.

---

## ASVspoof2021 LA — đã dừng

Notebook `v39` chạy được, cổng lệch, và kể cả sửa được thì `audio_jepa_s*` là **30,76 ± 1,03** (29,70 · 31,76 · 30,83) — đứng cuối bảng 12 hệ mã nguồn mở, nơi thấp nhất là 0,82 và cao nhất 26,60. `jfrz_s1` một seed cho 43,15.

Con số này có ý nghĩa khoa học — ASVspoof21 LA là ASVspoof19 đi qua codec điện thoại và VoIP, cùng người nói cùng attack, và ta rơi từ 7,39 xuống 30,76 — nhưng chưa được đo bằng một cổng đạt, nên **không đưa vào bài**. Để dành cho vòng sau, cùng với nhánh khởi tạo ngẫu nhiên.
