# Bài 6 — Threat model, đầu ra và supervision

[Bắt đầu lớp 2](00-BAT-DAU-LOP-02.md) · Trước: [codec](05-CODEC-RVQ-AUDIO-LM.md) · Tiếp: [protocol](07-DATASET-VA-PROTOCOL.md)

## Mục tiêu và kiến thức cần có

Sau bài này, bạn phải mô tả được đối tượng cần bảo vệ, đường tấn công, thông tin detector nhận, đầu ra và đơn vị gán nhãn. Cần phân biệt task sinh ở bài 2 với task quyết định ở đây. Tiến trình: **kịch bản → trial/nhãn → output → supervision → giới hạn suy luận**.

## 1. Threat model đặt nghĩa cho nhãn

Gọi $a$ là audio quan sát, $e$ là enrollment của người cần xác thực, $Y$ là nhãn theo protocol. Hai hệ cùng nhận $a$ nhưng có thể cần trả lời hai câu hỏi khác nhau.

| Kịch bản | Đường đi | Quyết định cần đưa ra |
|---|---|---|
| LA trong ASVspoof | TTS/VC được đưa vào đường số sau sensor | Phát hiện spoof để hỗ trợ bảo vệ ASV |
| PA trong ASVspoof | Bản ghi → loa → phòng → microphone của hệ | Nhận ra replay, kể cả bản ghi ban đầu là giọng thật |
| ASVspoof2021 DF | File speech, có các điều kiện nén của benchmark | Standalone bona fide/spoof; không có quyết định danh tính ASV |
| SASV | Enrollment $e$ + probe $a$ | Chỉ chấp nhận đúng người **và** bona fide |

LA/PA là đường truy cập/tấn công trong benchmark ASV, không phải họ generator. TTS có thể bị phát lại; một file genuine có thể dùng làm replay spoof. Xem định nghĩa LA/PA trong [ASVspoof2019 §2.2](https://arxiv.org/pdf/1911.01601) và DF trong [ASVspoof2021 §II–III](https://arxiv.org/pdf/2210.02437).

**SASV có ba loại trial:** target bona fide, non-target bona fide, spoof. Non-target bona fide là người thật khác enrollment: binary deepfake detector nên nhận là bona fide, nhưng SASV phải từ chối trial. Đây là khác biệt mục tiêu, không phải lỗi nhãn. [ASVspoof5 plan v0.6, §§3–4](https://www.asvspoof.org/file/ASVspoof5___Evaluation_Plan_Phase2.pdf)

## 2. Đầu ra xác định điều có thể đo

| Task | Output cần có | Annotation/evaluation tương ứng |
|---|---|---|
| Utterance detection | Một score $s(a)$ | Nhãn clip, false accept/reject hoặc EER theo đúng protocol |
| Segment detection/localization | $s_t$ hoặc tập interval $[t_0,t_1)$ | Nhãn theo thời gian, resolution, tolerance/overlap và boundary rule |
| Attribution closed-set | Class trong tập generator đã định nghĩa | Generator label đúng độ hạt; mọi test source thuộc tập đó |
| Attribution open-set | Known class hoặc unknown/reject | Unknown sources giữ ngoài train, threshold và evaluation rejection |
| Forensic similarity/source verification | Score quan hệ của hai audio hoặc test với reference set | Nhãn same/different source, reference protocol và source granularity |
| SASV | Score chấp nhận trial $(e,a)$ | Target/non-target/spoof trials, chi phí tương ứng |

Attribution phải nói đang gán **family, model, checkpoint hay vocoder**. Hai checkpoint cùng model có thể dùng cùng vocoder; nhận ra vocoder không xác lập checkpoint. Softmax luôn trả một known class không tự tạo cơ chế unknown rejection. Source verification so sánh với reference; một nghiên cứu dùng embedding classifier và cosine similarity, kiểm thử cả source không có trong training. Đó là bằng chứng theo protocol của nghiên cứu, không bảo đảm xác minh mọi generator. [Negroni et al., Interspeech2025 §§2–4](https://www.isca-archive.org/interspeech_2025/negroni25_interspeech.pdf)

Score của cả clip không chứa timestamp. Attention map hoặc saliency cũng chưa thành localization được kiểm chứng nếu thiếu temporal labels, ánh xạ resolution và phép đo tương ứng. [PartialSpoof2021 §§2–3](https://www.isca-archive.org/interspeech_2021/zhang21ca_interspeech.pdf)

## 3. Ví dụ hoàn chỉnh: ba file, hai hệ

**Ví dụ do người soạn đặt, không phải kết quả benchmark.** Enrollment là giọng Lan. Binary detector trả score cao = bona fide; SASV chấp nhận khi đồng thời đúng Lan và bona fide.

| Probe | Nhãn binary | Trial SASV | Quyết định SASV mong muốn |
|---|---|---|---|
| Lan nói trực tiếp | Bona fide | Target bona fide | Chấp nhận |
| Minh nói trực tiếp | Bona fide | Non-target bona fide | Từ chối |
| TTS bắt chước Lan | Spoof | Spoof nhắm Lan | Từ chối |

Nếu dùng binary detector làm SASV, file Minh có thể được chấp nhận sai dù detector phân loại bona fide hoàn toàn đúng. Cần enrollment và evidence về identity; không thể sửa thiếu thông tin này chỉ bằng đổi threshold binary.

Thêm một file Lan được phát lại qua loa tại cửa: nguồn người nói thật, nhưng trial PA là replay spoof. Thêm file Lan qua neural codec cho cuộc gọi được cho phép: có thể bona fide theo chính sách ứng dụng. Hai nhãn này cùng hợp lý vì threat model khác nhau.

## 4. Supervision và exposure phải ghi riêng

| Chế độ | Thông tin dùng khi học/thích nghi | Điều phải công bố |
|---|---|---|
| Supervised binary | Bona fide và spoof có label | Những attack/source nào đã thấy; target label có dùng không |
| One-class/anomaly | Chủ yếu dữ liệu normal/bona fide | Objective, contamination, định nghĩa normal; outlier không đồng nghĩa spoof |
| Semi-supervised | Một phần labeled, phần còn lại unlabeled | Nguồn unlabeled, pseudo-label và target exposure |
| Few-shot adaptation | Support set target nhỏ | Support/query tách thế nào; speaker/source/utterance overlap |
| Zero-shot transfer | Không dùng loại thông tin target được tuyên bố | Zero-shot đối với speaker, attack, label hay domain; pretraining có exposure gì |
| Domain adaptation | Có quyền truy cập target data | Labeled/unlabeled, calibration, chọn model và test-time adaptation |
| Domain generalization | Học từ source, target không dùng để thích nghi | Target có được xem để chọn checkpoint/threshold/augmentation không |

Đây là mô tả chế độ thông tin, không phải bảng bảo đảm hiệu năng. SSL pretraining và supervised downstream có thể nằm trong cùng pipeline. “Không dùng label target” không chứng minh “không từng thấy target audio”. Nếu dùng histogram toàn test set để chuẩn hóa score thì đã có target exposure; một số protocol cấm cách đó. ASVspoof5 v0.6 yêu cầu xử lý trial độc lập và nêu riêng hạn chế về evaluation-set adaptation. [Plan §4.3](https://www.asvspoof.org/file/ASVspoof5___Evaluation_Plan_Phase2.pdf)

## 5. Artifact, watermark và provenance là evidence khác nhau

Artifact detector học dấu âm học từ dữ liệu. Watermark detector kiểm dấu được chủ động chèn: AudioSeal có output theo sample cho **watermark presence**, không phải nhãn segment fake tự nhiên. Không có watermark có thể là genuine, generator không tham gia, hoặc watermark bị suy yếu. [AudioSeal §§3.1–3.3](https://arxiv.org/pdf/2401.17264)

Provenance/chữ ký kiểm chứng assertions và signer theo trust model. Chữ ký hợp lệ chưa chứng minh nội dung phát ngôn đúng sự thật hoặc đã có consent: C2PA tách trust vào signer khỏi việc người dùng đánh giá assertions. [C2PA specification2.2 §14.1](https://spec.c2pa.org/specifications/specifications/2.2/specs/C2PA_Specification.html#_trust_model)

Audio-only score không đủ để suy ra consent, intent, danh tính, quyền phát hành hoặc factual truth. Ví dụ giọng thật đọc một câu sai vẫn genuine theo nhãn nguồn âm thanh; giọng tổng hợp đọc câu đúng vẫn synthetic.

## 6. Liên hệ với paper Audio-JEPA

Paper dùng context encoder từ checkpoint Audio-JEPA đã phát hành làm front-end cho **supervised binary utterance detection**; downstream tối ưu weighted cross-entropy. Hai logits cho score $z_{\text{bona fide}}-z_{\text{spoof}}$, cao là bona fide. Input cố định 2,56s; output là score của input được chấm, không timestamp của vùng giả trong file dài. Paper không huấn luyện lại JEPA objective và không dùng prediction error của JEPA làm spoof score. [PDF §§3–4.2](<C:/Users/LENOVO/Downloads/SOICT_2026_paper_4308.pdf>)

Không gọi hệ này là SASV, localization hay attribution. Có thể đặt câu hỏi các task đó cho nghiên cứu sau, nhưng cần thay annotation/output/protocol trước khi báo kết quả.

## 7. Bài tập và đáp án giải thích

1. Detector cho $s(a)=0,8$ với score cao là bona fide. Có suy ra audio là Lan và Lan đồng ý phát hành không?
2. Một softmax gán mọi test file vào ba generator A/B/C; test có D. Đây đã là open-set attribution chưa?
3. Clip 8s có đoạn fake từ 5–6s, hệ chỉ đọc crop đầu 2,56s và trả một score. Có thể dùng score đó làm bằng chứng localization không?
4. Hệ không train với fake nhưng dùng 100 target clips unlabeled để chọn threshold. Có thể viết “zero target exposure” không?

**Đáp án.** (1) Không: score chỉ evidence cho nhãn binary theo phân phối/model; không có enrollment/consent. (2) Chưa: phải có unknown/rejection và evaluation nguồn D giữ ngoài train; gán D sang A là forced classification. (3) Không: vùng fake ngoài crop không được quan sát, output cũng không có temporal index. (4) Không: không có label vẫn là exposure/adaptation; mô tả chính xác thông tin đã dùng, rồi kiểm protocol cho phép hay không.

## Đào sâu tùy chọn

Viết một protocol source verification với hai cấp: same-vocoder và same-checkpoint. Chọn cặp khác checkpoint nhưng cùng vocoder làm counterexample. Nếu method không phân biệt cặp đó, giới hạn kết luận ở cấp vocoder; không nâng claim lên checkpoint. Đừng lấy tên task mới làm bằng chứng method đã giải được nó.
