ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
8 phút đọc · Toàn văn
Mục lục bài · 9 mục

Bài 6 — Threat model, đầu ra và supervision#

Bắt đầu lớp 2 · Trước: codec · Tiếp: protocol

Mục tiêu và kiến thức cần có#

Sau bài này, bạn phải mô tả được đối tượng cần bảo vệ, đường tấn công, thông tin detector nhận, đầu ra và đơn vị gán nhãn. Cần phân biệt task sinh ở bài 2 với task quyết định ở đây. Tiến trình: kịch bản → trial/nhãn → output → supervision → giới hạn suy luận.

1. Threat model đặt nghĩa cho nhãn#

Gọi aa là audio quan sát, ee là enrollment của người cần xác thực, YY là nhãn theo protocol. Hai hệ cùng nhận aa nhưng có thể cần trả lời hai câu hỏi khác nhau.

Kịch bảnĐường điQuyết định cần đưa ra
LA trong ASVspoofTTS/VC được đưa vào đường số sau sensorPhát hiện spoof để hỗ trợ bảo vệ ASV
PA trong ASVspoofBản ghi → loa → phòng → microphone của hệNhận ra replay, kể cả bản ghi ban đầu là giọng thật
ASVspoof2021 DFFile speech, có các điều kiện nén của benchmarkStandalone bona fide/spoof; không có quyết định danh tính ASV
SASVEnrollment ee + probe aaChỉ chấp nhận đúng người và bona fide

LA/PA là đường truy cập/tấn công trong benchmark ASV, không phải họ generator. TTS có thể bị phát lại; một file genuine có thể dùng làm replay spoof. Xem định nghĩa LA/PA trong ASVspoof2019 §2.2 và DF trong ASVspoof2021 §II–III.

SASV có ba loại trial: target bona fide, non-target bona fide, spoof. Non-target bona fide là người thật khác enrollment: binary deepfake detector nên nhận là bona fide, nhưng SASV phải từ chối trial. Đây là khác biệt mục tiêu, không phải lỗi nhãn. ASVspoof5 plan v0.6, §§3–4

2. Đầu ra xác định điều có thể đo#

TaskOutput cần cóAnnotation/evaluation tương ứng
Utterance detectionMột score s(a)s(a)Nhãn clip, false accept/reject hoặc EER theo đúng protocol
Segment detection/localizationsts_t hoặc tập interval [t0,t1)[t_0,t_1)Nhãn theo thời gian, resolution, tolerance/overlap và boundary rule
Attribution closed-setClass trong tập generator đã định nghĩaGenerator label đúng độ hạt; mọi test source thuộc tập đó
Attribution open-setKnown class hoặc unknown/rejectUnknown sources giữ ngoài train, threshold và evaluation rejection
Forensic similarity/source verificationScore quan hệ của hai audio hoặc test với reference setNhãn same/different source, reference protocol và source granularity
SASVScore chấp nhận trial (e,a)(e,a)Target/non-target/spoof trials, chi phí tương ứng

Attribution phải nói đang gán family, model, checkpoint hay vocoder. Hai checkpoint cùng model có thể dùng cùng vocoder; nhận ra vocoder không xác lập checkpoint. Softmax luôn trả một known class không tự tạo cơ chế unknown rejection. Source verification so sánh với reference; một nghiên cứu dùng embedding classifier và cosine similarity, kiểm thử cả source không có trong training. Đó là bằng chứng theo protocol của nghiên cứu, không bảo đảm xác minh mọi generator. Negroni et al., Interspeech2025 §§2–4

Score của cả clip không chứa timestamp. Attention map hoặc saliency cũng chưa thành localization được kiểm chứng nếu thiếu temporal labels, ánh xạ resolution và phép đo tương ứng. PartialSpoof2021 §§2–3

3. Ví dụ hoàn chỉnh: ba file, hai hệ#

Ví dụ do người soạn đặt, không phải kết quả benchmark. Enrollment là giọng Lan. Binary detector trả score cao = bona fide; SASV chấp nhận khi đồng thời đúng Lan và bona fide.

ProbeNhãn binaryTrial SASVQuyết định SASV mong muốn
Lan nói trực tiếpBona fideTarget bona fideChấp nhận
Minh nói trực tiếpBona fideNon-target bona fideTừ chối
TTS bắt chước LanSpoofSpoof nhắm LanTừ chối

Nếu dùng binary detector làm SASV, file Minh có thể được chấp nhận sai dù detector phân loại bona fide hoàn toàn đúng. Cần enrollment và evidence về identity; không thể sửa thiếu thông tin này chỉ bằng đổi threshold binary.

Thêm một file Lan được phát lại qua loa tại cửa: nguồn người nói thật, nhưng trial PA là replay spoof. Thêm file Lan qua neural codec cho cuộc gọi được cho phép: có thể bona fide theo chính sách ứng dụng. Hai nhãn này cùng hợp lý vì threat model khác nhau.

4. Supervision và exposure phải ghi riêng#

Chế độThông tin dùng khi học/thích nghiĐiều phải công bố
Supervised binaryBona fide và spoof có labelNhững attack/source nào đã thấy; target label có dùng không
One-class/anomalyChủ yếu dữ liệu normal/bona fideObjective, contamination, định nghĩa normal; outlier không đồng nghĩa spoof
Semi-supervisedMột phần labeled, phần còn lại unlabeledNguồn unlabeled, pseudo-label và target exposure
Few-shot adaptationSupport set target nhỏSupport/query tách thế nào; speaker/source/utterance overlap
Zero-shot transferKhông dùng loại thông tin target được tuyên bốZero-shot đối với speaker, attack, label hay domain; pretraining có exposure gì
Domain adaptationCó quyền truy cập target dataLabeled/unlabeled, calibration, chọn model và test-time adaptation
Domain generalizationHọc từ source, target không dùng để thích nghiTarget có được xem để chọn checkpoint/threshold/augmentation không

Đây là mô tả chế độ thông tin, không phải bảng bảo đảm hiệu năng. SSL pretraining và supervised downstream có thể nằm trong cùng pipeline. “Không dùng label target” không chứng minh “không từng thấy target audio”. Nếu dùng histogram toàn test set để chuẩn hóa score thì đã có target exposure; một số protocol cấm cách đó. ASVspoof5 v0.6 yêu cầu xử lý trial độc lập và nêu riêng hạn chế về evaluation-set adaptation. Plan §4.3

5. Artifact, watermark và provenance là evidence khác nhau#

Artifact detector học dấu âm học từ dữ liệu. Watermark detector kiểm dấu được chủ động chèn: AudioSeal có output theo sample cho watermark presence, không phải nhãn segment fake tự nhiên. Không có watermark có thể là genuine, generator không tham gia, hoặc watermark bị suy yếu. AudioSeal §§3.1–3.3

Provenance/chữ ký kiểm chứng assertions và signer theo trust model. Chữ ký hợp lệ chưa chứng minh nội dung phát ngôn đúng sự thật hoặc đã có consent: C2PA tách trust vào signer khỏi việc người dùng đánh giá assertions. C2PA specification2.2 §14.1

Audio-only score không đủ để suy ra consent, intent, danh tính, quyền phát hành hoặc factual truth. Ví dụ giọng thật đọc một câu sai vẫn genuine theo nhãn nguồn âm thanh; giọng tổng hợp đọc câu đúng vẫn synthetic.

6. Liên hệ với paper Audio-JEPA#

Paper dùng context encoder từ checkpoint Audio-JEPA đã phát hành làm front-end cho supervised binary utterance detection; downstream tối ưu weighted cross-entropy. Hai logits cho score zbona fide−zspoofz_{\text{bona fide}}-z_{\text{spoof}}, cao là bona fide. Input cố định 2,56s; output là score của input được chấm, không timestamp của vùng giả trong file dài. Paper không huấn luyện lại JEPA objective và không dùng prediction error của JEPA làm spoof score. PDF §§3–4.2

Không gọi hệ này là SASV, localization hay attribution. Có thể đặt câu hỏi các task đó cho nghiên cứu sau, nhưng cần thay annotation/output/protocol trước khi báo kết quả.

7. Bài tập và đáp án giải thích#

  1. Detector cho s(a)=0,8s(a)=0,8 với score cao là bona fide. Có suy ra audio là Lan và Lan đồng ý phát hành không?
  2. Một softmax gán mọi test file vào ba generator A/B/C; test có D. Đây đã là open-set attribution chưa?
  3. Clip 8s có đoạn fake từ 5–6s, hệ chỉ đọc crop đầu 2,56s và trả một score. Có thể dùng score đó làm bằng chứng localization không?
  4. Hệ không train với fake nhưng dùng 100 target clips unlabeled để chọn threshold. Có thể viết “zero target exposure” không?

Đáp án. (1) Không: score chỉ evidence cho nhãn binary theo phân phối/model; không có enrollment/consent. (2) Chưa: phải có unknown/rejection và evaluation nguồn D giữ ngoài train; gán D sang A là forced classification. (3) Không: vùng fake ngoài crop không được quan sát, output cũng không có temporal index. (4) Không: không có label vẫn là exposure/adaptation; mô tả chính xác thông tin đã dùng, rồi kiểm protocol cho phép hay không.

Đào sâu tùy chọn#

Viết một protocol source verification với hai cấp: same-vocoder và same-checkpoint. Chọn cặp khác checkpoint nhưng cùng vocoder làm counterexample. Nếu method không phân biệt cặp đó, giới hạn kết luận ở cấp vocoder; không nâng claim lên checkpoint. Đừng lấy tên task mới làm bằng chứng method đã giải được nó.

DỪNG LẠI & TỰ KIỂM TRA

Bạn đã giải thích được cơ chế trong bài?

↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.