Bài 4 — Metric thuộc đúng task: tandem, SASV và localization#
Mục tiêu và tiền đề#
Tính three-trial cost, hiểu assumptions của tandem và phân biệt frame/interval/boundary evidence. Cần task lớp 2, binary DCF, window/coverage lớp 4.
1. SASV accept target, không accept mọi bona fide#
Standalone CM hỏi B hay S. SASV có enrollment và ba trial types: T=bona fide target speaker, N=bona fide non-target, S=spoof. Chỉ accept T. N là genuine nhưng phải reject vì sai identity. High score lúc này nghiêng T; không đổi T thành “bona fide bất kỳ”.
trong đó , , , priors sum 1. Normalize bằng cho hai trivial accept/reject rules; min aDCF sweep SASV scores, không CM-only B/S score. ASVspoof 5 v0.6 §4.1/Appendix 11.2 áp dụng architecture-agnostic metric cho cả tandem và arbitrary SASV; optional subsystem scores còn cho t-DCF/t-EER. Không gọi Track 2 là chỉ một architecture.
Worked toy: T=[3;1], N=[2;0], S=[1,5;−1], threshold 2. T miss 1/2, N accept 1/2 (tie 2 accept), S accept 0. Priors(0,8;0,1;0,1), costs(1;1;10) cho raw 0,8·0,5+0,1·0,5=0,45; default = min(0,8;1,1)=0,8; normalized 0,5625. CM hoàn hảo acceptT/N rejectS vẫn cho N false accept 100%; không phải hoàn hảo SASV.
2. Tandem: hai decisions và conditional rates#
Cascade accept khi CM accept và ASV accept. Để dạy simplified t-DCF, giả định: CM miss giống nhau cho T/N; CM và ASV decisions conditionally independent given trial class; ASV threshold được fixed. ASV rates: target miss , non-target acceptance , spoof acceptance . Khi ấy:
Thay vào cost:
là residual ASV cost với CM acceptB/rejectS; không bằng 0 khi CM hoàn hảo. Các coefficients phụ thuộc ASV/risk setting; denominator official edition phải giữ đúng code/plan, không thay tùy ý bằng binary default. có thể không dương ở settings bất thường; không tự áp mọi simplified normalized expression; modern code từ chối coefficients âm. Kinnunen et al., t-DCF 2018 §§2–5 và official scoring dossier.
Toy đầy đủ: priors/costs như trên; . Target miss 0,145, non acceptance 0,19, spoof acceptance 0,06. Raw risk 0,116+0,019+0,06=0,195. Coefficients cũng cho 0,195. Đây là raw toy risk. Mã ASVspoof 5 đã pin dùng normalizer , với coefficients không âm và denominator>0: toy cho default 0,7 và normalized 0,195/0,7≈0,278571. Hàm legacy trong cùng file dùng công thức/normalizer khác; t-DCF 2018 ban đầu còn phân biệt các miss costs. Công thức rút gọn ở đây giả định chung target-rejection cost, không chép nguyên mọi edition. Đây chưa phải kết quả challenge.
Counterexample dependence: trên spoof, CM và ASV mỗi bên accept 50%. Nếu luôn accept cùng một nửa thì tandem FA 50%; nếu accept hai nửa đối nhau thì 0%; independence product dự đoán 25%. Marginal rates không đủ xác định joint decision. Muốn empirical joint risk cần paired subsystem scores/trials; t-DCF assumptions cần được đọc theo task/edition. Không dùng standalone EER thay tandem risk.
3. Localization đổi đơn vị measurement#
Dùng spoof-positive local score nếu starting score high=B. Nhưng utterance score chỉ cho một label, chưa có đáng tin. Annotation interval, frame grid, label rule và temporal resolution phải xác định; attention weights không tự ground-truth local scores. PartialSpoof v2 §§2–3 dùng cả utterance và segment labels, không một metric phổ quát cho mọi localization.
Toy timeline 10 s, true fake interval[2,4), predicted[3,5). Half-open endpoints tránh đếm hai lần shared boundary. Measure bằng duration: intersection 1 s, FN 1 s, FP 1 s, TN 7 s. Spoof-positive precision=recall=F1=0,5; accuracy 8/10=0,8; IoU=1/(2+2−1)=1/3. Trên aligned 100 ms nonoverlap frames tương ứng TP 10,FN 10,FP 10,TN 70. Overlapping frames cần assignment rule (center hoặc overlap proportion), không tự cộng frame durations nếu đếm trùng.
Boundary errors: onset|3−2|=1 s, offset|5−4|=1 s. Toy matching criterion yêu cầu cả errors≤ε: ε0,2 fail, ε1 pass. Đây là tolerance matching, khác collar bỏ vùng quanh boundaries khỏi frame scoring. Segment event-F1 còn cần one-to-one matching, IoU/tolerance và handling duplicate predictions. Hai predicted fragments cùng bao một true segment không được mặc định là hai TPs. Không nâng toy conventions thành official PartialSpoof metric.
Range-EER v1 §§2–3 đo overlap duration mà không cần cố định một frame grid. Trong spoof-positive convention, FPR là tổng duration bona fide bị dự đoán spoof chia bona fide duration; FNR là tổng spoof duration bị dự đoán bona fide chia spoof duration. Với toy trên: FPR=1/8, FNR=1/2. Các mẫu số khác precision=TP/(TP+FP). Quét local threshold mới tạo range-EER; một cặp intervals ở một threshold chưa cho EER. Boundary collar không phải mặc định của nguồn này.
4. Neo paper và tự kiểm#
Paper hiện tại là supervised utterance B/S; không enrollment, SASV hay timestamp output. EER/crop không chứng minh localization. Đổi sang SASV/localization cần labels/output/protocol phù hợp, không chỉ metric mới. Chương 06.
- N là bona fide. Vì sao accept N là error trong SASV nhưng đúng trong standalone CM?
- Nếu CM hoàn hảo, vì sao tandem cost còn có thể >0?
- Toy timeline accuracy 80% cho phép nói boundaries chính xác chưa?
- Hai subsystem spoof-acceptance 50% có buộc tandem 25% không?
Đáp án reasoning
- Decisions phục vụ identity target ở SASV, authenticity ở CM. Cùng waveform có label-action semantics khác.
- ASV còn missT/acceptN; có thể >0. CM không thay identity verification.
- Không. Hai boundary errors 1 s và spoof F10,5; long genuine region làm accuracy cao.
- Không; cần joint/conditional dependence assumptions, counterexample cho 0–50%.
Đào sâu: thay phân bố genuine durations rồi so duration-pooled/frame-macro/event-F1. Trước mỗi phép tính khóa label unit, valid frames, overlap, collar và matching policy; không đo trên padding như audio thật.