ajaudio / studyAUDIO-JEPA · RESEARCH NOTES
18 phút đọc · Toàn văn
Mục lục bài · 7 mục

Hồ sơ nguồn kỹ thuật cho training detector#

Cập nhật và kiểm tra nguồn trực tuyến: 11-10-2026. Tài liệu này bổ sung chứng cứ METHOD cho Chương 04, không phải danh sách kỹ thuật đã chạy trong thí nghiệm Audio-JEPA.

Phạm vi và cách đọc bằng chứng#

Tôi đã đọc các công thức/method và đoạn thực nghiệm liên quan trong nguồn chính bên dưới, không chỉ dựa trên abstract. Mỗi mục ghi rõ phần thực đọc và giới hạn suy luận. Các link tới paper là link chính thức của nhà xuất bản/ACL/arXiv; link code là repository được paper hoặc tác giả trỏ tới khi thấy được. Commit được cố định ở những repository có thể đối chiếu được.

PDF bài ACL 2026 tải tạm ngoài workspace vào thư mục TEMP để trích văn bản khi web-reader báo timeout. Bản HTML arXiv v3 sau đó cũng mở được trực tiếp; nội dung METHOD §§3–5 đã được đọc. Không lưu PDF hay dữ liệu trong workspace. Không tải corpus/checkpoint, không train model và không chạy lại v38–41.

Recipe đã được xác nhận trong manuscript#

Phần phương pháp đã đối chiếu ghi downstream supervised weighted cross-entropy, tăng trọng số bona fide khoảng 9,6, sáu epoch, batch 32; augmentation duy nhất được báo cáo là một time mask tối đa 16 frame và một frequency mask tối đa 16 mel-bin. Đây là hai mask trên feature, không phải waveform RawBoost, codec/reverb/noise augmentation, crop/speed perturbation, mixup, hay dữ liệu tổng hợp. Không gán các kỹ thuật ở dưới cho experiment nếu manuscript không nói đã chạy.

Phân chia A05 là giữ lại attack, không tự động đồng nghĩa speaker/source/generator-family-disjoint. Crop độ dài cố định có thể làm mất một fake segment nếu segment chỉ chiếm một phần clip; kết quả PartialSpoof bên dưới là cảnh báo về điều kiện nhãn/crop, không phải khẳng định đã xảy ra trong checkpoint này.

Loss, sampling và ý nghĩa đúng của trọng số#

Cross-entropy, BCE và sampler trong PyTorch#

Nguồn và phần đã đọc. PyTorch 2.9 CrossEntropyLoss, công thức reduction cho class-index targets và probability/soft targets; BCEWithLogitsLoss, công thức pos_weight và reduction; WeightedRandomSampler, tham số và ví dụ.

Claim hữu ích. Với hard class-index targets, từng loss CE được nhân trọng số class của nhãn thật. Khi reduction là mean, PyTorch chia tổng loss cho tổng trọng số target không bị ignore, không chia đơn giản cho batch size. Với probability targets/soft labels, công thức docs ghi mean chia số phần tử N. BCEWithLogitsLoss nhân hạng positive bằng pos_weight; mean chia số output elements. Đây là semantics khác với hard-target weighted CE. WeightedRandomSampler đặt xác suất lấy cho từng index, trọng số không cần tổng bằng 1, và mặc định lấy có hoàn lại nên một mẫu có thể lặp.

Ví dụ/caveat. Với một hard-target sample duy nhất, CE class weight bị triệt tiêu trong tử và mẫu của weighted mean; với minibatch hỗn hợp, tác động phụ thuộc thành phần batch, các trọng số và reduction. Balanced sampler thay đổi mẫu xuất hiện và batch statistics; weighted loss thay đổi gradient của mẫu đã chọn. Có thể cộng hai cơ chế, nhưng không nên khẳng định chúng luôn overcorrect: cần tính phân phối lấy mẫu và gradient contribution thực tế. Với mixup hoặc soft CE, phải xét riêng semantics probability-target; không áp dụng máy móc quy tắc mẫu số của hard labels.

Focal loss#

Nguồn. Tsung-Yi Lin, Priya Goyal, Ross Girshick, Kaiming He, Piotr Dollár, “Focal Loss for Dense Object Detection”, ICCV 2017, đọc paper §§3–4 và thí nghiệm RetinaNet; paper trỏ tới Detectron, snapshot code 04155a0 (HEAD được kiểm ngày 11-10-2026).

Claim hữu ích. Focal loss nhân cross-entropy với hệ số giảm theo xác suất đúng, (1 − p_t)^gamma; alpha có thể điều chỉnh cân bằng lớp. Paper nhắm vào bài toán object detection một-stage với tỷ lệ foreground/background cực lệch, và giảm đóng góp của vô số easy negatives. Nó làm hard examples có tương đối nhiều ảnh hưởng hơn.

Caveat và phản ví dụ. “Hard” cũng có thể là nhãn sai, outlier hoặc một miền bất thường; focal không tự phân biệt hard informative với hard noise. Paper không phải thử nghiệm speech anti-spoofing, nên kết quả RetinaNet không chứng minh focal tốt hơn weighted CE cho detector này.

Margin và metric learning#

Nguồn AM-Softmax. Feng Wang, Weiyang Liu, Haijun Liu, Jian Cheng, “Additive Margin Softmax for Face Verification”, arXiv v4 (30-05-2018), bài Signal Processing Letters 2018; đã đọc công thức, phần chuẩn hóa feature và thực nghiệm face verification.

Nguồn ArcFace. Jiankang Deng, Jia Guo, Jing Yang, Niannan Xue, Irene Kotsia, Stefanos Zafeiriou, “ArcFace: Additive Angular Margin Loss for Deep Face Recognition”, arXiv v4 (04-09-2022), CVPR 2019; đã đọc §III và các phần ablation/thực nghiệm.

Claim hữu ích. Các margin-softmax chuẩn hóa feature/class center rồi điều chỉnh logit của lớp đích bằng margin (cosine hoặc góc) để làm decision boundary/embedding phân tách hơn. ArcFace nêu rõ nó nhạy với label noise; sub-center ArcFace được đưa ra để cho phép một lớp có nhiều center, trong đó center phụ hút mẫu khó hoặc nhiễu.

Caveat. Các bài này là nhận dạng mặt, không phải detector speech. Nhãn fake gom nhiều generator/family thành một lớp có thể ép chúng vào một cụm; margin lớn hơn không mặc nhiên tăng khả năng phát hiện generator chưa thấy. Bằng chứng chỉ hỗ trợ giải thích cơ chế, không hỗ trợ kết luận đã thử hoặc sẽ cải thiện JEPA.

Nguồn supervised contrastive. Prannay Khosla et al., “Supervised Contrastive Learning”, arXiv v5 (10-03-2021), NeurIPS 2020; đã đọc §§3.1–3.2 và phần experiment chính. Mỗi mẫu có hai views; positives gồm các mẫu cùng nhãn và negatives là mẫu khác nhãn. Paper cũng nêu hai cách tổng hợp positives không tương đương; formulation đặt tổng ngoài log thắng rõ formulation còn lại trong thí nghiệm ImageNet của họ. Code PyTorch do paper trỏ: SupContrast, commit 66a8fe5.

Caveat/ứng dụng. Kéo mọi fake vào cùng vùng có thể xóa cấu trúc giữa các generator/family; đây là rủi ro cần đo bằng label-granular probe và held-out generator, không phải kết quả đã chứng minh trong paper SupCon. Paper dùng image classification, không phải deepfake detection.

Multi-task#

Nguồn cơ chế tổng quát. Alex Kendall, Yarin Gal, Roberto Cipolla, “Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics”, CVPR 2018; đọc phần homoscedastic-uncertainty weighting và thực nghiệm depth/semantic/instance segmentation.

Claim hữu ích. Bài học là loss của nhiều tác vụ cần cân bằng; paper học task weights theo homoscedastic uncertainty thay vì chỉ đặt hệ số tay. Chứng cứ thực nghiệm thuộc scene understanding.

Ví dụ speech. Chengzhe Sun, Shan Jia, Shuwei Hou, Siwei Lyu, “AI-Synthesized Voice Detection Using Neural Vocoder Artifacts”, arXiv v2 (27-04-2023), CVPRW 2023; đã đọc §§3–4. RawNet2 dùng shared front-end cho binary real/fake và auxiliary vocoder-identification task. LibriSeVoc tự-vocoder hóa cùng các mel-source qua sáu vocoder (WaveNet, WaveRNN, Mel-GAN, Parallel WaveGAN, WaveGrad, DiffWave), nhằm tách cue vocoder trong thiết kế dataset của họ. Code/data được paper trỏ tới repository này.

Caveat. Auxiliary task chỉ hữu ích nếu nhãn đáng tin và cue phụ trợ phù hợp với mục tiêu. Vocoder identification có thể tập trung representation vào cue của sáu vocoder cụ thể, không bảo đảm giúp với codec/TTS/VC khác; có thể có negative transfer. LibriSeVoc self-vocoding là controlled example, không phải coverage đầy đủ của deepfake ngoài đời.

Domain robustness và consistency#

Domain adversarial#

Nguồn. Yaroslav Ganin et al., “Domain-Adversarial Training of Neural Networks”, JMLR 17(59), 2016; đã đọc abstract và method PDF, đặc biệt gradient-reversal layer.

Claim hữu ích. Feature extractor học phân loại nhiệm vụ nguồn trong khi gradient reversal khiến domain classifier khó phân biệt source và target. Thiết lập paper dùng source có nhãn và target không nhãn. Với anti-spoofing, có thể định nghĩa domain theo corpus/channel/generator, nhưng cần quyết định domain labels và liệu có target data lúc train hay không.

Caveat. Làm một domain classifier khó giải mã domain không chứng minh detector không dùng thông tin domain ở bất kỳ đường biểu diễn nào; probe có thể yếu hoặc misspecified. Invariance cũng có thể xóa cue thật liên quan cả domain lẫn spoof. Không được diễn giải adversarial success như chứng minh “không còn shortcut”.

Group DRO#

Nguồn. Shiori Sagawa, Pang Wei Koh, Tatsunori B. Hashimoto, Percy Liang, “Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization”, arXiv 1911.08731, ICLR 2020; đã đọc §§3.1–3.3. Code: group_DRO, commit cbbc1c5.

Claim hữu ích. Group DRO tối ưu loss nhóm tệ nhất trong nhóm đã định nghĩa; hữu ích khi biết group như label × source. Nhưng paper cho ví dụ phản chứng quan trọng: trong chế độ overparameterized, ERM và DRO fit gần hoàn hảo mọi training group mà vẫn có worst-group test kém. Tăng regularization/early stopping giúp worst-group test trong Waterbirds/CelebA/MultiNLI của paper.

Caveat. Cần group IDs và đủ đại diện cho nhóm. Tối ưu những group đã thấy không bảo đảm generator/channel hoàn toàn mới; hiệu quả phụ thuộc regularization và generalization gap, không phải bảo đảm phân phối.

Consistency#

Nguồn. Antti Tarvainen, Harri Valpola, “Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results”, NeurIPS 2017; đã đọc abstract và method paper. Mean Teacher tạo teacher bằng EMA trọng số student rồi phạt bất nhất prediction student/teacher.

Claim hữu ích và caveat. Consistency khuyến khích dự đoán ổn định qua views/augmentations, nhưng nó giả định các views giữ nhãn cần dự đoán. Nếu random crop chỉ giữ một đoạn bona fide trong clip có fake segment ngắn mà nhãn crop vẫn bị gán “fake”, loss nhất quán sẽ bắt model bảo toàn nhãn sai cho view đó.

Augmentation và coverage#

SpecAugment so với waveform perturbation#

Nguồn. Daniel S. Park et al., “SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition”, Interspeech 2019; arXiv v3 03-12-2019; đọc §§2–3. SpecAugment tác động trên log-mel/filter-bank: time warp, mask dải tần, mask span thời gian; kết quả gốc là ASR WER.

Liên hệ project. Manuscript chỉ báo cáo time mask và frequency mask; không báo time warp. Do đó “mask kiểu SpecAugment” là mô tả phù hợp cho hai thao tác, nhưng không được tự nhận recipe đầy đủ ba phép biến đổi của paper hay gán WER gain sang spoof detection.

RawBoost#

Nguồn. Hemlata Tak, Madhu Kamble, Jose Patino, Massimiliano Todisco, Nicholas Evans, “RawBoost: A Raw Data Boosting and Augmentation Method applied to Automatic Speaker Verification Anti-Spoofing”, arXiv v2 (22-02-2022), ICASSP 2022; đã đọc PDF §§2–4. Paper trỏ code chính thức, snapshot commit 4f161a8.

Claim hữu ích. RawBoost tạo waveform nuisance bằng ba loại: linear/nonlinear convolutive noise, impulsive signal-dependent additive noise, và stationary signal-independent additive noise màu. Paper hướng tới telephony/encoding/transmission distortion; không cần noise/RIR external. Trong thiết lập ASVspoof 2021 LA, tác giả báo cáo cải thiện tương đối 27% so với baseline raw end-to-end của họ.

Ranh giới. RawBoost không đồng nghĩa với codec re-encode, RIR/reverb thật, random crop, speed perturbation hay mixup. Kết quả 27% không chuyển thành bảo đảm cải thiện detector hoặc domain khác.

Multi-augmentation và phản ví dụ theo từng miền#

Nguồn speech system. Wan Lin, Li Wang, Jindong Wang, Kunyu Feng, Zhizheng Wu, “Teffic-Audio: Tell Fact from Fiction”, arXiv v2 (14-08-2026), technical report; đã mở full HTML, đọc §§3.1–3.3, 4.1, 5.1. Paper không link official code repository trong trang arXiv/paper đã kiểm.

Method/coverage. Corpus trộn nhiều dataset và TTS/VC/neural vocoder/neural codec; thêm genuine từ LibriSpeech, AISHELL3, GigaSpeech, CNCeleb, CommonVoice để mở rộng speaker/language/recording conditions. Sampling cho spoof ưu tiên generator ID, nếu thiếu thì fallback dataset; M=1000 mẫu mỗi unit, rồi cân bằng tổng bona fide và chia đều qua nguồn genuine. Augmentation được lấy ngẫu nhiên 1 hoặc 2 phép với xác suất 0,5: RawBoost, RIR, MUSAN noise/speech/music, pitch shift ±1 semitone, low/high/bandpass, waveform time mask 1–10%, codec MP3/Vorbis/Opus/AAC/Speex/GSM/G.711/G.723.1/EnCodec, packet loss 0.01–0.1 với packet 20 ms.

Ablation và caveat. Trên cùng backbone w2v-BERT 2.0 + MHASP, bài báo cáo pooled EER 7.159 (merge + random sampling), 6.456 (+ attack/source-balanced sampling), 5.435 (+ supplementary bona fide), 5.896 (+ RawBoost thay cho diverse augmentation), và 1.454 (+ diverse audio augmentation). RawBoost cải thiện rõ vài set nhưng không cải thiện đều; ASVspoof24-Eval còn tệ hơn bước trước trong bảng. Đây là ablation nested của report, không phải causal universal ranking giữa từng phép đơn lẻ. Report cũng nói training corpus chứa official training partitions của một số benchmark trong evaluation suite; test vẫn có distribution gaps nhưng không phải mọi test đều unseen dataset hoàn toàn. Bài báo cáo kết quả tổng thể, không chứng minh từng codec/noise op riêng sẽ giúp model này.

Speed perturbation, mixup và crop#

Speed perturbation. Tom Ko, Vijayaditya Peddinti, Daniel Povey, Sanjeev Khudanpur, “Audio Augmentation for Speech Recognition”, Interspeech 2015; đã mở paper và đọc method/results. Bài khuyến nghị speed factors 0.9, 1.0, 1.1 và báo cáo cải thiện tương đối WER trung bình 4.3% qua bốn LVCSR tasks. Đây là ASR evidence; speed có thể đổi pitch/timbre/cue detector, nên label preservation cần kiểm riêng.

Mixup. Hongyi Zhang, Moustapha Cissé, Yann N. Dauphin, David Lopez-Paz, “mixup: Beyond Empirical Risk Minimization”, arXiv v2 (27-04-2018), ICLR 2018; đã đọc §§2–3 và pseudo-code. Mixup trộn convex hai input và trộn target theo cùng hệ số; mục tiêu là khuyến khích behavior tuyến tính giữa mẫu. Soft target lambda là hệ số trộn hai label, không tự là tỉ lệ thời lượng fake trong audio. Nếu waveform pha hai clip, đó cũng không mặc nhiên mô tả partial spoof vật lý hay giữ cue forensic.

Crop/partial fake. Lin Zhang et al., “An Initial Investigation for Detecting Partially Spoofed Audio”, Interspeech 2021; đã đọc §§2–4.2.3. PartialSpoof tạo clip trộn segment bona fide và spoof; model train trên full-spoof suy giảm đáng kể khi test partial-spoof, và càng giảm khi tỷ lệ spoof segment nhỏ. Crop fixed-size có thể cắt mất đoạn fake; nếu crop vẫn mang clip label thì target có thể sai. Paper cho thấy train với utterance labels/segment labels là các setting khác nhau; spotting mức segment khó hơn. Không suy ra đây là lỗi đã xuất hiện ở Audio-JEPA.

Data-centric sampling, source × label confound#

Nguồn chính, danh tính đã xác minh. Wen Huang, Yuchen Mao, Yanmin Qian, “A Data-Centric Approach to Generalizable Speech Deepfake Detection”, ACL 2026, pp. 17520–17539, DOI 10.18653/v1/2026.acl-long.796; arXiv v3, nộp 20-12-2025, sửa 29-12-2025. Đây chính là link ACL 2026 được Chương 04 và Literature nhắc tới; tên bài chính xác là “A Data-Centric Approach to Generalizable Speech Deepfake Detection”, không phải nhãn tóm tắt “Data-centric generalization”. Đã đọc HTML arXiv v3 §§3–5 và Appendix C. Web-reader của ACL final PDF timeout; ACL metadata, title, authors, venue, pages và DOI đã đối chiếu.

Method và claim. §3 cô lập biến data-composition: 8 source datasets với 10k real mỗi source và bốn generator tạo 40k fake/source; thí nghiệm khác dùng 16 generators trên fixed source pool; mỗi condition có ba random selections và đánh giá macro trên 10 OOD sets. Tác giả báo cáo source diversity nhìn chung giảm EER nhưng có thể làm ACC giảm; generator diversity cải thiện ACC rõ hơn nhưng hiệu ứng EER kém nhất quán. CDE gộp EER và (1−ACC); ACC dùng threshold 0.5 còn EER tối ưu threshold, vì vậy chúng phản ánh hai điều khác nhau.

§4 định nghĩa genuine domain là source; fake domain là cặp source × generator. DOSS-Select prune mỗi fake domain bằng cap Nc rồi chọn genuine source theo tổng fake tương ứng × ratio rho. DOSS-Weight dùng cap rồi temperature tau trên domain size, sau đó điều chỉnh tổng trọng số bona fide:spoof theo rho. Đây là diversity-aware data mixture, không phải Group DRO: không tối ưu max group loss.

Ví dụ và counterexample. Bảng §4.2 cho thấy naive aggregation average EER cải thiện từ 8.78 (k=2) xuống 3.29 (k=12), nhưng một dataset riêng ADD23 tệ hơn ở k=8 so với k=6 (12.57 → 16.18). Vì vậy nhiều dataset/diversity có thể cải thiện trung bình trong khi gây tradeoff cho một benchmark. DOSS-Select ở cap Nc=500 đạt average 2.77% trong bảng với 0.2k giờ; DOSS-Weight cap=2500, tau=5 đạt average 2.34% trên pool 6.4k giờ. Các con số thuộc protocol/pool của paper.

Giới hạn/code. Bài không có code URL trong ACL metadata hay arXiv HTML page được kiểm; không ghi commit. Paper có nguồn tiếng Anh/Trung và điều kiện riêng; không bảo đảm sampling policy tốt nhất cho tập dữ liệu khác, và group labels có thể thiếu/sai.

Bằng chứng speech cho source shortcut. Nicolas M. Müller, Franziska Dieckmann, Pavel Czempin, Roman U. Canals, Konstantin Böttinger, Jennifer Williams, “Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?”, ASVspoof 2021 workshop; đã đọc paper §§2–5. Họ phát hiện leading/trailing silence duration tương quan với nhãn ASVspoof 2019; một MLP chỉ nhận leading-silence duration đạt test EER 15.12%, còn RawNet2 EER tăng 3.61→15.50 khi trim silence lúc train. Đây là ví dụ shortcut có intervention. Caveat do chính tác giả nêu: silence có thể chứa cue hợp lệ; vấn đề là phân bố duration mất cân bằng theo lớp. Không suy ra model/audio corpus khác dùng silence.

Diagnostics: decodability, causal use và ablation#

Probes cần control task#

Nguồn. John Hewitt, Percy Liang, “Designing and Interpreting Probes with Control Tasks”, arXiv v1 (08-09-2019); đọc §§2–4. Probe nên được so với control task có cùng input/output nhưng target ngẫu nhiên để đo khả năng probe tự memorization. Trong ELMo, một MLP đạt POS accuracy 97.3 nhưng control accuracy 92.8; linear probe có accuracy gần bằng 97.2 nhưng control thấp hơn 71.2. Do đó high probe score tự nó chưa chứng minh representation “mã hóa theo nghĩa hữu ích”.

Áp dụng cho speech: speaker/source/generator probe thành công cho thấy thông tin đó giải mã được bằng probe đã chọn; không chứng minh detector dùng nó. Probe thất bại cũng không chứng minh thông tin không tồn tại; cần báo capacity/control, split theo speaker/source, và so layer/cue một cách kiểm soát.

Attention không phải bằng chứng nhân quả#

Nguồn. Sarthak Jain, Byron C. Wallace, “Attention is not Explanation”, NAACL-HLT 2019, pp. 3543–3556, DOI 10.18653/v1/N19-1357; đọc paper chính và abstract. Trong ba NLP task, attention weights thường không tương quan với gradient feature importance; attention distributions rất khác nhau vẫn có thể cho prediction tương đương.

Caveat. Thí nghiệm của họ là NLP RNN, không phải audio transformer. Suy luận phù hợp là không dùng attention heatmap một mình làm kết luận vùng âm thanh quyết định nhãn; cần score perturbation/ablation hay kiểm tra counterfactual trên cùng clip.

Sanity check cho saliency#

Nguồn. Julius Adebayo, Justin Gilmer, Michael Muelly, Ian Goodfellow, Moritz Hardt, Been Kim, “Sanity Checks for Saliency Maps”, NeurIPS 2018; đọc full paper, phần randomization tests và kết quả.

Claim hữu ích. So sánh heatmap khi random hóa lần lượt model weights/lớp hoặc labels để kiểm tra attribution có nhạy với model/data đã học không. Một số phương pháp trong bài giữ hình dạng hấp dẫn dù insensitive tới weights/data; nhìn đẹp bằng mắt chưa đủ.

Caveat. Paper áp dụng thí nghiệm ảnh; vượt qua sanity check không làm saliency thành giải thích hoàn hảo hay causal. Với audio, cần kiểm tra lại riêng và thêm deletion/insertion hay paired occlusion có score đo được.

Perturbation theo cặp và ablation#

Nguồn LibriSeVoc ở trên là mẫu controlled construction: sáu vocoder nhận cùng mel representation từ cùng original audio, giúp gán khác biệt quan sát được cho pipeline vocoder trong phạm vi data ấy. Nó minh họa cách giữ source/content cố định khi so treatment, không phải kết luận mọi khác biệt còn lại chỉ do generator trong corpus tự nhiên.

Một phép kiểm tra detector có thể biên soạn từ logic này (đề xuất, chưa chạy): tạo các cặp cùng utterance/source và cùng spoof label trước/sau codec, RIR/noise hoặc filtering; giữ thao tác đối xứng giữa bona fide/fake; báo paired score delta, ranking đảo chiều và EER/ACC từng condition. Khi kiểm crop, lưu vị trí fake segment và báo tỷ lệ clip/crop còn chứa segment; nếu không có segment labels, không gọi crop-positive là ground truth chắc chắn. So sánh inference-time occlusion/ablation với retraining-without-feature là hai câu hỏi khác nhau; một cái hỏi score phụ thuộc đoạn bị che, cái kia hỏi model có học lại giải pháp khác không.

Gợi ý câu chữ an toàn khi đưa vào chương#

  • Nói class weight và sampling thay đổi hai bước khác nhau; cộng chúng có thể compound nhưng mức độ phụ thuộc sampler, class counts, batch và reduction.
  • Nói focal tăng trọng số tương đối của hard examples, gồm cả khả năng label noise/outlier.
  • Nói mixup target là soft interpolation; không gọi đó là tỉ lệ thời lượng fake.
  • Nói crop partial-fake có thể làm nhãn clip không còn đúng; không nói mọi crop đều sai nhãn.
  • Nói domain adversarial làm domain khó giải mã bởi discriminator đã chọn; không kết luận không có domain cue.
  • Nói group DRO nhắm worst-case trên groups đã định nghĩa và cần regularization; không bảo đảm unseen shift.
  • Nói attention/saliency/probe là diagnostics; cần paired perturbation, control probe và sanity checks để củng cố claim.
  • Tách rõ paper “reported/used” với các phép augmentation/replication/ablation chỉ đang đề xuất.
↓ Bản Markdown nguyên gốcGiữ nguyên nội dung · Công thức, bảng và nguồn đầy đủ.Các chat bàn giao được mở trong Codex.

Gõ từ khóa để tìm bài học và đoạn liên quan.