# Lớp 3 — Học biểu diễn, SSL và JEPA

**Cập nhật:** 11/10/2026. Bộ này giải thích cơ chế đủ để đọc method và chất vấn claim của một paper Audio-JEPA/deepfake. Trạng thái hiện tại là **học liệu đã biên soạn; người học chưa được đánh giá**. Không chọn hướng nghiên cứu hoặc kế hoạch GPU trong lớp này.

## Điểm vào và phụ thuộc

Cần [xác suất/loss](../lop-01-nen-tang/06-XAC-SUAT-LOSS-DETECTION.md), [hình học biểu diễn](../lop-01-nen-tang/07-HINH-HOC-BIEU-DIEN.md), [neural network/attention/tối ưu](../lop-01-nen-tang/08-MANG-NORON-ATTENTION-TOI-UU.md), [mel và token](../lop-01-nen-tang/05-MEL-CEPSTRUM-CHUAN-HOA-TOKEN.md). Liên hệ forensic dựa trên [cue, confound và domain shift](../lop-02-deepfake-bai-toan/08-CUE-CONFOUND-DOMAIN-SHIFT.md). Chưa chắc phần nào thì dùng bài prerequisite đúng điểm đó, không cần đọc lại toàn bộ lớp 1–2.

```mermaid
flowchart TD
    A[1. Representation phục vụ task] --> B[2. Target và loss]
    B --> C[3. Contrastive và speech units]
    B --> D[4. Reconstruction và contextual targets]
    B --> E[5. Self-distillation và anti-collapse]
    C --> F[6. JEPA training step]
    D --> F
    E --> F
    F --> G[7. Masking thiết kế task]
    E --> H[8. Collapse diagnostics]
    G --> I[9. Encoder và error scoring]
    H --> I
    I --> J[10. Biến thể và evidence]
```

## Mười bài học chính

| Bài | Câu hỏi phải giải được | Ví dụ/cơ chế nổi bật |
|---|---|---|
| [1 — Representation phục vụ task](01-BIEU-DIEN-PHUC-VU-TASK.md) | Giữ thông tin khác đọc được thông tin thế nào? | XOR khả nghịch nhưng không tuyến tính; invariance collision; discrete information bottleneck |
| [2 — Taxonomy, target và loss](02-TAXONOMY-TARGET-LOSS.md) | Target liên tục/rời rạc khác contrastive/non-contrastive ở đâu? | MSE reduction, hard CE/soft CE/KL, InfoNCE gradients, normalization |
| [3 — Contrastive và speech units](03-SPEECH-UNITS-CONTRASTIVE.md) | CPC, wav2vec2, HuBERT, WavLM, BEST-RQ cập nhật target khác nhau ra sao? | Quantizer gradient vs offline IDs vs fixed random codes; denoising target |
| [4 — Reconstruction và continuous target](04-RECONSTRUCTION-CONTINUOUS-TARGET.md) | AudioMAE reconstruct gì, data2vec predict gì? | Patch MSE; conditional mean; contextualization và top-layer normalization |
| [5 — Self-distillation và asymmetry](05-SELF-DISTILLATION-ASYMMETRY.md) | Stop-gradient, EMA, predictor, regularizer làm những việc gì? | Detached-target gradient; EMA half-life; VICReg/Barlow numeric counterexamples |
| [6 — JEPA training step](06-JEPA-TRAINING-STEP.md) | Có thể đi từ spectrogram đến optimizer/EMA bằng tay không? | Token/tensor trace; simultaneous SGD toy; paper/code normalized-loss mismatch |
| [7 — Masking thiết kế task](07-MASKING-THIET-KE-NHIEM-VU.md) | Cùng 50% mask sao có độ khó khác nhau? | Grid adjacency/distance; conditional uncertainty; patch removal vs mask token |
| [8 — Collapse diagnostics](08-COLLAPSE-DIAGNOSTICS.md) | Rank/variance/cosine đo ở đâu và chưa chứng minh gì? | Mean-dominated cosine; tiny high-rank features; position-only token variation |
| [9 — Encoder và error scoring](09-ENCODER-ERROR-SCORING.md) | Prediction error có phải spoof probability không? | Energy/density/LLR; predictor compatibility; weighted CE và SOICT head |
| [10 — Biến thể và evidence](10-BIEN-THE-VA-DOC-BANG-CHUNG.md) | Một tên mới cần bằng chứng ở mức nào? | S-JEPA vs anchored GMM; GLaS gradient paths; BEST-RQ-2; recipe/provenance ladder |

Mỗi bài có mục tiêu, cơ chế, toy hoặc phản ví dụ, liên hệ deepfake và bài tập có đáp án thu gọn. Đọc phần đáp án **sau khi tự giải thích lý do**, không đánh dấu hiểu chỉ vì nhận ra thuật ngữ.

## Tài liệu đi kèm

- [Sổ nguồn và mức đã đọc](11-SO-DANG-KY-NGUON.md): primary versions, method sections, root/agent scope và nguồn manuscript.
- [Hồ sơ 19 recipe](14-HO-SO-RECIPE.md): view, target, loss, gradient, update, output, data và giới hạn.
- [Paper/code/checkpoint crosswalk](research/jepa-code-doi-chieu.md): pinned I-JEPA/Audio-JEPA code; normalization, schedules và provenance.
- [Báo cáo enrich](12-BAO-CAO-ENRICH.md): lỗ hổng ban đầu, phần đã bổ sung, kiểm tra và điều còn mở.
- [Tiến độ học và bàn giao](13-TIEN-DO-HOC-VA-BAN-GIAO.md): tách việc viết tài liệu khỏi mức hiểu của người học; câu hỏi đang chờ.
- [Kiểm tra toy và liên kết](scripts/kiem-tra-hoc-lieu.py), [kết quả validation](research/validation.json), [hình masking](assets/masking-toy.png), [hình collapse](assets/collapse-toy.png).

## Cách học trong chat

Mỗi lượt chỉ một cơ chế: giải thích ngắn → một câu hỏi vì sao → người học trả lời → sửa đúng chỗ → một biến thể kiểm tra transfer. Không đưa cả đề thi mười bài một lần. Khi người học chưa trả lời, giữ trạng thái **đang chờ**, không tự ghi “đã học”.

Các mốc kiểm hiểu: sau bài 2 tự phân loại target/loss; sau bài 5 tự chỉ gradient và update; sau bài 6 tự tính một step; sau bài 8 chọn đúng population phép đo; sau bài 9 phân biệt error/probability/score; sau bài 10 phân biệt reported method, verified code và checkpoint provenance. Mốc nào chưa đạt thì ôn đúng cơ chế đó.

Đánh giá cuối lớp là vẽ recipe không nhìn tên và giải thích một failure mode với bằng chứng cần thiết. Không yêu cầu train/download model để chứng minh đã hiểu.
