09 Attention
🚧 Այս գլուխը կիսատ է։ Պլանավորված երեք դասից պատրաստ է մեկը (L24)։ L25-ը և L26-ը դեռ չեն կառուցվել, ուստի գլուխը կանգ է առնում attention-ի մեկ գլխի վրա և դեռ չի հասնում ամբողջական transformer-ին։ Տեսանյութ և տնային աշխատանք դեռ չկան։
Այս գլխի մի մասը հենվում է LMU I2DL (slds-lmu/lecture_i2dl) նյութի վրա, CC BY 4.0։ Մի քանի նկար վերցված է 3Blue1Brown-ի transformer-ի շարքից։
🎲 Random
TBD
📚 Նյութը
Սլայդերը ml/ch9_attention/ պանակում․
- L24 — Attention: դասը սկսվում է հենց այնտեղից, որտեղ L21-ը կանգ առավ՝ seq2seq-ի bottleneck-ից։ Ուղղումը մեկ գաղափարով է․ թող decoder-ը հետ նայի ամբողջ նախադասությանը, ոչ թե մեկ սեղմված վեկտորի։ Հետո՝ ինչու՞ ընդհանրապես պահել RNN-ը — և թռիչքը․ հեռացրեք ռեկուրենտությունը, թողեք միայն attention-ը, և հաջորդական հաշվարկը դառնում է all-to-all, այսինքն՝ զուգահեռ։ Երկրորդ կեսը self-attention-ի ամբողջական մեխանիկան է․ query / key / value-ն որպես «փափուկ բառարանային որոնում» (և որպես web search), ինչու՞ երեք առանձին մատրիցա, dot product-ը մոտիկից, ինչու՞ softmax, ինչու՞ բաժանել \(\sqrt{d_k}\)-ի, ապա թվերը ձեռքով հաշված, ~15 տող կոդ, իրական head իրական նախադասության վրա, և ինչու՞ է այս ամենը պարզապես matmul (ուստի աշխատում է GPU-ի վրա)։ PDF
L24-ի վերջին բովանդակային frame-ը կոչվում է «One head of attention, end to end» — և դա բառացի է։ Multi-head attention-ը, positional encoding-ը, residual stream-ը և ամբողջ transformer block-ը դեռ չեն դասավանդվել․ դրանք L25-ի և L26-ի բովանդակությունն են։
Պլանավորված (դեռ չկառուցված)
Ուրվագիծը՝ ml/ch9_attention/ATTENTION_CHAPTER_PLAN.md։
- L25 — The Transformer block: multi-head attention, positional encoding, residual stream, և ամբողջական block-ը։
- L26 — Transformers in the world: encoder / decoder / causal-mask ճարտարապետությունները, CLM vs MLM, ինչու՞ հաղթեցին, և \(O(n^2)\) պատը։
📝 Թեմայի վերաբերյալ հարցաշար (Google Form): TBD
🏡 Տնային
TBD