09 Attention

Important

🚧 Այս գլուխը կիսատ է։ Պլանավորված երեք դասից պատրաստ է մեկը (L24)։ L25-ը և L26-ը դեռ չեն կառուցվել, ուստի գլուխը կանգ է առնում attention-ի մեկ գլխի վրա և դեռ չի հասնում ամբողջական transformer-ին։ Տեսանյութ և տնային աշխատանք դեռ չկան։

Note

Այս գլխի մի մասը հենվում է LMU I2DL (slds-lmu/lecture_i2dl) նյութի վրա, CC BY 4.0։ Մի քանի նկար վերցված է 3Blue1Brown-ի transformer-ի շարքից։

🎲 Random

TBD

📚 Նյութը

Սլայդերը ml/ch9_attention/ պանակում․

  • L24 — Attention: դասը սկսվում է հենց այնտեղից, որտեղ L21-ը կանգ առավ՝ seq2seq-ի bottleneck-ից։ Ուղղումը մեկ գաղափարով է․ թող decoder-ը հետ նայի ամբողջ նախադասությանը, ոչ թե մեկ սեղմված վեկտորի։ Հետո՝ ինչու՞ ընդհանրապես պահել RNN-ը — և թռիչքը․ հեռացրեք ռեկուրենտությունը, թողեք միայն attention-ը, և հաջորդական հաշվարկը դառնում է all-to-all, այսինքն՝ զուգահեռ։ Երկրորդ կեսը self-attention-ի ամբողջական մեխանիկան է․ query / key / value-ն որպես «փափուկ բառարանային որոնում» (և որպես web search), ինչու՞ երեք առանձին մատրիցա, dot product-ը մոտիկից, ինչու՞ softmax, ինչու՞ բաժանել \(\sqrt{d_k}\)-ի, ապա թվերը ձեռքով հաշված, ~15 տող կոդ, իրական head իրական նախադասության վրա, և ինչու՞ է այս ամենը պարզապես matmul (ուստի աշխատում է GPU-ի վրա)։ PDF
WarningՈրտեղ է դասը կանգ առնում

L24-ի վերջին բովանդակային frame-ը կոչվում է «One head of attention, end to end» — և դա բառացի է։ Multi-head attention-ը, positional encoding-ը, residual stream-ը և ամբողջ transformer block-ը դեռ չեն դասավանդվել․ դրանք L25-ի և L26-ի բովանդակությունն են։

Պլանավորված (դեռ չկառուցված)

Ուրվագիծը՝ ml/ch9_attention/ATTENTION_CHAPTER_PLAN.md։

  • L25 — The Transformer block: multi-head attention, positional encoding, residual stream, և ամբողջական block-ը։
  • L26 — Transformers in the world: encoder / decoder / causal-mask ճարտարապետությունները, CLM vs MLM, ինչու՞ հաղթեցին, և \(O(n^2)\) պատը։

📝 Թեմայի վերաբերյալ հարցաշար (Google Form): TBD

🏡 Տնային

TBD

Flag Counter