LLM Training & Alignment
🆕 Նոր բաժին։ Տասնութ հիմնարար հոդվածների հիման վրա պատրաստված սլայդեր՝ ժամանակակից LLM-ների ուսուցման և alignment-ի մասին։ Սլայդերը անգլերեն են (հոդվածներին մոտ մնալու համար)։ Տեսանյութերը դեռ ձայնագրված չեն — TBD։ Դասերն անցնելուց հետո կավելացվեն YouTube-ի հղումները և նշումներով (_notes) PDF-երը։
🎲 Random
Շաբաթվա պատահական հղումը՝ TBD։
Տասնութ հոդված, մեկ ամբողջական պատմություն՝ թոքենիզացիայից և նախապես ուսուցումից (pretraining) մինչև fine-tuning, alignment, reasoning և պատրաստի մոդելների տեխնիկական ռեպորտներ 🤖
📚 Նյութը
Տասնութ հոդված՝ դասավորված ամբողջ LLM-ի ուսուցման խողովակաշարի (pipeline) երկայնքով։ Յուրաքանչյուրը մեկ հոդվածի ինքնուրույն դասախոսություն է։ Սլայդերը՝ ml/llm_training/slides/ պանակում։
Մաս 1 — Fine-tuning և alignment
- [01] GRPO — Group Relative Policy Optimization — critic-free RL LLM-ների համար․ PPO-ի ամենաթանկ մասը (value network-ը) փոխարինում ենք խմբի (group) միջինով։ DeepSeekMath, R1-ի հիմքում ընկած ալգորիթմը։ 🎞️ Սլայդեր · 📄 Paper (2402.03300) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [02] DPO — Direct Preference Optimization — բաց ենք թողնում և՛ reward model-ը, և՛ RL-ը․ preference alignment-ը դառնում է մեկ դասակարգման (classification) loss։ «Your language model is secretly a reward model»։ 🎞️ Սլայդեր · 📄 Paper (2305.18290) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [03] LoRA — Low-Rank Adaptation — հսկա մոդելը fine-tune ենք անում՝ սառեցնելով կշիռները և սովորելով երկու փոքրիկ low-rank մատրից․ 10,000× ավելի քիչ պարամետր, զրո inference latency։ 🎞️ Սլայդեր · 📄 Paper (2106.09685) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [04] LIMA — Less Is More for Alignment — 1,000 խնամքով ընտրված օրինակ, առանց RLHF-ի, մրցունակ է RLHF-ով ուսուցանված պրոդուկտների հետ։ Superficial Alignment Hypothesis-ը՝ ունակությունը գալիս է pretraining-ից, alignment-ը միայն ձևն է ընտրում։ 🎞️ Սլայդեր · 📄 Paper (2305.11206) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [18] FLAN — Instruction Tuning at Scale — pretrained մոդելը zero-shot-ում անշնորհք է։ Fine-tune ենք անում շատ առաջադրանքների վրա՝ բոլորը որպես բնական-լեզվով ցուցում (instruction) ձևակերպած → մոդելը սովորում է «կատարիր ցուցումը» որպես ընդհանուր հմտություն, որը փոխանցվում է չտեսած առաջադրանքի տեսակներին։ FLAN 137B > zero-shot GPT-3 175B (20/25 dataset)։ [04] LIMA-ի հակադիր թեզը՝ շատ առաջադրանք ընդդեմ քիչ, բայց որակյալ օրինակների։ 🎞️ Սլայդեր · 📄 Paper (2109.01652) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD
Մաս 2 — Թոքենիզացիա, pretraining և մոդելների ռեպորտներ
- [05] BPE-Dropout — subword regularization — ստանդարտ BPE-ն ամեն բառին տալիս է ՄԵԿ բաժանում, մոդելը երբեք այլընտրանքային split-եր չի տեսնում ու փխրուն է։ BPE-dropout՝ ուսուցման ընթացքում merge-երը պատահականորեն բաց ենք թողնում (\(p\) հավանականությամբ) → նույն merge-աղյուսակից շատ բաժանումներ, առանց նոր մոդելի։ Ինֆերենսի ժամանակ՝ սովորական BPE։ 🎞️ Սլայդեր · 📄 Paper (1910.13267) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [06] Don’t Stop Pretraining — DAPT / TAPT — մի կանգնեցրեք pretraining-ը․ ֆայն-թյունինգից առաջ շարունակեք pretraining-ը ձեր դոմենի (DAPT) կամ առաջադրանքի սեփական տեքստի (TAPT) վրա։ Էժան է (հատկապես TAPT-ը) և հուսալիորեն օգնում է — ամենաշատը, երբ դոմենը հեռու է pretraining-ի կորպուսից։ 🎞️ Սլայդեր · 📄 Paper (2004.10964) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [07] The Llama 3 Herd of Models — բաց 405B մոդել՝ GPT-4-ի մակարդակի, կառուցված միտումնավոր «ձանձրալի» բաղադրատոմսով․ որակյալ տվյալ + մասշտաբ + պարզ post-training (SFT + rejection sampling + DPO, ոչ PPO)։ Scaling law-երը և՛ ընտրում են 405B-ն, և՛ կանխատեսում benchmark-ի արդյունքը։ 🎞️ Սլայդեր · 📄 Paper (2407.21783) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [08] Qwen3 Technical Report — մեկ մոդել՝ և՛ «մտածող» (thinking, long CoT), և՛ արագ (non-thinking) ռեժիմով, plus «thinking budget» — քանի՞ թոքեն ծախսել մտածելու վրա (compute-vs-quality dial)։ Dense + MoE ընտանիք, 4-փուլ post-training, strong-to-weak դիստիլացիա։ 🎞️ Սլայդեր · 📄 Paper (2505.09388) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD
Մաս 3 — Հիմքեր, արդյունավետություն և արխիտեկտուրա
- [16] RoPE — Rotary Position Embeddings — self-attention-ը դիրք չի զգում (permutation-invariant)։ RoPE-ն \(q\) և \(k\) վեկտորները պտտում է դիրքին համաչափ անկյունով → dot product-ը կախված է միայն ՀԱՐԱԲԵՐԱԿԱՆ դիրքից (\(m-n\))։ Էժան է, ազդում է միայն \(q,k\)-ի վրա, և հեռավոր թոքենների ուշադրությունը բնականորեն մարում է։ Llama/Qwen/DeepSeek-ի լռելյայն դիրքային կոդավորումը (θ=500k երկար-կոնտեքստ scaling-ը՝ արդեն հետագա աշխատանք, ոչ բուն հոդվածում)։ 🎞️ Սլայդեր · 📄 Paper (2104.09864) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [15] FlashAttention — IO-aware exact attention — attention-ի խցանումը ոչ թե FLOP-երն են, այլ HBM հիշողության թողունակությունը (memory-bound)։ Tiling + online softmax → \(N\times N\) մատրիցը երբեք չի գրվում դանդաղ հիշողություն, իսկ backward-ում այն վերահաշվում ենք պահելու փոխարեն։ Ճշգրիտ (ոչ մոտավոր) արդյունք, ~3× ավելի արագ, մինչև 20× քիչ հիշողություն — երկար կոնտեքստի հիմքը։ 🎞️ Սլայդեր · 📄 Paper (2205.14135) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [09] Scaling Laws — Kaplan և Chinchilla — ֆիքսված compute budget-ի դեպքում ի՞նչ չափի մոդել և քանի՞ թոքեն։ Kaplan (2020)՝ հարթ power law-եր, հակված մեծ մոդելների կողմը։ Chinchilla (2022)՝ compute-optimal-ը պահանջում է \(N\)-ն ու \(D\)-ն հավասար մասշտաբել (~20 թոքեն/պարամետր) — 2020-2022-ի շատ մոդելներ թերուսուցանված էին։ 🎞️ Սլայդեր · 📄 2001.08361 · 2203.15556 · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [10] InstructGPT — RLHF-ի հիմքը — pretrained մոդելը միայն հաջորդ թոքենն է կանխատեսում, ոչ թե կատարում ցուցումը։ RLHF-ի 3 քայլը՝ SFT → reward model (մարդկային ranking-ներից) → PPO՝ KL penalty-ով։ 1.3B InstructGPT-ն գերադասվում է 175B GPT-3-ից։ Հենց այս խողովակաշարն են [01] GRPO-ն ու [02] DPO-ն հետո պարզեցնում։ 🎞️ Սլայդեր · 📄 2203.02155 · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [12] QLoRA — quantized LoRA — [03] LoRA-ն դեռ պահանջում է base մոդելը 16-bit հիշողությունում (65B ≈ 130GB)։ QLoRA՝ base-ը պահում ենք 4-bit NF4-ով, backprop անում 16-bit adapter-ների մեջ → 65B-ի fine-tuning մեկ 48GB GPU-ի վրա, առանց որակի կորստի։ 🎞️ Սլայդեր · 📄 2305.14314 · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [13] Mixture of Experts — Switch, Mixtral — FFN-ը փոխարինում ենք \(N\) expert + router-ով, ամեն թոքեն գնում է միայն top-\(k\) expert։ Շատ պարամետր, բայց քիչ FLOP մեկ թոքենի համար։ Mixtral 8x7B՝ 47B ընդհանուր, ~13B ակտիվ, մրցունակ Llama-2-70B-ի հետ։ 🎞️ Սլայդեր · 📄 2101.03961 · 2401.04088 · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [17] DeepSeek-V3 — էժան ուսուցանված frontier MoE — 671B ընդհանուր / 37B ակտիվ, GPT-4o-ի մակարդակի, բայց ~$5.6M-ով։ V3-ի սեփական նորամուծությունները՝ auxiliary-loss-free load balancing, մեծ մասշտաբի FP8 ուսուցում, և Multi-Token Prediction (MLA-ն ու DeepSeekMoE-ն ժառանգված են V2-ից, ոչ V3-ի գյուտ)։ [11] DeepSeek-R1-ի հիմքում ընկած base մոդելը։ 🎞️ Սլայդեր · 📄 Paper (2412.19437) · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD
Մաս 4 — Reasoning (մտածող մոդելներ)
- [14] Chain-of-Thought և process supervision — մոդելին խնդրում ենք «քայլ առ քայլ» մտածել → reasoning-ի մեծ բարելավում, բայց միայն մեծ մասշտաբում (emergent)։ Let’s Verify Step by Step՝ process reward model-ը (գնահատում է ամեն քայլ) գերազանցում է outcome-ը MATH-ի վրա։ Ուղիղ կապ [01] GRPO-ի process supervision-ի հետ։ 🎞️ Սլայդեր · 📄 2201.11903 · 2305.20050 · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD - [11] DeepSeek-R1 — reasoning RL-ով — բաց մոդել՝ o1-ի մակարդակի, և reasoning-ը չսովորեցրին — այն emerge արեց RL-ից։ R1-Zero՝ զուտ RL (առանց SFT), rule-based reward, GRPO → մոդելն ինքն է սովորում երկար մտածել և ստուգել իրեն («aha moment»)։ Distillation՝ R1-ից փոքր մոդելների մեջ։ 🎞️ Սլայդեր · 📄 2501.12948 · 📝 Նշումներով
TBD· 📺 ՏեսանյութTBD
📝 Թեմայի վերաբերյալ հարցաշար (Google Form): TBD
Սլայդերը հիմնված են բնօրինակ հոդվածների վրա (հղումները վերևում)։ Բոլոր նկարները Python-ով գեներացված են (matplotlib), իսկ բենչմարկների թվերը վերցված են հոդվածների աղյուսակներից։ Ամբողջական ցանկը՝ slides/README.md։
🏡 Տնային
Առայժմ TBD։ (Առաջարկվող վարժություն՝ վերցնել փոքր բաց մոդել և HuggingFace trl/peft-ով անցնել SFT → LoRA → DPO ուղին մեկ փոքր preference dataset-ի վրա։)