19 Mechanistic Interpretability

Warning

🚧 Not finished. This chapter has not been taught yet, and the page below was drafted by Claude rather than written up from a delivered lecture. Treat it as a preview: expect gaps and mistakes until it has been reviewed.

Warning

🚧 Գլուխը ընդլայնվում է 8 դասախոսության՝ 4 հիմնական (մի ամբողջական ուղի) և 4 ընտրովի, որոնցից յուրաքանչյուրը կարելի է բաց թողնել։ Պատրաստ սլայդերը նշված են ստորև։ Տեսանյութ և տնային աշխատանք դեռ չկա։

🎲 Random

TBD

📚 Նյութը

  • 1 · Looking inside (հիմնական) - ի՞նչ է mechanistic interpretability-ն և ինչու՞ է պետք։ Չորս պատճառ՝ debugging, վստահություն, գիտություն, կառավարում։ Որտե՞ղ է այն 5-րդ գլխի «քարտեզի» վրա։ Չորս նեյրոնով ցանց, որը կարդում ենք ամբողջությամբ՝ ամեն նեյրոն շեղանկյան մեկ կողմն է, իսկ մեկ նեյրոնը ջնջելիս բացվում է հենց այդ կողմը։ Feature, circuit, universality բառերը, և գլխի մեթոդը՝ նայել, վարկած կազմել, միջամտել։ PDF
  • 3 · Opening the box (հիմնական) — ինչպե՞ս կարդալ մոդելի ներսը։ Residual stream-ը որպես ընդհանուր ալիք, logit lens, գծային probe-ներ, attention-ի պատկերներ, induction head-եր։ Դասախոսությունն ավարտվում է ձախողմամբ՝ այս բոլոր մեթոդները կորելյացիոն են։ PDF
  • 4 · Circuits read off the weights (ընտրովի) - attention head-ը բաժանում ենք երկու մատրիցի՝ QK (ուր նայել) և OV (ինչ գրել)։ Զրո շերտ՝ bigram աղյուսակ, մեկ շերտ՝ copying head-եր, երկու շերտ՝ composition։ Induction head-ը գտնում ենք միայն կշիռներից՝ առանց որևէ տեքստ աշխատեցնելու, և տեսնում ենք, թե ինչու է այն պահանջում երկու շերտ։ PDF
  • 5 · Does it actually do that? (հիմնական) — պատճառահետևանքային մեթոդներ․ ablation (zero / mean / resample), activation patching, direct logit attribution, path patching։ Ամբողջական circuit-ը GPT-2 small-ում, ապա՝ self-repair-ը, որը կոտրում է միամիտ ablation-ը։ PDF
  • 7 · Features (հիմնական) — superposition, sparse autoencoder-ները որպես գործիք, transcoder-ներ և attribution graph-եր, steering, chain-of-thought-ի հավատարմությունը, և թե ինչի՞ համար է այս ամենը։ PDF
ImportantԳլխի ամենակարևոր գաղափարը — նայելը վարկած է, միջամտելը՝ ապացույց

Մոդելի ներսի մասին ցանկացած պնդում արժե այնքան, որքան միջամտությունը, որով այն ստուգվել է։

Ի՞նչ ենք տեսնում Ի՞նչ է դա ապացուցում
Head-ը նայում է ճիշտ բառին ոչինչ — կարող է ոչինչ չգրել
Probe-ը գտնում է տեղեկությունը տեղեկությունը առկա է, ոչ թե՝ օգտագործվում է
Neuron-ի top օրինակները մեկ թեմայի են հնարավոր է cherry-picking
Ablation-ից հետո ոչինչ չփոխվեց ոչ թե head-ն անօգուտ է — գուցե backup կա
Patching-ը վերականգնում է պատասխանը տեղեկությունն իսկապես այնտեղ է

Այս գլխի ամբողջ բովանդակությունը այս աղյուսակի վերջին տողն է՝ ինչպես անցնել առաջին չորսից հինգերորդին։

TipԵրեք բան, որ արժե հիշել
  • Չափված․ տեղեկությունը կարող է պառկել առանց օգտագործվելու։ Probe-ը «կրկնվա՞ծ է անունը» հարցին պատասխանում է 100% ճշտությամբ 3-րդ շերտից, բայց մոդելի պատասխանը չի փոխվում մինչև 9-րդ շերտը։ Վեց շերտ՝ գիտի և չի գործում։
  • Չափված․ ջնջեցինք երեք ամենակարևոր head-երը, և մոդելը լավացավ։ +3.58 → +3.75։ Փոխհատուցման 45%-ը գալիս է նրանից, որ L10H7-ը (negative name mover) դադարում է ճնշել — ոչ թե backup-երից։ Ոչ թե «պահեստը ստանձնեց», այլ արգելակն ազատվեց։
  • Չափված․ zero / mean / resample ablation-ը տալիս են տարբեր նշաններ։ Նույն երեք head-երը՝ +3.91, +3.70, +3.34։ Երբ կարդում եք «ablate արեցինք, արդյունքն ընկավ», առաջին հարցը՝ ո՞ր ablation-ը։
NoteԿապը 5-րդ գլխի հետ

5-րդ գլուխը (դասախոսություններ 22–24՝ SHAP, LIME, PFI, PDP) սև արկղի մեթոդներն են՝ մոդելը միայն հարցնում ենք։ Այս գլուխը բաց արկղն է՝ կարդում ենք կշիռներն ու ակտիվացումները։

Սա բարելավում չէ, այլ ուրիշ գործիք ուրիշ առարկայի համար։ SHAP-ն աշխատում է gradient boosting-ի վրա, որը ձեզնից շատերը իրական աշխատանքում կօգտագործեն։ Այս գլխի մեթոդները պահանջում են նեյրոնային ցանց, որի կշիռները ձեր ձեռքին են։

🔗 Հղումներ

  • Neuronpedia — feature-ների և attribution graph-երի բրաուզեր։ Ոչ մի տեղադրում, ոչ մի GPU։ Սկսելու ամենաէժան կետը։
  • ARENA, chapter 1 — վարժություններ լուծումներով։ 1.2 (TransformerLens), 1.4.1 (L46-ի circuit-ը), 1.3.3 (feature-ներ)։
  • How To Become A Mechanistic Interpretability Researcher — Neel Nanda-ի ուղեցույցը, որի հիման վրա կառուցված է այս գլուխը։
  • Welch Labs — Grokking — ընտրովի դիտում։ Մեկ circuit, ամբողջությամբ հասկացված՝ մոդուլյար գումարում սինուս-կոսինուսով։ Այն միակ դեպքն է, որտեղ ամեն ինչ ստացվեց։ L46-ը բացատրում է, թե ինչու դաշտն այնուամենայնիվ հեռացավ այս ուղղությունից։

💻 Կոդը

Բոլոր փորձերն ու գծապատկերները վերարտադրելի են՝ ml/ch19_mech_interp/py_src/։ Ամեն ինչ աշխատում է CPU-ի վրա GPT-2 small-ով (124M) — ոչ մի GPU, ոչ մի Colab։

uv pip install --python ./ma/Scripts/python.exe transformer_lens circuitsvis
./ma/Scripts/python.exe ml/ch19_mech_interp/py_src/make_ioi_dataset.py   # տվյալները
./ma/Scripts/python.exe ml/ch19_mech_interp/py_src/l45_figs.py           # L45-ի գծապատկերները

Չմշակված արդյունքները՝ results/*.json։ Գծապատկերները կարդում են այդ ֆայլերը և երբեք չեն վերագործարկում փորձը։