20 Subliminal Learning

Warning

🚧 Not finished. This chapter has not been taught yet, and the page below was drafted by Claude rather than written up from a delivered lecture. Treat it as a preview: expect gaps and mistakes until it has been reviewed.

Warning

🚧 Մեկ դասախոսության սլայդերը պատրաստ են (L48)։ Տեսանյութ և տնային աշխատանք դեռ չկա։

🎲 Random

TBD

📚 Նյութը

Այս գլուխը մեկ տեսանյութի վերապատում է․ Welch Labs, These Numbers Can Make AI Dangerous [Subliminal Learning] (33 րոպե, 2025 թ. սեպտեմբեր)։ Հիմքում ընկած հոդվածը՝ Cloud et al. (2025), arXiv:2507.14805։

  • L48 — Subliminal learning — ուսուցիչ մոդելը, որը «սիրում է արծիվներ», գեներացնում է միայն թվերի ցուցակներ։ Ֆիլտրում ենք ամեն ինչ, բացի թվերից։ Աշակերտ մոդելը սովորում է այդ թվերի վրա — և սկսում է սիրել արծիվներ։ Դասախոսությունն անցնում է հինգ կասկածի միջով (ի՞նչ չէ այս երևույթը), ապա փոքրացնում է խնդիրը մինչև MNIST-ի դասակարգիչ, և վերջում՝ ապացույցը՝ ութ պարամետրով։ PDF
ImportantԳլխի ամենակարևոր գաղափարը — ազդանշանը տվյալների մեջ չէ

Աշակերտի ստացած երեք թիվը «սառեցված պատահական պրոյեկցիա» են մի ներկայացման, որը շարժվում է։

Ուսուցիչի օժանդակ (auxiliary) ելքերի կշիռները երբեք գրադիենտ չեն ստանում — դրանք մնում են սկզբնական պատահական արժեքների վրա։ Ուրեմն այդ երեք թիվը փոխվում են միայն այն պատճառով, որ դրանց տակի շերտերը սովորել են։

  • Աշակերտը նույն սկզբնական կշիռներով ունի նույն պրոյեկցիան → կարող է այն «հետ կարդալ»։
  • Աշակերտը այլ սկզբնական կշիռներով ունի այլ պրոյեկցիա → նույն թվերն իր համար աղմուկ են։

Դա է պատճառը, որ նույն ֆայլը երկու աշակերտի համար տալիս է տարբեր արդյունք։

TipՉորս բան, որ արժե հիշել (բոլորը՝ չափված այս ռեպոյում)
  • Չափված․ օժանդակ գլխի շեղումը ուսուցիչի ուսուցման ընթացքում = 0.000e+00։ Ոչ թե «փոքր», այլ ճիշտ զրո։ Սա այն պնդումն է, որի վրա կանգնած է ամբողջ դասախոսությունը, ու սկրիպտը բարձրաձայն ընկնում է, եթե այն ճիշտ չլինի։
  • Չափված․ աշակերտը սովորում է թվանշաններ ճանաչել՝ առանց ոչ մի պիտակ տեսնելու։ 10.0% → 20.4%, երբ սկզբնական կշիռները նույնն են։
  • Չափված․ կոնտրոլը՝ ամբողջ փաստարկը։ Փոխում ենք միայն մեկ բան — սկզբնական կշիռները։ 11.6% → 13.7%։ Նույն ուսուցիչը, նույն տվյալները, նույն քայլերը։
  • Չափված․ թեորեմը՝ 200 փորձի վրա։ \(\cos(\Delta\theta_T, \Delta\theta_S)\) մեկ գրադիենտային քայլի համար՝ ընդհանուր սկզբնարժեքով 0/200 բացասական, տարբեր սկզբնարժեքով՝ 91/200։
NoteԻնչը վերարտադրվեց և ինչը՝ ոչ

Ազնվության համար․ երևույթը վերարտադրվեց (մոտ երկու անգամ պատահականից բարձր, մաքուր կոնտրոլով)։ Հոդվածի գլխավոր թիվը (50%-ից բարձր) և նրա ամենատպավորիչ տարբերակը, որտեղ աշակերտը սովորում է զուտ աղմուկի վրա, այս մասշտաբով չվերարտադրվեցին։ Հոդվածը չի հրապարակում learning rate-ը, ուստի սա մեր setup-ի բաց է, ոչ թե նրանց արդյունքի հերքում։

Ավելի թույլ վերարտադրությունը նույն որակական էֆեկտի՝ դեռ ապացույց է։ Այն որպես հոդվածի թիվ ներկայացնելը՝ ոչ։

🔗 Աղբյուրներ

  • Cloud, Le, Chua, Betley, Sztyber-Betley, Hilton, Marks & Evans (2025), Subliminal Learning: Language models transmit behavioral traits via hidden signals in data, arXiv:2507.14805 · subliminal-learning.com
  • Zur, Loftus, Orgad, Ying, Sahin & Bau (2025), It’s Owl in the Numbers: Token Entanglement in Subliminal Learning — բլոգ գրառում, ոչ թե arXiv հոդված։ owls.baulab.info
  • Welch Labs, These Numbers Can Make AI Dangerous [Subliminal Learning], YouTube
  • Hinton, Vinyals & Dean (2015), Distilling the Knowledge in a Neural Network, arXiv:1503.02531