15 Vision-Language-Action Models
🚧 Դասախոսության սլայդերը պատրաստ են (L38)։ Տեսանյութը դեռ չի ձայնագրվել, տնային աշխատանք դեռ չկա։
Ուղիղ շարունակությունն է ch12-ի (VLM) և ch11-ի (RL)․ VLA-ն vision-language մոդել է, որի ելքը շարժման հրաման է։ Առանց այդ երկուսի այս գլուխը կարդալ պետք չէ։
🎲 Random
TBD
📚 Նյութը
Մեկ դասախոսություն (սլայդերը ml/ch15_vla/ պանակում)։
- L38 — Vision-Language-Action Models — ինչպես է vision-language մոդելը դառնում գործող մոդել․ action tokenization, action chunking, կառավարման հաճախականությունը, ինչու է ռոբոտի տվյալը երեք կարգով պակաս, ապա՝ գլխի ամենակարևոր մասը՝ ինչ է իրականում չաշխատում։ PDF
VLA-ն կոչվում է Vision-Language-Action։ Բայց չափումները ցույց են տալիս, որ լեզվական ալիքը հաճախ գրեթե ոչինչ չի անում․
- generalized պայմաններում 90%+ արդյունք ցույց տվող մոդելները փլուզվում են մինչև 0.0%,
- իսկ հրահանգը անիմաստ տառաշարով փոխարինելը տալիս է նույն շարժման հետագիծը։
Այսինքն՝ մոդելը հաճախ պարզապես անտեսում է, թե ինչ եք խնդրել, և կատարում է այն, ինչ սովորել է տեսարանից։
Սա ch12-ի hallucination-ի frame-ի շարունակությունն է, բայց ավելի սուր․ այնտեղ լեզվական prior-ը գերակշռում էր թույլ տեսողական ապացույցին, այստեղ լեզվական մուտքը կարող է ամբողջովին անտեսվել, և մոդելը դեռ 90% ցույց տա։
Հայերենի համար պատկերն ավելի վատ է․ ոչ-անգլերեն հրահանգները արժենում են 30–50% անկում։
1. Հաջողությունը անվտանգության չափանիշ չէ։ RedVLA-ի չափմամբ ավելի ուժեղ policy-ն նաև ավելի խոցելի է՝ benign հաջողությունը 76.5% → 97.1%, հարձակման հաջողությունը՝ 64.9% → 90.5%։ Եվ վնասը գալիս է հենց աշխատանքի ընթացքում, ոչ թե փլուզումից․ ռոբոտը կատարում է առաջադրանքը և վնաս պատճառում ճանապարհին։
2. Հրապարակված համեմատությունների մեծ մասը աղմուկ է։ 20 փորձի վրա 70% և 80% արդյունքները վիճակագրորեն չեն տարբերվում (95% Wilson՝ [48%, 85%] ընդդեմ [58%, 92%])։ Ինտերվալները դադարում են հատվել միայն n = 289-ից։ Իսկ տիպիկ հրապարակված փորձերի քանակը՝ 10–20։
Դասախոսությունը այս չափանիշը կիրառում է նաև ինքն իր վրա (frame 34)։
🏡 Տնային
TBD