05 Interpretability

Note

📝 Սլայդերը պատրաստ են (ներքևում)։ [22]–[24] դասերն անցկացված են (նշումներով PDF-երը ներքևում), բայց տեսանյութերը դեռ չեն հրապարակվել։ [25] նախագիծը դեռ չի անցկացվել։

📚 Նյութը

Սլայդերը ml/05_interpretability/ պանակում․

  • [22] Interpreting linear models & trees — glass-box models you can just read: (standardized) coefficients as effect + importance, Lasso as built-in feature selection, why correlated features split the credit, reading a single tree, impurity importance in forests and boosting (and why each library defines it differently), and RuleFit (Friedman & Popescu, 2008) as rules + Lasso. PDF · PDF (նշումներով) · ▶️ տեսանյութը՝ շուտով
  • [23] PFI & feature effects — model-agnostic tools for any model: permutation importance (on test data), the correlation trap, and its repairs — CFI, LOCO, SAGE. Then the functional ANOVA decomposition (Hooker, 2004), ICE → PDP → M-plots → ALE, and measuring interactions with Friedman’s H. PDF · PDF (նշումներով) · ▶️ տեսանյութը՝ շուտով
  • [24] SHAP & LIME — the Shapley value from cooperative game theory (Shapley, 1953), worked by hand, what “without a feature” actually means (a background dataset), then the four SHAP plots (waterfall, bar, beeswarm, dependence). LIME step by step — sample, weight by proximity, fit a local surrogate — and counterfactual explanations as an optimization problem (validity, proximity, sparsity, plausibility, actionability). Both methods are shown on text too: SHAP per word, and LIME catching a newsgroup classifier that had learned the mail headers (the text twin of the husky/snow example). PDF · PDF (նշումներով) · ▶️ տեսանյութը՝ շուտով

📝 Թեմայի վերաբերյալ հարցաշար (Google Form): TBD

TipԵրեք դասի կարմիր թելը

Նույն տվյալների վրա (bike sharing) տարբեր մեթոդները տալիս են տարբեր «կարևորության» դասակարգումներ։ Դա սխալ չէ — պարզապես ամեն մեթոդ ուրիշ հարց է տալիս․ atemp-ը PFI-ով երկրորդն է (413), իսկ LOCO-ով՝ −0.7 (այսինքն՝ առանց նրա մոդելը մի փոքր ավելի լավն է)։ Միշտ ասեք՝ որ կարևորությունն եք նկատի ունենում։

🏡 Տնային

Chapter project — Explaining startup success 🧀🧀

472 ստարտափ, թիրախը՝ հաջողություն թե ձախողում։ Բայց խնդիրը ոչ թե ճշգրտությունն է, այլ բացատրելը — ո՞ր գործոններն են իրականում կանգնած արդյունքի հետևում։ Հենց դրա համար այս գլուխը գործիքներ տվեց․ glass-box մոդելներ, PFI, PDP/ICE։

Data: Startup_Success/data.csv (+ dictionary.csv — features-ի նկարագրությունը)։

Լուծումը (ամբողջական walkthrough): 25_startup_success_solution.ipynb (download) · view on GitHub

Քայլերը՝

  • Part 0 — EDA & data-quality audit: թիրախի բալանսը, բացակայող արժեքները, թվային features-ի բաշխումները, correlation structure։
  • Part 1 — leakage audit: այս dataset-ի ամենակարևոր քայլը։ Գտեք այն սյունը, որը «շատ լավ» է աշխատում այն պատճառով, որ արդյունքից հետո է գրանցվել — հետո հեռացրեք և նորից fit արեք։
  • Part 2 — [22]-ի glass boxes: logistic regression-ի գործակիցները, Lasso-ն որպես feature selection, և մեկ ծառ, որը կարելի է կարդալ։
  • Part 3 — [22]-ի forest: ներկառուցված impurity importance — և ինչու է այն կողմնակալ։
  • Part 4 — [23]-ի model-agnostic գործիքները: permutation importance (test-ի վրա), ապա PDP/ICE՝ էֆեկտի ձևը տեսնելու համար։
Warning

Այս գլխի ամբողջ իմաստը՝ կարևոր ≠ պատճառ։ Մոդելը ցույց է տալիս, թե ինքը ինչ է օգտագործում, ոչ թե ինչն է իրականում առաջացնում արդյունքը։

Flag Counter