فصل سیودوم: ارزیابی روشهای تفسیرپذیری
عنوان اصلی: Evaluation of Interpretability Methods
منبع: https://christophm.github.io/interpretable-ml-book/evaluation.html
نویسنده: Christoph Molnar
مترجم: مریم محمودی
تا به حال، این کتاب به معرفی روشهای مختلف تفسیرپذیری و کاربردهایشان پرداخته است. این فصل بر ارزیابی روشهای تفسیرپذیری متمرکز است.
ارزیابی تفسیرپذیری کار سادهای نیست. این مفهوم میتواند برای افراد مختلف معانی متفاوتی داشته باشد. یک پزشک ممکن است تفسیرپذیری را به توانایی توضیح دادن یک پیشبینی خاص برای بیمار تعبیر کند، در حالی که یک محقق ممکن است آن را به توانایی کشف روابط جدید در دادهها معنا کند. اما خبر خوب این است که کارهای ارزشمندی در زمینه چارچوببندی ارزیابی تفسیرپذیری انجام شده است. در این فصل، من رویکردهای مختلف ارزیابی را بررسی میکنم و خصوصیات مختلف تفسیرها را فهرست میکنم.
سطوح ارزیابی
مقاله درخورتوجهی توسط دوشی-ولز و همکاران (۲۰۱۷) سه سطح برای ارزیابی تفسیرپذیری پیشنهاد میدهد:
- سطح کاربرد (Application level): بهترین روش تفسیر را برای یک کار خاص انتخاب کنید. این کار اغلب نیاز به آزمایشهای انسانی دارد و باید در چارچوب کار واقعی انجام شود.
- سطح انسانی (Human level): آزمایشهای انسانی سادهتر، بدون کارشناس حوزه. این آزمایشها مقرونبهصرفهتر هستند و میتوانند کیفیت عمومی تفسیرها را ارزیابی کنند.
- سطح تابع (Function level): نیازی به انسان ندارد. از یک تعریف ریاضی از کیفیت تفسیر استفاده میکند. این سطح ارزانترین سطح است، اما کیفیت واقعی تفسیر را در یک کار خاص اندازهگیری نمیکند.
هرچه سطح پایینتر باشد، ارزیابی سریعتر و ارزانتر است، اما ریسک ارزیابی چیزی متفاوت از تفسیرپذیری واقعی نیز بیشتر است.
خصوصیات تفسیرها
رویکرد دیگر برای ارزیابی روشهای تفسیرپذیری، فهرست کردن خصوصیاتی است که یک تفسیر یا روش تفسیر باید داشته باشد. در ادامه، برخی از مهمترین خصوصیات را که عمدتاً برگرفته از رابنیک-شیکونیا و بوهانیتس (۲۰۱۸) هستند، مرور میکنم.
خصوصیات روشهای تفسیر
این خصوصیات به خود روش تفسیرپذیری مربوط میشوند، نه به یک تفسیر خاص.
- قدرت بیانی (Expressive Power): نوع تفسیری که یک روش میتواند تولید کند. آیا میتواند قوانین if-then تولید کند؟ یک مدل خطی؟ یک خلاصه آماری؟ یک مثال؟
- شفافبودن (Translucency): آیا روش به مدلگریری (مدل black-box) دسترسی دارد یا فقط به ورودی و خروجی؟
- قابلیت حمل (Portability): آیا روش روی انواع مختلف مدلها قابل استفاده است؟
- پیچیدگی الگوریتمی (Algorithmic Complexity): محاسبه یک تفسیر چقدر پیچیده است؟ آیا به آموزش مدل جدید نیاز دارد؟ اجرای آن چقدر طول میکشد؟
خصوصیات تفسیرهای فردی
این خصوصیات به یک تفسیر خاص (مثلاً توضیح یک پیشبینی) مربوط میشوند.
- دقت (Accuracy): تفسیر چقدر مدل black-box را به صورت دقیق توصیف میکند؟ آیا تفسیر در مناطق دیگر ورودی نیز معتبر است؟ (نگاه کنید به: اثر راشومون (Rashomon Effect))
- وفاداری (Fidelity): آیا تفسیر به خوبی رفتار مدل را در مجاورت یک نمونه خاص تقریب میزند؟
- سازگاری (Consistency): آیا تفسیرهای مشابه برای نمونههای مشابه تولید میشوند؟
- پایداری (Stability): آیا تغییرات کوچک در ورودی باعث تغییرات کوچک در تفسیر میشود؟
- قابلیت فهم (Comprehensibility): آیا یک انسان میتواند تفسیر را بفهمد؟ آیا تفسیر خیلی پیچیده نیست؟
- قطعیت (Certainty): آیا روش تفسیر از عدم قطعیت خودش خبر میدهد؟
- درجه اهمیت (Degree of Importance): آیا روش تعیین میکند که هر ویژگی چقدر مهم است؟
- تازگی (Novelty): آیا تفسیر حاوی اطلاعات جدید و غیرمنتظره است، یا فقط اطلاعات بدیهی را تکرار میکند؟
- نمایندگی (Representativeness): آیا تفسیر فقط یک نمونه را توضیح میدهد یا کلاس وسیعتری از نمونهها را؟
خلاصهای از خصوصیات
جدول زیر خلاصهای از خصوصیات روشها و تفسیرهای فردی را نشان میدهد، همراه با کاربردهایشان در سطوح مختلف ارزیابی:
| خصوصیت | توضیح | سطح ارزیابی |
|---|---|---|
| قدرت بیانی | نوع تفسیر (قانون، خطی، ...) | تابع |
| شفافبودن | دسترسی به مدل | تابع |
| قابلیت حمل | 适用於多种模型 | تابع |
| پیچیدگی الگوریتمی | هزینه محاسباتی | تابع |
| دقت | تقریب مدل | تابع |
| وفاداری | تقریب محلی | تابع |
| سازگاری | تکرارپذیری بین نمونههای مشابه | تابع / انسانی |
| پایداری | حساسیت به نویز ورودی | تابع |
| قابلیت فهم | قابلیت درک توسط انسان | انسانی |
| قطعیت | گزارش عدم قطعیت | تابع |
| درجه اهمیت | اهمیت ویژگی | تابع |
| تازگی | اطلاعات جدید | انسانی / کاربرد |
| نمایندگی | تعمیمپذیری تفسیر | تابع / انسانی |
منابع
- Doshi-Velez, Finale, and Been Kim. "Towards A Rigorous Science of Interpretable Machine Learning." arXiv preprint arXiv:1702.08608 (2017).
- Robnik-Šikonja, Marko, and Marko Bohanec. "Perturbation-Based Explanations of Prediction Models." In Human and Machine Learning, pp. 159–175. Springer, Cham (2018).