فصل سی‌ودوم: ارزیابی روش‌های تفسیرپذیری

عنوان اصلی: Evaluation of Interpretability Methods
منبع: https://christophm.github.io/interpretable-ml-book/evaluation.html
نویسنده: Christoph Molnar
مترجم: مریم محمودی


تا به حال، این کتاب به معرفی روش‌های مختلف تفسیرپذیری و کاربردهایشان پرداخته است. این فصل بر ارزیابی روش‌های تفسیرپذیری متمرکز است.

ارزیابی تفسیرپذیری کار ساده‌ای نیست. این مفهوم می‌تواند برای افراد مختلف معانی متفاوتی داشته باشد. یک پزشک ممکن است تفسیرپذیری را به توانایی توضیح دادن یک پیش‌بینی خاص برای بیمار تعبیر کند، در حالی که یک محقق ممکن است آن را به توانایی کشف روابط جدید در داده‌ها معنا کند. اما خبر خوب این است که کارهای ارزشمندی در زمینه چارچوب‌بندی ارزیابی تفسیرپذیری انجام شده است. در این فصل، من رویکردهای مختلف ارزیابی را بررسی می‌کنم و خصوصیات مختلف تفسیرها را فهرست می‌کنم.

سطوح ارزیابی

مقاله درخورتوجهی توسط دوشی-ولز و همکاران (۲۰۱۷) سه سطح برای ارزیابی تفسیرپذیری پیشنهاد می‌دهد:

  1. سطح کاربرد (Application level): بهترین روش تفسیر را برای یک کار خاص انتخاب کنید. این کار اغلب نیاز به آزمایش‌های انسانی دارد و باید در چارچوب کار واقعی انجام شود.
  2. سطح انسانی (Human level): آزمایش‌های انسانی ساده‌تر، بدون کارشناس حوزه. این آزمایش‌ها مقرون‌به‌صرفه‌تر هستند و می‌توانند کیفیت عمومی تفسیرها را ارزیابی کنند.
  3. سطح تابع (Function level): نیازی به انسان ندارد. از یک تعریف ریاضی از کیفیت تفسیر استفاده می‌کند. این سطح ارزان‌ترین سطح است، اما کیفیت واقعی تفسیر را در یک کار خاص اندازه‌گیری نمی‌کند.

هرچه سطح پایین‌تر باشد، ارزیابی سریع‌تر و ارزان‌تر است، اما ریسک ارزیابی چیزی متفاوت از تفسیرپذیری واقعی نیز بیشتر است.

خصوصیات تفسیر‌ها

رویکرد دیگر برای ارزیابی روش‌های تفسیرپذیری، فهرست کردن خصوصیاتی است که یک تفسیر یا روش تفسیر باید داشته باشد. در ادامه، برخی از مهم‌ترین خصوصیات را که عمدتاً برگرفته از رابنیک-شیکونیا و بوهانیتس (۲۰۱۸) هستند، مرور می‌کنم.

خصوصیات روش‌های تفسیر

این خصوصیات به خود روش تفسیرپذیری مربوط می‌شوند، نه به یک تفسیر خاص.

  • قدرت بیانی (Expressive Power): نوع تفسیری که یک روش می‌تواند تولید کند. آیا می‌تواند قوانین if-then تولید کند؟ یک مدل خطی؟ یک خلاصه آماری؟ یک مثال؟
  • شفاف‌بودن (Translucency): آیا روش به مدل‌گر‌یری (مدل black-box) دسترسی دارد یا فقط به ورودی و خروجی؟
  • قابلیت حمل (Portability): آیا روش روی انواع مختلف مدل‌ها قابل استفاده است؟
  • پیچیدگی الگوریتمی (Algorithmic Complexity): محاسبه یک تفسیر چقدر پیچیده است؟ آیا به آموزش مدل جدید نیاز دارد؟ اجرای آن چقدر طول می‌کشد؟

خصوصیات تفسیر‌های فردی

این خصوصیات به یک تفسیر خاص (مثلاً توضیح یک پیش‌بینی) مربوط می‌شوند.

  • دقت (Accuracy): تفسیر چقدر مدل black-box را به صورت دقیق توصیف می‌کند؟ آیا تفسیر در مناطق دیگر ورودی نیز معتبر است؟ (نگاه کنید به: اثر راشومون (Rashomon Effect))
  • وفاداری (Fidelity): آیا تفسیر به خوبی رفتار مدل را در مجاورت یک نمونه خاص تقریب می‌زند؟
  • سازگاری (Consistency): آیا تفسیرهای مشابه برای نمونه‌های مشابه تولید می‌شوند؟
  • پایداری (Stability): آیا تغییرات کوچک در ورودی باعث تغییرات کوچک در تفسیر می‌شود؟
  • قابلیت فهم (Comprehensibility): آیا یک انسان می‌تواند تفسیر را بفهمد؟ آیا تفسیر خیلی پیچیده نیست؟
  • قطعیت (Certainty): آیا روش تفسیر از عدم قطعیت خودش خبر می‌دهد؟
  • درجه اهمیت (Degree of Importance): آیا روش تعیین می‌کند که هر ویژگی چقدر مهم است؟
  • تازگی (Novelty): آیا تفسیر حاوی اطلاعات جدید و غیرمنتظره است، یا فقط اطلاعات بدیهی را تکرار می‌کند؟
  • نمایندگی (Representativeness): آیا تفسیر فقط یک نمونه را توضیح می‌دهد یا کلاس وسیع‌تری از نمونه‌ها را؟

خلاصه‌ای از خصوصیات

جدول زیر خلاصه‌ای از خصوصیات روش‌ها و تفسیرهای فردی را نشان می‌دهد، همراه با کاربردهایشان در سطوح مختلف ارزیابی:

خصوصیتتوضیحسطح ارزیابی
قدرت بیانینوع تفسیر (قانون، خطی، ...)تابع
شفاف‌بودندسترسی به مدلتابع
قابلیت حمل适用於多种模型تابع
پیچیدگی الگوریتمیهزینه محاسباتیتابع
دقتتقریب مدلتابع
وفاداریتقریب محلیتابع
سازگاریتکرارپذیری بین نمونه‌های مشابهتابع / انسانی
پایداریحساسیت به نویز ورودیتابع
قابلیت فهمقابلیت درک توسط انسانانسانی
قطعیتگزارش عدم قطعیتتابع
درجه اهمیتاهمیت ویژگیتابع
تازگیاطلاعات جدیدانسانی / کاربرد
نمایندگیتعمیم‌پذیری تفسیرتابع / انسانی

منابع

  • Doshi-Velez, Finale, and Been Kim. "Towards A Rigorous Science of Interpretable Machine Learning." arXiv preprint arXiv:1702.08608 (2017).
  • Robnik-Šikonja, Marko, and Marko Bohanec. "Perturbation-Based Explanations of Prediction Models." In Human and Machine Learning, pp. 159–175. Springer, Cham (2018).