هر سامانهی خودکاری خطا میکند. پرسش این است که آیا کاربرانش میتوانند آن خطاها را ببینند. ابزاری که فقط موفقیتهایش را گزارش میدهد، اعتمادی میخواهد که هنوز ثابتش نکرده. ابزاری که خطاهایش را نشان میدهد، چیزی به کاربران میدهد که برای تصمیم دربارهی میزان تکیه بر آن لازم دارند.
ادعای دقت هم به شاهد نیاز دارد
«دقت ۹۹ درصدی» ادعایی است مثل هر ادعای دیگر. دقت روی چه چیزی؟ چه کسی آن را سنجیده؟ در برابر کدام مرجع؟ عدد دقتی که نمونههای آزمونش معلوم نباشد، دقیقاً همان ادعای بیپشتوانهای است که یک راستیآزما باید رد کند. به همین دلیل Honest Lens استاندارد خودش را دربارهی خودش هم به کار میبرد: صفحهی خودآزمایی نمونهها را تکتک فهرست میکند، نتیجهی مرجع، نتیجهی موتور و یادداشتی برای هر کدام، از جمله موارد اختلاف.
الگوهای خطا، نه فقط نرخ خطا
یک نرخ خطای واحد چیز زیادی دربارهی اینکه کی باید محتاط بود نمیگوید. الگوهای خطا مفیدترند. الگوهایی که باید از یک راستیآزمای هوش مصنوعی انتظار داشت و او باید به کاربرانش اطلاع دهد عبارتاند از:
- کنایه و اصطلاحات محلی. طعنه و تعبیرهای منطقهای ممکن است بهعنوان ادعایی تحتاللفظی خوانده شوند، بهویژه هنگام گذر از یک زبان به زبان دیگر.
- آمارهای تودرتو. وقتی منبعی یک زیرمجموعه را از کل جدا میکند، مدل ممکن است این دو را با هم اشتباه بگیرد.
- اسناد در دسترس نبودن. وقتی سوابق رسمی دیجیتال یا عمومی نیستند، تنها پاسخ صادقانه «شواهد ناکافی» است.
- رویدادهای تازه. هر چیزی پس از پایان دادههای آموزشی مدل برایش ناشناخته است، مگر اینکه اطلاعاتش داده شود.
چرا «نمیدانم» موفقیت به حساب میآید
موتوری که وقتی شواهد ضعیف است از داوری خودداری میکند، شکست نخورده؛ همانطور که طراحی شده کار میکند. به همین دلیل خودآزمایی، امتناعهای صادقانه را بهعنوان دستهای جداگانه دنبال میکند، نه اینکه آنها را خطا حساب کند یا پنهانشان کند.
کاربران چه میتوانند بکنند
- توضیح را بخوانند، نه فقط نتیجه را.
- منابع را بررسی کنند، بهویژه برای ادعاهای پرپیامد.
- از دکمههای داوری همتا کنار هر ادعا استفاده کنند تا ارزیابیهایی را که بیش از حد سختگیرانه یا ناقص به نظر میرسند علامت بزنند.
اصل ماجرا
شفافیت ویژگیای نیست که وقتی سامانه خوب کار کرد اضافه شود. تنها راهی است که هر کسی، از جمله سازندگانش، بتواند بفهمد آیا اصلاً کار میکند یا نه.