מה יוצא מזה · יחידה 10 מתוך 20
איך בכלל מודדים
1950 · מבחן שהפך למטרה מפסיק להיות מבחן
ב־1950 פתח אלן טיורינג מאמר במילים ״אני מציע לשקול את השאלה, האם מכונות יכולות לחשוב״. מה שקרה אחר כך באותו מאמר נשכח כמעט לגמרי. טיורינג לא ניסה לענות על השאלה. הוא כתב שהיא ״חסרת משמעות מכדי שתהיה ראויה לדיון״, והציע להחליף אותה בשאלה אחרת שאפשר להכריע בה: משחק חיקוי, שבו חוקר מתכתב עם שני משתתפים ומנסה לקבוע מי מהם מי. בגרסה המקורית מדובר בגבר ובאישה, והמכונה נכנסת במקום אחד מהם. טיורינג גם נתן ניבוי מדוד: בעוד כחמישים שנה, למחשב עם זיכרון של סדר גודל מסוים, ״חוקר ממוצע לא יהיה לו יותר משבעים אחוז סיכוי לזהות נכון אחרי חמש דקות של תשאול״.
שימו לב מה הוא לא אמר. הוא לא הגדיר מבחן שמי שעובר אותו חושב, ולא טען שמעבר במבחן מוכיח תודעה. הוא ביצע החלפה של שאלה פילוסופית בשאלה תפעולית, והודה בכך במפורש. כל השימוש הפופולרי ב״מבחן טיורינג״ כרף שמוכיח משהו הוא תוספת מאוחרת. ומה שקרה בפועל למבחן מוכיח למה הוא נזנח: ב־2014 הוכרז שתוכנה עברה אותו בכך שהתחזתה לנער בן שלוש־עשרה, סרקסטי ודובר אנגלית כשפה שנייה — כלומר בנתה לעצמה תירוץ לכל תשובה משונה. המבחן תגמל התחמקות משכנעת, לא הבנה.
התחום עבר אפוא למבחנים ממוקדים: אוספי שאלות עם תשובות נכונות ידועות, וציון אחוז. זה נשמע מוצק, ויש בו שלוש חולשות שצריך להכיר.
הראשונה היא תוקף מבני, שזה השם המקצועי לשאלה הפשוטה ״האם המבחן מודד את מה שאמרו שהוא מודד״. ביקורת שפורסמה ב־2021 טענה שהתחום מקדש אוסף קטן של מבחנים ומתייחס אליהם כאילו הם מייצגים יכולת כללית, בעוד שכל אחד מהם נבנה למשימה צרה ומסוימת. עבודה מקבילה באותה שנה הביאה מסגרת מהמדעים החברתיים: מושגים כמו ״סיכון״ או ״יכולת״ אינם נצפים, ומי שמודד אותם בונה תחליף נצפה — ובפער בין המושג לתחליף נולדות רוב הטעויות. זו אותה תבנית בדיוק כמו האלגוריתם הרפואי שמדד הוצאה במקום מחלה.
השנייה היא זיהום. חומר האימון נגרף מהרשת, והמבחנים נמצאים ברשת. כשמודל נבחן על שאלות שהיו בחומר האימון שלו, הציון מודד זיכרון ולא יכולת. סקירה מ־2023 מנסחת את מצב הידע ביושר: ״היקף הבעיה אינו ידוע, מפני שלא פשוט למדוד אותו״. ב־2024 נעשה הניסוי הנקי — צוות בנה אלף שאלות חשבון חדשות לגמרי, בדיוק באותו סגנון ובאותה רמת קושי של מבחן ותיק ומוכר, ובדק את אותם מודלים על שניהם. הירידה הגיעה עד שמונה נקודות אחוז, ומודלים שנטו יותר לשחזר מילה במילה את שאלות המבחן הישן הראו ירידה גדולה יותר. ההגינות של אותו מחקר ראויה לציון: הוא גם מצא שחלק גדול מהמודלים המתקדמים הראו סימנים מעטים בלבד להתאמת יתר, כלומר הם באמת פותרים תרגילים חדשים.
השלישית היא הבעיה הכללית ביותר, ואינה ייחודית למחשבים: כשמדד הופך למטרה, הוא מפסיק להיות מדד טוב. ב־2019 נעשה ניסוי יפה בתחום התמונות — בנו מחדש מערכת מבחן לפי אותה שיטת איסוף בדיוק של מערכת המבחן המקורית, ובדקו עליה את המודלים המובילים. הדיוק ירד באחת־עשרה עד ארבע־עשרה נקודות אחוז. אבל המסקנה של המחברים הייתה מעניינת יותר מהמספר: הירידה לא נבעה מכך שהתחום ״התאמן על המבחן״, אלא מכך שהתמונות החדשות היו מעט קשות יותר, ושיפורים על המבחן הישן תורגמו לשיפורים פרופורציוניים על החדש. כלומר הדירוג בין המודלים שרד; המספר המוחלט לא. וזה בדיוק מה שאפשר לומר על רוב הציונים שמדווחים: הם משווים היטב וקובעים רע.
ויש חיבור ישיר בין היחידה הזאת לקודמת. אם המבחן נותן נקודה על תשובה נכונה, אפס על תשובה שגויה ואפס על ״אני לא יודע״, אז מערכת שממקסמת ציון תנחש תמיד. חלק ממה שנתפס כהמצאה של עובדות הוא פשוט התנהגות של נבחן שהמבחן שלו בנוי כך. אפשר לשנות את זה, והשינוי אינו בטכנולוגיה אלא בניקוד.
עובדות מפתח
- שנה
- 1950
- חלק
- איך זה עובד
- שער
- מה יוצא מזה
- נושא
- מדידה והערכה
להעמיק
הסילבוס של היחידה. כל קישור נבדק — מה שלא עבד, לא נכנס.
❯לקריאה
- הערך על מבחן טיורינג באנציקלופדיה לפילוסופיה של סטנפורדמה הוצע בדיוק אילו גרסאות יש ולמה התחום הפסיק להתייחס לזה כמדד. באנגלית.
- החיפוש אחר מבחן חדשמאמר עברי בדוידסון על למה מבחן טיורינג נשבר ואילו מבחנים הוצעו במקומו.
◈מקורות וארכיון
- המאמר של טיורינג במלואוכולל המשפט שהשאלה אם מכונות חושבות חסרת משמעות מכדי לדון בה ואת הניבוי המדויק לחמישים שנה. באנגלית.
- הביקורת על תרבות המבחניםהטענה שאוסף קטן של מבחנים הפך לנציג של יכולת כללית שהוא לא מודד. באנגלית.
- אלף שאלות חדשות באותו סגנוןהניסוי שבדק כמה מהציון במבחן ותיק נובע מהיכרות עם המבחן עצמו. באנגלית.
- מה קורה כשבונים את אותו מבחן מחדשהבדיקה שמצאה ירידה של אחת־עשרה עד ארבע־עשרה נקודות והסבירה למה הדירוג בכל זאת שרד. באנגלית.
ספרים
ספרים שלמים בנושא. אין קישורי קנייה — חנויות משתנות, ספר לא.
- Artificial Intelligence: A Guide for Thinking HumansMelanie Mitchell · 2019פרק שלם על מה מבחנים בתחום באמת בודקים ולמה קל כל כך להשתכנע מציון. לא אותר תרגום עברי.
- ההיסטוריה הקצרה של ה-AIטובי וולש · 2023מראה כמה פעמים כבר הוכרז שרף נפרץ וכמה מהר הרף עבר מקום. יצא בעברית בהוצאת תכלת.
ההערה שלי
נשמרת בדפדפן הזה תוך כדי הכתיבה, ולא נשלחת לשום מקום.