האוניברסיטה

יסודות · יחידה 03 מתוך 20

שכבות וייצוגים

2012 · מה שהרשת בונה לעצמה כשאיש לא אומר לה מה לבנות

בספטמבר 2012 התפרסמו תוצאות תחרות שנתית לזיהוי תמונות. במשך שנתיים היו הציונים הטובים בסביבות עשרים ושמונה אחוזי שגיאה ואז עשרים וחמישה. באותה שנה הוגשה רשת עמוקה, ושיעור השגיאה שלה היה חמישה עשר ושלושה עשיריות האחוז — למעלה מעשר נקודות מתחת למקום השני. בתחום שבו התקדמות שנתית נמדדת בנקודה או שתיים, זה לא היה שיפור אלא הכרזה. התחום כולו עבר לרשתות עמוקות בתוך שנה. לשם קנה מידה: בשנת 2015 ירדה השגיאה ל־3.57 אחוזים, וב־2017 לכ־2.25, בסביבות הרמה של אדם שמשקיע מאמץ מלא באותה משימה.

מה בעצם קרה שם. ברשת עמוקה, כל שכבה מקבלת את מה שהשכבה שלפניה הוציאה ובונה ממנו משהו מורכב יותר. אף אחד לא מגדיר את השלבים. הם נוצרים מפני שהם מקטינים את הטעות. השאלה אם זה באמת מה שמתרחש הייתה במשך שנים אמונה מקצועית, עד שמישהו פתח את הקופסה והסתכל.

ב־2013 פרסמו מתיו זיילר ורוב פרגוס שיטה להציג מה גורם ליחידה מסוימת בעומק הרשת להתעורר. ב־2020 נמשכה העבודה בצורה שיטתית: קבוצת חוקרים לקחה רשת זיהוי תמונות אחת, עברה על 1,056 היחידות הראשונות שלה, וקטלגה אותן אחת אחת. התוצאות מדויקות באופן שקשה להתווכח איתו. בשכבה הראשונה, מתוך שישים וארבע יחידות, ארבעים וארבעה אחוזים הם גלאי קווים בכיוון מסוים וארבעים ושניים אחוזים גלאי ניגוד צבע. זהו. שכבה שלמה שלא עושה שום דבר מלבד לשאול ״יש כאן קו, ובאיזו זווית״. בשכבה השנייה מופיעים גלאי תדר נמוך וצירופי צבע. בשלישית, מתוך מאה תשעים ושתיים יחידות, כבר יש גלאי קו ממש, מרקמים, ועקומות קטנות. ובשכבות עמוקות יותר נמצאו גלאי עקומה בכל זווית, גלאים שמבחינים בין אזור חלק לאזור מחוספס — שימושי מאוד לאיתור גבול של עצם — וגלאי ראש כלב שמגיב לאותו ראש מזוויות שונות.

וזה בדיוק הסדר שהוסבר בלי ראיות במשך עשרים שנה: קווים, אחר כך מרקמים, אחר כך חלקים, אחר כך עצמים. אף אחד לא תכנן אותו. החוקרים כתבו שאפשר ״לקרוא אלגוריתמים בעלי משמעות ישירות מתוך המשקלים״, והם הראו כמה כאלה: איך גלאי עקומה בנוי מגלאי קווים בזוויות סמוכות, ומה מחובר למה.

עד כאן הצד שיודעים. עכשיו הצד שלא, והוא גדול יותר. הבעיה הראשונה נקראת רב־משמעות: יחידה אחת ברשת מגיבה לעיתים קרובות לכמה דברים שאין ביניהם קשר. החוקרים מביאים יחידה שמגיבה לפרצופי חתולים, לחזיתות של מכוניות ולרגלי חתולים גם יחד. ההסבר המקובל היום, שנוסח ב־2022, נקרא סוּפֶּרפּוֹזיציה: לרשת יש הרבה יותר מושגים שכדאי לה להחזיק מאשר יחידות פנויות, ולכן היא דוחסת כמה מהם לאותה יחידה ומסתמכת על כך שנדיר שהם יופיעו יחד. יעיל מאוד. בלתי קריא לחלוטין.

מאז מנסים לחלץ את המושגים הדחוסים בכלים ייעודיים, ויש התקדמות אמיתית. עבודה מ־2024 חילצה ממודל שפה מיליון מושגים נפרדים בניסוי אחד וכשלושים וארבעה מיליון באחר. אבל כדאי לקרוא מה המחברים עצמם כתבו על המגבלה: ״גם במפרק בן שלושים וארבעה מיליון אנו רואים עדויות לכך שקבוצת התכונות שחשפנו היא תיאור חלקי של הייצוגים הפנימיים של המודל״. באותו ניסוי הגדול, שישים וחמישה אחוזים מהמושגים שחולצו התגלו כמתים, כלומר לא מגיבים כמעט לשום דבר.

ובאותה רוח, המשפט שראוי להיות בכל דיון על ״הבנה של רשתות״ נכתב בידי מי שעשו את העבודה הטובה ביותר בתחום, בפתח המאמר שלהם: הטענות שלהם ״ספקולטיביות במתכוון״, ו״האמת היא שרק גירדנו את פני השטח של הבנת מודל ראייה יחיד״. זה נכתב ב־2020 על רשת קטנה יחסית, וכל מה שקרה מאז הוא שהמודלים גדלו.

אז מה התשובה הנכונה לשאלה ״האם מבינים מה קורה בפנים״. לא ״כן״ ולא ״זו קופסה שחורה״. התשובה היא שיש מדע צעיר עם שיטות שעובדות, עם ממצאים חוזרים שנמדדו, ועם הודאה מפורשת של העוסקים בו שהם מתארים שבריר. ומי שמצטט את המשפט ״אפילו המתכנתים לא יודעים מה קורה שם״ כדי לסיים דיון — מצטט נכון ומסיק לא נכון.

עובדות מפתח

שנה
⁦2012⁩
חלק
איך זה עובד
שער
יסודות
נושא
ייצוגים פנימיים

להעמיק

הסילבוס של היחידה. כל קישור נבדק — מה שלא עבד, לא נכנס.

לקריאה

מקורות וארכיון

ספרים

ספרים שלמים בנושא. אין קישורי קנייה — חנויות משתנות, ספר לא.

  • Artificial Intelligence: A Guide for Thinking HumansMelanie Mitchell · ⁦2019⁩הפרק על ראייה ממוחשבת מסביר מה רשת באמת מזהה ובאיזה מובן זה שונה מראייה. לא אותר תרגום עברי.
  • Atlas of AIKate Crawford · ⁦2021⁩לא על הפנים של הרשת אלא על מה שמסביבה אבל הפרק על מאגרי התמונות הכרחי כדי להבין מה היא ראתה. לא אותר תרגום עברי.