יסודות · יחידה 02 מתוך 20
איך מכונה לומדת מטעות
1986 · ההליך שהתגלה מחדש ארבע פעמים עד שתפס
היחידה הקודמת נעצרה בקושי: בשכבה אחת קל לדעת איזו ידית לסובב, כי כל ידית מחוברת ישירות לתשובה. ברגע שיש שכבות באמצע, שאיש לא אמר להן מה תפקידן, השאלה נעשית קשה. אם התשובה בסוף יצאה שגויה בשתי נקודות, איזו מבין מיליון הידיות בשכבה השלישית אשמה, ובכמה. בלי תשובה לזה, רשתות עמוקות הן רעיון על הנייר.
הפתרון מתחיל בהגדרה של ״כמה טעית״ כמספר אחד. לוקחים את מה שהרשת פלטה, מחסרים ממנו את מה שרצינו, מעלים בריבוע כדי שסטייה למעלה ולמטה תיחשב שווה, ומחברים הכול. המספר הזה נקרא פונקציית ההפסד, והוא כל מה שהמכונה יודעת על ״טוב״ ו״רע״. הכול מכאן והלאה הוא ניסיון להקטין אותו.
עכשיו דמיינו נוף הררי שבו הגובה בכל נקודה הוא המספר הזה, והמיקום שלכם נקבע לפי כל הידיות יחד. למידה היא ירידה במדרון. אתם בערפל, רואים רק את השיפוע מתחת לרגליים, ועושים צעד קטן בכיוון היורד. ואז עוד אחד. זה נקרא ירידה בגרדיאנט, ובניגוד לרוב האנלוגיות בתחום היא לא מטפורה אלא תיאור מדויק, פרט לכך שהנוף הוא לא תלת־ממדי אלא בעל מיליארד מימדים.
מה שהיה חסר הוא הדרך לחשב את השיפוע הזה ביעילות עבור כל ידית בבת אחת, ולזה קוראים התפשטות לאחור. את ההליך גילו כמה פעמים בלי שאיש ישים לב. ב־1970 פרסם סֵפּוֹ לינַיינמַא את הצורה הכללית שלו כשיטה לגזירה אוטומטית. ב־1974 כתב פול וֶרבּוֹס בהרווארד דוקטורט בשם ״מעבר לרגרסיה: כלים חדשים לניבוי ולניתוח במדעי ההתנהגות״ שהכיל את הרעיון, והתקשה לפרסם אותו במשך שנים. ב־1985 תיאר אותו דיוויד פרקר. ורק באוקטובר 1986, כשדייוויד רוּמלהַארט, ג׳פרי הינטון ורונלד ויליאמס פרסמו ארבעה עמודים בכתב העת ״ניצ׳ר״, זה נתפס.
המאמר ההוא פותח בשני משפטים שמסכמים את כל התחום: ״אנו מתארים הליך למידה חדש, התפשטות לאחור, לרשתות של יחידות דמויות נוירון. ההליך מכוונן שוב ושוב את משקלי החיבורים ברשת כדי למזער מדד של ההפרש בין וקטור הפלט בפועל לבין וקטור הפלט הרצוי״. וזהו. אין שם כוונה, אין ייצוג של המטרה, אין תכנון. יש מדידה של פער וצעד קטן שמקטין אותו.
המשפט השני שחשוב במאמר הוא מה שקורה לשכבות האמצע: ״כתוצאה מכוונון המשקלים, יחידות פנימיות ׳חבויות׳ שאינן חלק מהקלט או מהפלט מגיעות לייצג תכונות חשובות של תחום המשימה״. איש לא אמר להן מה לייצג. הן נדחפו לזה מפני שזה מה שהקטין את הטעות. בדוגמה שהמחברים הביאו, רשת שהתבקשה לזהות אם רצף מספרים סימטרי ״גילתה פתרון אלגנטי בעזרת שתי יחידות ביניים בלבד״. זה הרגע שבו רשת מפסיקה להיות מסווג ומתחילה לבנות לעצמה מושגים — וזו היחידה הבאה.
ההגינות של המאמר ההוא ראויה לציון, כי היא הפוכה לטון של היום. המחברים כתבו בעצמם שני סייגים. האחד: ״החיסרון הברור ביותר של הליך הלמידה הוא שמשטח הטעות עשוי להכיל מינימה מקומיות, ולכן אין ערובה שהירידה בגרדיאנט תמצא מינימום גלובלי״ — כלומר אפשר להיתקע בגומה ולחשוב שהגעת לעמק. והשני: ״הליך הלמידה, בצורתו הנוכחית, אינו מודל סביר ללמידה במוחות״. הדימוי של ״רשת עצבית״ הוא שם היסטורי, לא טענה ביולוגית.
מה שהשתנה מאז הוא גודל, וכדאי לראות אותו בשתי תחנות מתוארכות. ב־2012 הרשת שזכתה בתחרות זיהוי התמונות הגדולה הייתה בעלת שישים מיליון פרמטרים ושמונה שכבות, ואומנה תשעים מחזורים על שני כרטיסים גרפיים ביתיים במשך חמישה עד שישה ימים. ב־2020 פורסם מודל שפה בעל מאה שבעים וחמישה מיליארד פרמטרים ותשעים ושש שכבות, שאומן על שלוש מאות מיליארד יחידות טקסט. אותה פעולה בדיוק, מוכפלת בהרבה.
ודבר אחד שמצאו כשהגדילו, שמסביר למה ״גדול יותר״ הוא לא התשובה. ב־2022 פורסם מחקר שאימן יותר מארבע מאות מודלים בגדלים שונים, מ־70 מיליון פרמטרים ועד למעלה מ־16 מיליארד, על כמויות טקסט שונות. המסקנה: לאימון יעיל צריך להגדיל את המודל ואת כמות הטקסט באותו יחס — על כל הכפלה של גודל המודל, הכפלה של הנתונים. מודל בן שבעים מיליארד פרמטרים שאומן לפי הכלל הזה עקף מודלים גדולים ממנו פי שניים עד פי שבעה שאומנו בלי לשים לב אליו. כלומר חלק גדול מהעדיפות שיוחסה לגודל נבע פשוט מכך שמודלים קודמים היו רעבים.
עובדות מפתח
- שנה
- 1986
- חלק
- איך זה עובד
- שער
- יסודות
- נושא
- אופטימיזציה
להעמיק
הסילבוס של היחידה. כל קישור נבדק — מה שלא עבד, לא נכנס.
❯לקריאה
- ירידה בגרדיאנט: איך רשת לומדתהשיעור המוכר ביותר בנושא בשפה חזותית: פונקציית ההפסד כנוף ואת הלמידה כירידה במדרון. באנגלית עם איורים ואנימציות.
- המכונות הלומדותיושוע בנג׳ו מסביר בעברית איך השכבות והמשקלים עובדים ואיך מתבצע כוונון הדרגתי.
◈מקורות וארכיון
- המאמר שהפך את זה לשימושיארבעת העמודים מ־1986 של רומלהארט הינטון וויליאמס בכתב העת ניצ׳ר. באנגלית.
- אותו מאמר במלואו לקריאהכולל הגדרת הטעות משפט היחידות החבויות ושני הסייגים של המחברים על מינימה מקומיות ועל המוח. באנגלית.
- הכלל שמגדיר מה נחשב אימון יעילהמחקר של ארבע מאות המודלים והמסקנה שגודל וכמות נתונים צריכים לגדול יחד. באנגלית.
ספרים
ספרים שלמים בנושא. אין קישורי קנייה — חנויות משתנות, ספר לא.
- The Alignment ProblemBrian Christian · 2020מספר את ההיסטוריה של ההתפשטות לאחור כסיפור אנושי כולל עשרות השנים שבהן איש לא רצה לשמוע. לא אותר תרגום עברי.
- Artificial Intelligence: A Guide for Thinking HumansMelanie Mitchell · 2019הפרקים על רשתות עצביות מסבירים את המנגנון בלי מתמטיקה ובלי להחמיא לו. לא אותר תרגום עברי.
ההערה שלי
נשמרת בדפדפן הזה תוך כדי הכתיבה, ולא נשלחת לשום מקום.