האוניברסיטה

שפה · יחידה 06 מתוך 20

למה ניחוש המילה הבאה מייצר טקסט

1951 · מטרת אימון אחת ופשוטה ומה היא מכריחה מערכת לבנות

ב־1951 פרסם קלוד שאנון ניסוי שראוי להיות ההתחלה של הסיפור הזה. הוא רצה למדוד כמה מידע באמת יש באות אחת של אנגלית כתובה. אם כל האותיות היו מופיעות בהסתברות שווה, אות אחת הייתה שווה כ־4.7 סיביות. כשלוקחים בחשבון את שכיחות האותיות בפועל, היא יורדת ל־4.14. כשלוקחים בחשבון גם איזו אות באה אחרי איזו, 3.56. כשמסתכלים על מילים שלמות, 2.62.

ואז הוא עשה משהו יפה. הוא לקח ספר — ביוגרפיה של תומס ג׳פרסון — בחר ממנו מאה קטעים אקראיים באורך חמש־עשרה אותיות כל אחד, והושיב אדם לנחש אות אחר אות מה בא הלאה, עם אפשרות לנסות שוב עד שיקלע. מספר הניחושים הוא המדידה. התוצאה, כשנותנים לאדם מאה אותיות של הקשר: בין 0.6 לבין 1.3 סיביות לאות. כלומר יותר משלושה רבעים ממה שכתוב באנגלית הוא עודף — הוא נגזר ממה שכבר נכתב. וזו הנקודה: מערכת שיודעת לנחש היטב את מה שבא הלאה אינה מבצעת תרגיל נחמד. היא מחזיקה, במובן מדויק, מודל של השפה.

זו כל מטרת האימון של מודל שפה. לא לענות נכון, לא להיות מועיל, לא לומר אמת. לקבל רצף ולנחש מה בא אחריו, ולהיענש לפי כמה שפספס. חוזרים על זה על כמות טקסט אדירה, והדבר שנבנה תוך כדי הוא מה שדרוש כדי לנחש טוב.

וכאן מתפצלים הדרכים. הטענה הראשונה אומרת: מה שדרוש כדי לנחש טוב הוא ידיעת צורה בלבד. מאמר משפיע מ־2020 מנסח את זה חד: ״מערכת שאומנה על צורה בלבד אין לה מראש שום דרך ללמוד משמעות״. המחברים מביאים ניסוי מחשבתי על תמנון שמצותת לכבל תקשורת בין שני אנשים, לומד להמשיך את דפוסי האותיות בצורה משכנעת לחלוטין, ואז נשאל מה לעשות כשמתקיפה אותו דוב — ואין לו שום דרך לדעת, כי מעולם לא ראה דוב. ב־2021 ניסחה אותה קבוצה את הביטוי שתפס: מודל שפה הוא ״מערכת לתפירה מקרית של רצפי צורות לשוניות שראתה בחומר האימון שלה, לפי מידע הסתברותי על איך הן מצטרפות, בלי שום התייחסות למשמעות — תוכי סטוכסטי״. בקו דומה נטען ב־2022 שכדאי פשוט להימנע ממילים כמו ״יודע״, ״מאמין״ ו״חושב״ כשמתארים מנבא אסימונים.

והטענה הנגדית אומרת: ניבוי טוב מכריח לבנות מודל של מה שמייצר את הטקסט. יש לה ראיה יפה במיוחד, שפורסמה ב־2022. חוקרים אימנו מודל מאותו סוג בדיוק על דבר אחד: רצפי מהלכים חוקיים במשחק הלוח אותלו. בלי חוקים, בלי לוח, בלי לספר לו שקיים משחק. ואז בדקו מה יש בפנים, ומצאו ייצוג פנימי של מצב הלוח. מעבר לכך, כששינו את הייצוג הזה בכוח — הזיזו ״אבן״ בתוך הרשת — הפלט השתנה בהתאם. כלומר זה לא מתאם, זה רכיב שהמערכת משתמשת בו. ב־2023 הראה חוקר אחר שהייצוג אפילו פשוט משנראה: הוא ליניארי, ומקודד לא ״במשבצת הזאת יש אבן שחורה״ אלא ״במשבצת הזאת יש אבן שלי״ — וזה הגיוני, כי אותה רשת משחקת את שני הצדדים. בכיוון דומה נמצאו במודלי שפה ייצוגים ליניאריים של מיקום גיאוגרפי ושל זמן היסטורי, ואפילו יחידות בודדות שמקודדות קואורדינטה.

אז מי צודק. שימו לב שהשאלה החלוקה כאן אינה עובדתית אלא מושגית: אף אחד לא חולק על כך שקיים ייצוג פנימי של לוח אותלו. המחלוקת היא אם לקרוא למשהו כזה ״מודל של העולם״ ואם משמעות דורשת מגע עם דבר מחוץ לטקסט. יש גם עמדה שלישית, שגורסת שמשמעות נקבעת ביחסים הפנימיים בין המצבים של מערכת ולא בהצבעה על עצמים בעולם — ולפיה השאלה ״האם יש לו משמעות״ אינה נחתכת לפי סוג הנתונים אלא לפי מבנה הפנים.

נותר פרט מכני אחד שמסביר תופעה שכל משתמש פוגש: למה אותה שאלה נותנת תשובות שונות. המודל אינו פולט מילה אלא התפלגות הסתברויות על כל המילים האפשריות, וצריך לבחור מתוכה. הבחירה החמדנית — תמיד המילה הסבירה ביותר — נשמעת כמו הבחירה הנכונה, והיא הבחירה הגרועה. במחקר מ־2019 הראו שהיא מייצרת טקסט ״תפל וחוזר על עצמו באופן מוזר״, ושאפשר לקבל מאותו מודל בדיוק, בלי לשנות בו דבר, טקסט טוב או טקסט גרוע — רק לפי שיטת הבחירה. הפתרון המקובל הוא להגריל מתוך קבוצת המילים הסבירות בלבד. מכאן האקראיות, ומכאן גם שתשובה שונה בכל פעם אינה סימן למצב רוח.

עובדות מפתח

שנה
⁦1951⁩
חלק
איך זה עובד
שער
שפה
נושא
ניבוי אסימונים

להעמיק

הסילבוס של היחידה. כל קישור נבדק — מה שלא עבד, לא נכנס.

לקריאה

  • למה הצ׳אטבוט טועההסבר עברי בדוידסון של ניבוי האסימון הבא ושל הסיבות המדויקות לטעויות שנובעות ממנו.

מקורות וארכיון

ספרים

ספרים שלמים בנושא. אין קישורי קנייה — חנויות משתנות, ספר לא.

  • נקסוסיובל נח הררי · ⁦2024⁩לא ספר מנגנון אבל הפרקים על מה שרשת מידע עושה למי שחי בתוכה נוגעים ישירות בשאלה הזאת. נכתב בעברית.
  • Artificial Intelligence: A Guide for Thinking HumansMelanie Mitchell · ⁦2019⁩פרקי השפה עוברים על הוויכוח הזה בלי להכריע ובלי לטשטש. לא אותר תרגום עברי.