האוניברסיטה

שפה · יחידה 05 מתוך 20

מילים כמספרים

2013 · מה קורה כשמחליפים משמעות בשכנוּת

ב־1957 כתב הבלשן הבריטי ג׳ון רופרט פירת׳ משפט שהפך למשפט המכונן של התחום: ״תכיר מילה לפי החברה שבה היא מסתובבת״. הוא לא היה הראשון. פירת׳ עצמו מפנה לוויטגנשטיין, שטען שמשמעותה של מילה נמצאת בשימוש בה; ביוונית יש שורה דומה אצל אוריפידס, ובלטינית פתגם משפטי עתיק. אבל הניסוח של פירת׳ הוא שהפך להוראת הפעלה.

וההוראה היא זו: אל תנסה להגדיר מה מילה אומרת. תסתכל במקום זה על כל המילים שמופיעות לידה, בטקסט רב ככל האפשר. ואז תן לכל מילה רשימה של מספרים — כמה מאות מספרים — כך שמילים שמופיעות בחברה דומה יקבלו רשימות דומות. הרשימה הזאת נקראת וקטור, וממנה והלאה אפשר לחשב. ״קרוב״ ו״רחוק״ הופכים למרחק שאפשר למדוד. זה כל התרגום של שפה למתמטיקה, והוא היה מספיק.

התוצאה שהפכה את הרעיון למפורסם פורסמה ב־2013. מתברר שהיחסים בין המילים נשמרים לא רק כקרבה אלא ככיוון: המרחק והכיוון מ״גבר״ ל״מלך״ דומים למרחק והכיוון מ״אישה״ ל״מלכה״. ולכן אפשר לחשב. לוקחים את הווקטור של ״מלך״, מחסרים ״גבר״, מוסיפים ״אישה״, ומחפשים את המילה הקרובה ביותר לתוצאה. יוצא ״מלכה״. אותו טריק עובד גם על דקדוק: מ״הולך״ ל״הלך״ הוא אותו כיוון כמו מ״רץ״ ל״רץ בעבר״. במבחן שבנו המחברים היו שמונת אלפים שאלות כאלה.

וכאן נכנס תיקון שראוי להכיר, כי הוא משנה את מה שמותר להסיק. בכל המימושים הסטנדרטיים של הטריק הזה, שלוש מילות הקלט מוצאות מרשימת התשובות האפשריות. כלומר כשמחשבים ״מלך פחות גבר ועוד אישה״, המערכת אינה רשאית להחזיר ״מלך״, ״גבר״ או ״אישה״. הכלל נכנס משום שהמבחן המקורי בנוי מארבע מילים שונות. אבל מסתבר שהוא לא טכני. במחקר מ־2019 הסירו את המגבלה ובדקו: הדיוק צנח משבעים וארבעה אחוזים לעשרים ואחד. במילים אחרות, ביותר משני שלישים מהמקרים התשובה ״הנכונה״ מתקבלת רק מפני שאסור לתת את התשובה שהחישוב בעצם מצביע עליה, והיא לרוב אחת ממילות הקלט. שם המאמר הוא סיכום העניין: ״גבר הוא לרופא כמו שאישה היא לרופא״. מבקרים נוספים הראו שהמבחן רגיש מאוד לגחמות של מילים בודדות, ושחיפוש מתוחכם יותר מוצא מידע שהשיטה הפשוטה מפספסת. אז הטריק אמיתי והוא הרבה פחות נקי ממה שמראים.

מה שכן עמיד לגמרי הוא מה שהווקטורים חשפו על הטקסט שממנו נלמדו. ב־2016 פורסם מאמר בשם ״גבר הוא למתכנת מחשבים כמו שאישה היא לעקרת בית?״, שהראה שוקטורים שאומנו על ארכיון חדשות מכילים אסוציאציות מגדריות במידה מטרידה. ב־2017 פורסם ב״סיינס״ מחקר שעשה את זה כמו שצריך: לקחו מבחן פסיכולוגי מוכר שמודד אסוציאציות סמויות אצל בני אדם, והריצו את אותו מבחן בדיוק על וקטורי מילים שאומנו על סריקת רשת בת 840 מיליארד יחידות טקסט. כל ההטיות שנמדדו אצל אנשים חזרו, בגדלים דומים ואף גדולים יותר: פרחים מול חרקים, כלי נגינה מול כלי נשק, שמות פרטיים ״לבנים״ מול ״שחורים״, ושמות גברים מול נשים ביחס לקריירה ומשפחה.

ובתוך אותו מחקר נמצא הממצא החזק ביותר, והוא לא על הטיה אלא על מראה. החוקרים בדקו עד כמה החוזק של הקשר המגדרי של כל שם מקצוע בווקטורים מנבא את אחוז הנשים בפועל באותו מקצוע לפי נתוני הלשכה לסטטיסטיקה של העבודה בארצות הברית. המתאם היה 0.90. בדיקה מקבילה על שמות פרטיים מול מפקד האוכלוסין נתנה 0.84. כלומר הווקטורים לא ״המציאו״ סטריאוטיפ — הם מדדו במדויק את חלוקת העבודה בפועל בחברה שכתבה את הטקסט. וזה בדיוק מה שהופך את השאלה לקשה: מה בדיוק מבקשים מהמכונה, לתאר את העולם או לתאר עולם אחר.

הניסיון לתקן נתקל בקושי משלו. ב־2016 הוצעו שיטות ״ניקוי הטיה״ שמזהות כיוון מגדרי במרחב ומנטרלות אותו, והמדדים אכן ירדו. ב־2019 הראו חוקרות שהמדדים ירדו אבל המידע נשאר: אפשר עדיין לשחזר את החלוקה המגדרית מתוך המרחקים בין המילים ה״מנוקות״. הניסוח שלהן: ״האפקט בפועל הוא בעיקר הסתרת ההטיה, לא הסרתה״.

עובדות מפתח

שנה
⁦2013⁩
חלק
איך זה עובד
שער
שפה
נושא
ייצוג מילים

להעמיק

הסילבוס של היחידה. כל קישור נבדק — מה שלא עבד, לא נכנס.

לקריאה

מקורות וארכיון

ספרים

ספרים שלמים בנושא. אין קישורי קנייה — חנויות משתנות, ספר לא.

  • Artificial Intelligence: A Guide for Thinking HumansMelanie Mitchell · ⁦2019⁩הפרק על שפה מסביר מה ייצוג התפלגותי לוכד ומה הוא בהכרח מפספס. לא אותר תרגום עברי.
  • Atlas of AIKate Crawford · ⁦2021⁩על השאלה מה אוסף טקסט בכלל מייצג ומי החליט מה נכנס אליו. לא אותר תרגום עברי.