יסודות · יחידה 04 מתוך 20
מאיפה באים הנתונים
2009 · לא ידע אנושי אלא ערימה מסוימת של דברים עם היסטוריה
ב־2009 הוצג בכנס לראייה ממוחשבת מאגר תמונות בשם אימג׳נט. בשלב ההוא היו בו כ־3.2 מיליון תמונות בחמשת אלפים ומאתיים קטגוריות; היום הוא מונה 14,197,122 תמונות ב־21,841 קטגוריות. התמונות לא צולמו לצורך העניין. הן נאספו בשאילתות למנועי חיפוש תמונות, כשכל מילה מורחבת בשמות נרדפים לה ומתורגמת לסינית לספרדית להולנדית ולאיטלקית כדי לגרוף עוד. ואז היה צריך מישהו שיאמת שבתמונה שנמצאה תחת המילה ״נמר״ יש באמת נמר. המישהו הזה היה 49 אלף עובדים מ־167 מדינות, שעברו על יותר ממאה ושישים מיליון תמונות מועמדות בין יולי 2008 לאפריל 2010, כל תמונה בשלושה אישורים בלתי תלויים.
כדאי לעצור על המשפט הזה, כי הוא חוזר בכל שלב מאז. מאגר אימון אינו ידע. הוא תוצר של החלטות: מה חיפשנו, איפה, באיזו שפה, ומי אישר. בהמשך גם התברר מה זה אומר. בבדיקה שנערכה בין 2018 ל־2020 עברו על החלק במאגר שמתאר בני אדם: מתוך 2,832 קטגוריות אנושיות, 1,593 סומנו כפוגעניות ו־1,081 כקטגוריות שאינן באמת חזותיות — כלומר תכונות שאי אפשר לראות בתמונה. נותרו מאה חמישים ושמונה, ורק מאה שלושים ותשע מהן עם יותר ממאה תמונות.
במעבר לטקסט קנה המידה משתנה אבל ההיגיון זהה. מאגר הטקסט שנבנה מסריקת האינטרנט וניקויה, ופורסם עם ניתוח מפורט ב־2021, מכיל כ־156 מיליארד יחידות טקסט אחרי סינון — מתוך 1.4 טריליון לפני. ומה יש בו בפועל. המקור הגדול ביותר הוא מאגר פטנטים של גוגל. אחריו ויקיפדיה האנגלית, ואחר כך עיתונות: הניו יורק טיימס, הלוס אנג׳לס טיימס, הגרדיאן. יש בו גם כמעט שלושים וארבעה מיליון יחידות טקסט מאתרי צבא ארצות הברית. ולמעלה מעשירית מהפטנטים הגיעו ממשרדי פטנטים שאינם דוברי אנגלית, כלומר עברו תרגום מכונה — הטקסט שעליו לומדים אנגלית אינו כולו אנגלית שאדם כתב.
הניקוי עצמו מסתבר כהחלטה טעונה. בין המסננים היה מסנן שמסיר מסמכים שמכילים מילים מרשימת מילים גסות. הבדיקה מצאה מה הוא עשה בפועל: טקסט באנגלית אפרו־אמריקאית הוסר בשיעור של ארבעים ושניים אחוזים, טקסט באנגלית של דוברי ספרדית בשלושים ושניים אחוזים, וטקסט באנגלית ״לבנה״ ב־6.2 אחוזים בלבד. אף אחד לא התכוון לזה. המסנן פשוט עשה את מה שנאמר לו, ומה שנאמר לו לא היה מה שהתכוונו.
שתי בעיות נוספות שהתגלו באותו גוף מחקרים ראויות לשם. הראשונה, שכפול: במאגרים האלה יש טקסט שחוזר על עצמו פעמים רבות — במקרה אחד משפט בן שישים ואחת מילים שהופיע למעלה משישים אלף פעם. ניקוי הכפילויות הוריד פי עשרה את התדירות שבה מודל פולט טקסט משונן מילה במילה, וגם קיצר את האימון. השנייה, זיהום מבחנים: קטעים שאמורים לשמש למבחן נמצאים בתוך חומר האימון. בבדיקה של מאגרי מבחנים מקובלים נמצאו שיעורי זיהום שנעים בין כמעט אפס ובין קרוב לרבע מהמבחן. כשמודל ״מצליח במבחן״, זו השאלה הראשונה שצריך לשאול, וגם המאמר שהציג את אחד המודלים הגדולים של 2020 הודה בעצמו שבאג בסינון גרם לו לפספס חלק מהחפיפות.
יש גם עניין של בעלות. מאגר טקסט פתוח שפורסם בסוף 2020 בגודל 825 ג׳יגה־בייט הורכב מעשרים ושניים חלקים, ואחד מהם, כשתים־עשרה אחוז ממנו, היה אוסף ספרים שמקורו באתר פיראטי. ביולי 2023 הוסר החלק הזה בדרישת ארגון זכויות דני. והחלק החשוב: מודלים שכבר אומנו עליו לא שכחו אותו. אותו עניין בדיוק בתמונות — מאגר של כמעט שישה מיליארד זוגות של תמונה וכיתוב, שנאספו מהרשת, הוא הבסיס לחלק גדול ממחוללי התמונות, והוא גם מה שאמנים מצאו את עבודתם בתוכו. זו היחידה על זכויות יוצרים בחלק השני של הפקולטה.
ומי עושה את העבודה. בינואר 2023 פורסם תחקיר על צוות בקניה שהועסק כדי לסמן טקסטים קשים — תיאורים של התעללות, אלימות ופגיעה עצמית — כדי שאפשר יהיה ללמד מודל לזהות ולסנן אותם. השכר נטו נע בין 1.32 לשני דולרים לשעה. החברה שהזמינה את העבודה שילמה לקבלן 12.50 דולר לשעה. המספרים על העומס שנויים במחלוקת בין הצדדים: העובדים דיברו על מאה חמישים עד מאתיים וחמישים קטעים במשמרת של תשע שעות, הקבלן טען שבעים. אחד המסמנים תיאר זאת כך: ״זה היה עינוי. אתה קורא שורה של אמירות כאלה כל השבוע, ועד יום שישי אתה מעורער מעצם החשיבה על התמונה הזאת״. הרעיון שמערכת כזאת ״למדה לבד״ הוא אחד הדברים הרחוקים ביותר מהאמת.
ולבסוף, בעיה חדשה יחסית ומעניינת. ככל שיותר טקסט ברשת נוצר במכונה, יותר ממנו נכנס למאגרי האימון של הדור הבא. מחקר שפורסם ב־2024 הראה במודלים שונים מה קורה כשמאמנים דור על פלט של קודמו שוב ושוב: קודם נעלמים המקרים הנדירים בקצוות ההתפלגות, ואחר כך התפוקה מתכווצת לטווח צר. הכינוי שניתן לזה הוא קריסת מודל. כמה זה רלוונטי בפועל שנוי במחלוקת, כי בעולם האמיתי לא זורקים את הנתונים הישנים — אבל הכיוון נמדד ותועד, ולמאמר יצא תיקון מחברים ב־2025.
עובדות מפתח
- שנה
- 2009
- חלק
- איך זה עובד
- שער
- יסודות
- נושא
- מאגרי אימון
להעמיק
הסילבוס של היחידה. כל קישור נבדק — מה שלא עבד, לא נכנס.
❯לקריאה
- מי סימן את הטקסטים הקשיםהתחקיר על הצוות בקניה כולל השכר לשעה מול מה ששולם לקבלן והמחלוקת על העומס. באנגלית.
- נקמת האמניםסקירה עברית על איסוף התמונות מהרשת ועל ניסיונות של אמנים להרעיל את חומר האימון.
◈מקורות וארכיון
- המאמר שהציג את אימג׳נטאיך נאספו התמונות מהם מנועי החיפוש ואיך נבנה האימות בידי עובדים חיצוניים. באנגלית.
- מה באמת יש בתוך מאגר טקסט ענקהבדיקה שמצאה את הפטנטים את אתרי הצבא את התרגום המכונה ואת מה שמסנן המילים הגסות הוריד. באנגלית.
- הכפילויות ומה שהן עושותהממצא שניקוי כפילויות מוריד פי עשרה פליטה של טקסט משונן וגם מקצר את האימון. באנגלית.
- מה קורה כשמאמנים על פלט של מכונההמאמר על קריסת מודל: קודם נעלמים הקצוות ואחר כך מצטמצם הטווח. באנגלית.
ספרים
ספרים שלמים בנושא. אין קישורי קנייה — חנויות משתנות, ספר לא.
- Atlas of AIKate Crawford · 2021הפרקים על בניית מאגרים ועל העבודה שמאחוריהם הם הטיפול המקיף ביותר בנושא הזה. לא אותר תרגום עברי.
- Ghost WorkMary L. Gray and Siddharth Suri · 2019על כוח העבודה הבלתי נראה שמסמן מסנן ומתקן כדי שהמערכת תיראה אוטומטית. לא אותר תרגום עברי.
- Artificial UnintelligenceMeredith Broussard · 2018על ההנחה שמחשב פותר בעיה חברתית ועל מה שקורה כשהנתונים נושאים את הבעיה בתוכם. לא אותר תרגום עברי.
ההערה שלי
נשמרת בדפדפן הזה תוך כדי הכתיבה, ולא נשלחת לשום מקום.