בכל הרצאה מגיע הרגע הזה. מישהו/י מרים יד ושואל/ת: "אז מתי זה באמת יקרה? מתי המכונה תעקוף אותנו?"
במשך שנים אני מצטט את ריי קורצוויל שמדבר על AGI ב-2029 ועל סינגולריות מלאה ב-2045. אחרים נוקבים בתאריכים משלהם. אבל ככל שהתאריכים מתקרבים, שאלה אחרת מטרידה אותי יותר: איך בכלל נדע שהגענו?
תעשייה שלמה של מבחנים
לתעשיית ה-AI יש תשובה מסודרת: מבחנים.
ARC-AGI של פרנסואה שולה מציג למודלים חידות היגיון שהם מעולם לא ראו, כדי למדוד לא ידע אלא יכולת ללמוד משהו חדש. Humanity's Last Exam אסף כ-2,500 שאלות ממאות מומחים, בקצה הידע האנושי, אחרי שהמבחנים הקודמים נהיו קלים מדי למודלים. ויש עוד עשרות: מתמטיקה ברמת מחקר, תכנות, רפואה.
אלה מבחנים מרשימים, ואני עוקב אחריהם בסקרנות. אבל יש להם כמה בעיות שקשה להתעלם מהן.
שלוש בעיות
המבחנים נשחקים במהירות מסחררת. מבחן MMLU, שהיה פעם האתגר הרציני של התחום, הגיע לרוויה: כל המודלים המובילים עוברים אותו בציונים כמעט זהים, עד שאין מה ללמוד מההבדלים. ARC-AGI נבנה במיוחד כדי להחזיק מעמד, וגם הגרסה השנייה שלו כבר נחצתה השנה בציון של יותר מ-80 אחוז. מבחן שנועד להחזיק עשור מחזיק שנה או שתיים.
מבחן בודק רק מה שאפשר לבדוק. לכל שאלה במבחנים האלה יש תשובה נכונה, כזאת שמחשב יכול לבדוק אוטומטית. אבל רוב ההחלטות שבגללן אנחנו פונים למומחים הן בדיוק הפוכות: אין להן תשובה נכונה אחת. מה אומרים לעובד ותיק שגילה שהחדש מרוויח יותר ממנו? מה עושים שעה לפני עלייה לבמה? שם, בשטח האפור של שיקול הדעת, חיה המומחיות האמיתית. ואת השטח הזה המבחנים לא מודדים.
וההערה החשובה מכולן: ציון במבחן לא עונה על השאלה האמיתית. נניח שמודל יקבל 100 בכל המבחנים כולם. האם זה אומר שאנשים יסמכו עליו יותר מאשר על רופאה, על יועץ, על מנטור? הסינגולריות היא לא אירוע מעבדה. היא אירוע חברתי. היא קורית לא כשהמכונה נהיית חכמה יותר, אלא כשאנחנו מתחילים להתייחס אליה ככזאת.
אלן טיורינג הבין את זה עוד ב-1950. המבחן המפורסם שלו לא בדק את המכונה, הוא בדק אותנו: האם בני אדם מצליחים להבחין. ובמובן הזה יש חדשות. מחקר מאוניברסיטת קליפורניה בסן דייגו מצא שמודל שהתבקש לאמץ דמות אנושית זוהה כאדם ב-73 אחוז מהשיחות, יותר מבני האדם האמיתיים שישבו בצד השני. המכונה כבר עוברת בתור אדם. השאלה הבאה היא האם היא עוברת בתור חכם יותר.
הזווית שחסרה
וכאן נכנס האתגר שלנו.
אתגר הסינגולריות לא מודד את המכונה. הוא מודד אותנו. בכל סבב, שאלה אחת של שיקול דעת מוצגת למומחה אנושי ולמודל AI. שתי התשובות מתפרסמות בלי שמות, והציבור עונה על שתי שאלות: איזו תשובה חכמה יותר בעיניכם, ואיזו נכתבה על ידי מכונה.
מכל סבב יוצאות שתי נקודות על שני גרפים. הגרף הראשון הוא גרף ההעדפה: באיזו תדירות הציבור בוחר את תשובת ה-AI על פני תשובת המומחה. הגרף השני הוא גרף הזיהוי: כמה מאיתנו עוד מסוגלים בכלל להצביע על המכונה.
ביום שבו גרף ההעדפה יחצה את קו ה-50 באופן יציב, וגרף הזיהוי יירד לגובה של הטלת מטבע, לא נצטרך הכרזה של אף מעבדה. נראה את הסינגולריות קורית מול העיניים, שאלה אחרי שאלה, תחום אחרי תחום.
מה זה לא
חשוב להדגיש: זה לא מחקר אקדמי (לפחות לא בשלב הראשון). הקהל שמצביע הוא הקהל שעוקב אחרי, לא מדגם מייצג של האוכלוסייה. ההצבעה פומבית וחשופה להשפעה חברתית. כל זה כתוב בעמוד המתודולוגיה, בלי הסתרות.
אבל בניגוד למבחנים, העדפה אנושית אי אפשר לשנן. התנאים קבועים, השיטה שקופה, והמגמה לאורך זמן היא הסיפור. המבחנים הגדולים מודדים כמה המכונה מסוגלת. אנחנו מודדים כמה אנחנו מוכנים.
השאלות הפתוחות מחכות עכשיו באתר. ההצבעה לוקחת דקה, והיא הופכת אתכם לחלק מהניסוי.
בואו נמדוד את זה ביחד.