ניסוי חוכמת המונים למדידת AI
המתודולוגיה
איך זה עובד
בכל סבב אנחנו בוחרים שאלה שאין לה תשובה אחת נכונה, מהסוג שאנשים באמת מתלבטים בה. אותה שאלה בדיוק מוצגת לשניים: מומחה אנושי ומודל AI. שתי התשובות עוברות עריכה קלה של צורה בלבד, כדי שאי אפשר יהיה לזהות בקלות מי כתב מה, ואז הקהל מצביע.
הכללים שאנחנו מתחייבים להם
- אורך ומבנה אחידים. שתי התשובות דומות באורכן ובמבנה שלהן. עורכים צורה בלבד, לעולם לא תוכן.
- הגרלת מיקום. בכל סבב מטילים מטבע כדי לקבוע אם תשובת ה-AI תוצג ראשונה או שנייה. כך מנטרלים את הנטייה להעדיף את מה שקוראים קודם.
- עד 2 ניסיונות. למודל יש 2 ניסיונות. שולחים את השאלה פעם אחת ואז כותבים "האם זה הכי טוב שאתה יכול?". ולוקחים את מה שיצא, בלי נסיונות נוספים. שדרוג של המודל נרשם במדד.
- המומחה נשאר אנונימי. מציגים תחום ושנות ניסיון בלבד. השם נחשף רק אם המומחה בוחר בכך.
- הצבעה מתועדת. מצביעים בתגובות בלינקדאין ובפייסבוק (עם 1 או 2) או כאן באתר עם חשבון גוגל, קול אחד לאדם. אנחנו שומרים צילומי מסך לפני חשיפת התוצאות.
- מדגם קטן מסומן. סבב שנאספו בו פחות ממאה קולות מקבל סימון מפורש.
מה חשוב להגיד
ההצבעה פומבית, ולכן חשופה להשפעה חברתית. הקהל שמצביע הוא קהל העוקבים של הפרויקט, לא מדגם מייצג של האוכלוסייה. המדד מודד דבר אחד בדיוק: את ההעדפות של הקהל הזה, לאורך זמן, בתנאים קבועים ושקופים.