Google DeepMind השיקה פיילוט המשתמש ב-benchmarking קריפטוגרפי מסוג "סמיות כפולה" (double-blind) כדי להעריך את מודלי Gemini Flash Lite שלה, מבלי לחשוף את ה-prompts (הנחיות הבדיקה) או את משקולות המודל (model weights). ההערכה מתבצעת בתוך Confidential Space של Google Cloud, כך שהמעריך לעולם לא רואה את המודל והמודל לעולם לא רואה את השאלות — גישה שעשויה להחזיר את האמינות לדיווחים על ביצועי AI.

למה זיהום של מבחני ביצועים (benchmarks) חשוב

אם מודל מתאמן על נתונים שמופיעים מאוחר יותר במבחן ביצועים, הציון שלו מפסיק למדוד יכולת הסקה והופך לשינון. תוצאה מושלמת במבחן מזוהם אינה מעידה דבר על יכולת אמיתית. חוקרים מתמודדים מזה זמן רבות עם פרדוקס: עליהם למסור נתוני בדיקה לספק המודל כדי לאמת מבחן ביצועים, תוך סיכון של חשיפה מוקדמת, או עליהם לסרב לגישה חיצונית כדי להגן על משקולות קנייניות, מה שמותיר את הביקורת ללא אימות. העיכוב האחרון בהערכת Fable 5 של Anthropic במבחן ה-ARC-AGI מדגים כיצד מדיניות מחמירה של שמירת נתונים עלולה לעכב הערכה עצמאית.

פתרון קריפטוגרפי

הפיילוט מחליף חוזים משפטיים והבטחות ל-"zero-logging" במנגנון הגנה טכני. Confidential Space יוצר enclave מבודד בחומרה שמריץ את מודל Gemini Flash Lite. המעריך מעלה את חבילת הבדיקה, שה-enclave אוטם בתוך "קופסה" קריפטוגרפית שהמודל אינו יכול לפתוח. במקביל, משקולות המודל נשארות מוצפנות בתוך ה-enclave, ואינן נראות למעריך. ה-enclave מייצר הוכחה מתמטית לכך שהמודל מעולם לא ניגש להנחיות במהלך שלב ההסקה (inference). התוצאה היא הרצה של סמיות כפולה אמיתית: שני הצדדים שומרים על הסודות שלהם, בעוד צד שלישי מקבל מדד ביצועים שניתן לאימות.

מי עומד להרוויח

  • רגולטורים ומבקרים יכולים כעת לדרוש הוכחות ליכולת מבלי לאלץ ספקים לחשוף סודות מסחריים.
  • ארגונים בתחומי אבטחת סייבר, ביטחון או כל תחום המטפל בנתונים מסווגים יכולים לבדוק כלי AI מבלי להסתכן בדליפת נתונים.
  • מפתחי מודלים שומרים על היתרון התחרותי שלהם; הם כבר לא צריכים לבחור בין פתיחות להגנה.

אם הגישה תתרחב, היא עשויה להפוך לשיטה המוגדרת כברירת מחדל להסמכת מודלים פורצי דרך (frontier models), ובכך להעביר את התעשייה מהסדרים מבוססי אמון להבטחות מבוססות מתמטיקה.

נקודות חיכוך פוטנציאליות

המערכת מסתמכת על מחסנית ה-confidential computing של Google Cloud, ולכן ארגונים המעדיפים ספקי ענן אחרים עשויים להיתקל במכשולי אינטגרציה. הרצת מודלים בתוך enclave מוסיפה שיהוי (latency) ומגבילה את מאיצי החומרה הזמינים, מה שעלול להשפיע על ציוני מבחני הביצועים. כמו כן, בעוד שההוכחה הקריפטוגרפית מבטיחה שהמודל לא ראה את ההנחיות, היא אינה מונעת מניפולציות אחרות, כגון fine-tuning לאחר תחילת הבדיקה. מבקרים עשויים לטעון שהפתרון מטפל רק בחלק קטן מבעיית השחזור (reproducibility) הרחבה יותר.

מה כדאי לעקוב אחריו בהמשך

  • אימוץ מעבר לשלב הפיילוט – מעבדות AI אחרות וספקי ענן עשויים לבנות enclaves תואמים, כדי לבדוק אם ניתן לבקר את המודל על פני פלטפורמות שונות.
  • גופים קובעי תקנים – קבוצות של בטיחות AI עשויות לקודד ביקורות קריפטוגרפיות של סמיות כפולה כחלק ממסגרות הסמכה.
  • פשרות בביצועים – הרצות של מבחני ביצועים בעולם האמיתי יחשפו האם העומס (overhead) של הרצה חסויה הוא מקובל עבור מודלים בקנה מידה גדול.

השורה התחתונה

על ידי נעילת נתוני הבדיקה והמודל יחד בתוך סביבה קריפטוגרפית אטומה הדדית, הפיילוט של Google DeepMind מציע נתיב קונקרטי להערכת ביצועי AI מהימנה. השיטה אינה מבטלת כל אתגר ביקורת, אך היא מסירה את המקור הבולט ביותר להטיה — זיהום של מבחני ביצועים (benchmark contamination) — מבלי לאלץ אף צד לוותר על הנכסים היקרים ביותר שלו. אם הקהילה תאמץ את הטכניקה, ניתן יהיה סוף סוף לקבל דוחות התקדמות עתידיים של AI כפי שהם מוצגים.