סאטיה נאדלה פתח זה עתה בעימות פומבי עם אותן מעבדות שחברתו עזרה להקים. המנכ"ל של Microsoft פרסם אזהרה בוטה לגבי האופן שבו חברות ה-AI הגדולות ביותר כותבות מחדש את כללי הבעלות על נתונים, והמסר הדהד בעוצמה יוצאת דופן. בפוסט בבלוג לאחרונה, נאדלה האשים מעבדות קצה (frontier labs), כולל OpenAI ו-Anthropic, בבניית שוק מפוברק. הן קוצרות נתונים ציבוריים כדי לאמן מודלים עצומים, ואז משתמשות בתנאי השירות שלהן כדי למנוע מכל אחד ללמוד מהפלט שהמודלים הללו מייצרים. התוצאה, הוא טוען, היא העברה חד-כיוונית של ערך שמותירה את הארגונים משלמים את החשבון תוך שהם מוותרים על הידע הקנייני שלהם.
הסטנדרט הכפול של הזיקוק (Distillation)
כדי להבין את התלונה, כדאי להסתכל על הטכניקה שמעבדות אלו כל כך להוטות לחסום. זיקוק (Distillation) היא שיטת אימון נפוצה שבה מודל קטן ומתמחה לומד מהפלט של מודל גדול יותר, במקום לעכל טקסט גולמי מהאינטרנט מאפס. סטארט-אפ או צוות מחקר עשויים להזין מיליוני הנחיות (prompts) למודל קצה, לתפוס את התגובות, ולהשתמש באותם אותות עשירים כדי לאמן מודל קומפקטי שרץ באופן מקומי או משרת צורך נישתי. זה זול ודורש הרבה פחות אנרגיה מאשר בניית מודל יסוד (foundation model) מאפס.
OpenAI ו-Anthropic אוסרות על פרקטיקה זו בתנאי השירות שלהן. כאשר הן מזהות זיקוק שיטתי, הן מתייחסות לכך כאל הפרה. האכיפה פונה לעיתים קרובות ליריבים, במיוחד חברות AI שבסיסן בסין, אשר מואשמות בשימוש בשיטה זו כדי לצמצם את פער היכולות מבלי להשתוות להוצאות המיליארדים שהושקעו בהרצות אימון מקוריות.
נאדלה הדגיש את המתח העומד בלב המדיניות הזו. אותן מעבדות בדיוק בנו את מודלי הדגל שלהן באמצעות סריקה (crawling) של הרשת הפתוחה, גירוד (scraping) של ספרים, פורומים, מאגרי קוד ומאמרים, והכל תחת הטיעון המשפטי שאימון על נתונים הנגישים לציבור מהווה שימוש הוגן (fair use). הן כרתו את הנחלת הכלל. ובכל זאת, הן מציבות כעת גדרות משפטיות כדי למנוע מכל אחד להתייחס לפלטי המודלים שלהן כחומר לימוד ציבורי בתמורה. הן נראות כמי שאומרות: אתם יכולים ללמוד מהידע הפתוח של העולם, אך איש אינו רשאי ללמוד מאיתנו.
לאסימטריה הזו יש משמעות מעבר לוויכוח אקדמי. היא מבססת היררכיה שבה קומץ של ספקי תשתית שולטים במי ידע מה. אם השימוש ההוגן מצדיק את בליעת האינטליגנציה המתועדת של האנושות על ידם, הרי שהפלט של המודלים הללו מתחיל להיראות כמו נחלת ציבור מופרטת. מתחרים ולקוחות כאחד נמנעים ממיחזור האותות הללו לכלים חדשים. הכיוון הוא רק לעבר המעבדות הגדולות ביותר.
לשלם פעמיים על האינטליגנציה שלכם
נאדלה טבע ביטוי למלכוד הכלכלי שהוא רואה מתגבש: "פרדוקס המידע ההפוך". לדעתו, ארגונים משלמים כיום עבור בינה מלאכותית פעמיים, ורק אחת מהתשלומים הללו מופיעה בחשבונית.
העלות הראשונה היא מובנת מאליה. חברות קונות קרדיטים של API, נרשמות ל-Copilot, או רוכשות רישיונות לשירותי צ'אטבוט. העלות השנייה נסתרת. בכל פעם שעובד מתקן עובדה שהומצאה (hallucinated fact), מדרג תגובה כעוזרת, או משפר דוח שנוצר, פעולה זו מייצרת את מה שנדלה קורא לו "שאריות" (exhaust). זהו שובל התיקונים, נתוני ההעדפות ויומני האינטראקציה שנוצרים במהלך עבודה אמיתית.
השאריות הללו אינן פסולת דיגיטלית. הן מכילות לעיתים קרובות לוגיקה עסקית שהושגה במאמץ רב. צוות לוגיסטי עשוי להנחות מודל לאופטימיזציה של מסלולי שילוח תוך שימוש באילוצים פנימיים שהחברה השקיעה שנים בפיתוחם. מחלקה משפטית עשויה לתקן שוב ושוב ניסוח חוזים עד שהפלט תואם לסגנון המוסדי שלה. קבוצת מחקר פרמצבטית עשויה לשאול שאלות על נתונים קליניים בדרכים החושפות סדרי עדיפויות אסטרטגיים. כאשר האינטראקציות הללו עוברות דרך API של צד שלישי, הספק רואה את כל חילופי המידע. המודל לומד איך נראות תשובות טובות עבור אותו תחום ספציפי.
עם הזמן, המשוב הזה הופך את המודל הכללי של הספק לחד ומתוקן יותר בדיוק במשימות שהלקוח שכר אותו לבצע. הספק יכול אז להפוך ולמכור את היכולת המשופרת הזו למתחרה של הלקוח, או להשיק מוצר סמוך המחקה את זרימת העבודה המקצועית. הארגון המקורי שילם דמי מנוי, תרם את המומחיות הקניינית שלו, ולמעשה אימן את המתחרה של עצמו.
מדוע AI ריבוני (Sovereign AI) עובר ממושג אופנה לאסטרטגיה
The logical response to this drain is to reclaim control over the learning loop. Nadella’s argument is clearly designed to position Microsoft as a different kind of landlord. Rather than insisting customers feed their intelligence into a centralized black box, he is making the case for environments where the customer keeps the keys.
This is where the conversation around sovereign AI gains practical weight. Running models inside a private cloud, an on-premise data center, or a tightly controlled virtual network means the interaction data never leaves the organization’s perimeter. The enterprise still benefits from modern foundation models, but the weights, the prompts, and the preference data remain inside a boundary the company administers.
Microsoft has built its Azure cloud business around exactly this promise of private deployments and regional data residency. In his post, Nadella signaled that Microsoft wants to be the platform where enterprises can host their own training and inference without inadvertently shipping their intellectual property to a distant model provider. The pitch is straightforward: use powerful AI, but keep your exhaust.
Other vendors are making similar noises, but Nadella’s intervention carries extra weight because of Microsoft’s deep partnership with OpenAI. For a CEO whose
