OpenAI Codex כתב משחק DOS שלם בסגנון Asteroids בשפת Assembly x86 ב-16 סיביות, תוך אספקת 18 קבצי מקור וכ-2,500 שורות קוד ללא שורה אחת של Assembly שנכתבה על ידי אדם. הניסוי מראה שבינה מלאכותית יכולה להוביל מחזור חיים מלא של תוכנה — מתכנון ועד לניפוי שגיאות (debugging) — צעד מעבר להדגמות ה"השלמת קוד" הרגילות.

למה הניסוי היה חשוב

רוב הדגמות הקידוד של AI הפומביות מסתצרות למקטעים קטנים או לכלי עזר פשוטים. כדי לבחון את הגבול העליון, הניסוי דחף את Codex לסביבה המוגבלת ביותר שניתן לדמיין: Assembly x86 ב-16 סיביות על DOS, ללא מנועי משחק, ספריות גרפיקה או נוחות של שפות ברמה גבוהה. המטרה הייתה לראות האם בינה מלאכותית יכולה לא רק לייצר קוד, אלא גם לנהל את משימות ההנדסה הסובבות אותו.

כיצד חולקו התפקידים

האחריות האנושית הוגבלה לשלושה פעולות:

  • הגדרת מטרת הפרויקט הכוללת (משחק ירי בסגנון Asteroids).
  • מענה על שאלות הקשורות לאופן המשחק שעלו.
  • בדיקת משחק (play-test) של כל גרסה ודיווח על באגים שנמצאו.

האחריות של Codex כיסתה את כל השאר:

  • ניסוח תוכנית פרויקט וארכיטקטורה.
  • כתיבת קבצי המקור ב-Assembly.
  • ניפוי שגיאות (debug), רפקטורינג (refactor) וארגון מחדש של הקוד.
  • תחזוקת מאגר ה-Git, כולל commits וניהול ענפים (branches).
  • בניית הקובץ הבינארי והרצתו באמולטור DOS.

האדם מעולם לא הקליד הוראת Assembly אחת, מעולם לא הפעיל קומפיילר, ומעולם לא הפעיל את המשחק במהלך הפיתוח. האינטראקציה נעצרה בתיאור תסמיני הבאגים; ה-AI איתר ותיקן את שורש הבעיה בעצמו.

תהליך העבודה האיטרטיבי

כל מחזור החל ב-Codex שמציע אבן דרך (למשל, "יישום תנועת ספינת השחקן"). לאחר מכן הוא ייצר את קבצי המקור המתאימים, ביצע להם commit, בנה את הקובץ ההרצה (executable), והעביר את הגרסה הניתנת להרצה לבודק. Codex ניתח את התסמין, עקב אחריו דרך בסיס הקוד והוציא תיקון (patch) ללא הדרכה אנושית נוספת.

מה המוצר הסופי מכיל

  • 18 קבצי מקור ב-Assembly, מאורגנים במבנה מאגר קונבנציונלי.
  • כ-2,500 שורות Assembly, המכסות טיפול בקלט, ציור ספריטים (sprites), זיהוי התנגשויות ומערכת ניקוד גבוה (high-score).
  • קובץ הרצה (executable) ל-DOS הניתן למשחק, הפועל בסביבת DOS סטנדרטית ומדמה את המשחק הקלאסי Asteroids.
  • אפס שורות Assembly שנכתבו על ידי אדם, מה שמאשר שה-AI טיפל בכל משימות התכנות ברמה הנמוכה (low-level).

סיכונים והשלכות

אם בינה מלאכותית יכולה להוביל פרויקט באופן אוטונומי מהקונספט ועד לקובץ בינארי עובד, התפקיד המסורתי של המתכנת כמנצח העיקרי על בסיס הקוד משתנה. חברות יוכלו לקצר את הזמן המושקע בהקמת תשתית (boilerplate), תיעוד וניפוי שגיאות שגרתי, ובכך לשחרר מהנדסים להתמקד בעיצוב ובאסטרטגיית המוצר.

הניסוי מדגיש גם מגבלות. סביבת הבדיקה הייתה צרה במכוון: משחק DOS לשחקן יחיד עם מכניקה מובנת היטב. הרחבת הגישה למערכות גדולות ורב-מודולריות עם תלויות חיצוניות, מגבלות אבטחה או נתיבי קוד קריטיים לביצועים נותרה בלתי מוכחת. יתרה מכך, הבודק האנושי עדיין שימש כשער האיכות האחרון; שגיאת לוגיקה שלא זוהתה הייתה עלולה לחמוק ללא פיקוח זה.

טיעונים נגדיים ושאלות פתוחות

  • אמינות: תכנות ב-Assembly אינו סלחני; שגיאת off-by-one אחת יכולה להפיל את כל התוכנית. Codex תיקן את הבאגים שהוא זיהה, אך הוא עלול להחמיץ בעיות תזמון (timing issues) עדינות שמופיעות רק בבדיקות עומס.
  • יכולת תחזוקה: קוד שנוצר ללא הנחיות סגנון אנושיות עשוי להיות קשה יותר לקריאה או להרחבה על ידי מפתחים עתידיים, במיוחד אם מוסכמות השמות של ה-AI שונות מסטנדרטים של צוות.
  • קניין רוחני: מי הבעלים של הקוד כשה-AI כותב אותו? מסגרות הרישוי הנוכחיות מניחות יוצרות אנושיות, מה שמותיר אזור אפור עבור תוצרים המופקים על ידי AI.

מה כדאי לעקוב אחריו בהמשך

  • מדדים רחבים יותר: יישום אותו תהליך עבודה אוטונומי על אפליקציות מרושתות, אפליקציות מובייל או פרויקטים מודרניים ב-C/C++ יבחן האם הגישה ניתנת להרחבה מעבר למשחקי רטרו.
  • שילוב כלים: הטמעת Codex בתוך תהליכי CI/CD עשויה לאוטומט לא רק יצירת קוד אלא גם בדיקות, סריקות אבטחה ופריסה (deployment).
  • התפתחות מדיניות: ככל שהקוד המופק על ידי AI יתפשט, מדיניות משפטית ותאגידית תצטרך להתייחס לבעלות, אחריות משפטית וציות (compliance).

המסקנה ברורה: בינה מלאכותית (AI) יכולה כעת לשמש כמהנדס תוכנה יחיד עבור פרויקטים מוגדרים היטב ובעלי גבולות ברורים, תוך אספקת קוד תפקודי ברמה נמוכה (low-level) ללא כתיבה ידנית על ידי בני אדם. השאלה האם יכולת זו תשנה את פני הפיתוח המקובל תלויה במהירות שבה המערכת האקולוגית (ecosystem) תוכל לתת מענה לנושאי אמינות, יכולת תחזוקה וסוגיות משפטיות.