מבחן ביצועים של 107 משימות מגוונות מראה ש-AutoGen מנצחת את LangGraph ו-CrewAI בשיעור ההצלחה, בשיהוי (latency) ובעלות הטוקנים, עם שיעור השלמה של 90% בממוצע של 10.2 שניות תוך שימוש ב-10,700 טוקנים בלבד בכל הרצה. מפתחים הבונים צינורות בינה מלאכותית ברמת ייצור מתעניינים בכך, כיוון שהמספרים חושפים עלויות נסתרות שדמויות פשוטות לעולם אינן חושפות.
למה מבחן בעולם האמיתי חשוב
רוב הדמויות הציבוריות של מסגרות סוכנים עוצרות בשימוש של שלב בודד – צ'אט עם PDF, בוט מכירות פשוט, או שליפת נתונים בסיסית. הדוגמאות הללו מסתירות כיצד המערכות מתנהגות כאשר עומס העבודה מתרחב לעשרות שלבים, ענפים מותנים והקשרים (contexts) של פרומפטים גדולים. מבחן הביצועים החדש דוחף כל מסגרת דרך סט רחב של תרחישים המעמיסים על שיתוף מצב (state sharing), ביצוע מקבילי ויעילות טוקנים, ומעניק למפתחים הצצה לאתגרים של סביבת הייצור.
נתונים ראש בראש
| מסגרת | שיעור הצלחה | שיהוי ממוצע | שימוש ממוצע בטוקנים |
|---|---|---|---|
| AutoGen | 90% | 10.2 שניות | 10,700 |
| LangGraph | 85% | 12.9 שניות | 11,900 |
| CrewAI | 78% | 19.1 שניות | 14,350 |
שיעור ההצלחה מודד האם הפלט הסופי עומד בקריטריוני הנכונות של המשימה. שיהוי (latency) הוא זמן השעון מההתחלה ועד הסוף, ושימוש בטוקנים מציג את אורך הפרומפט הכולל שהמודל מעבד, המשמש כמדד לעלות.
צלילה לעומק המסגרות
AutoGen – מהירות ויעילות, אך כאב ראש בניפוי שגיאות
הארכיטקטורה של AutoGen משתפת מצב (state) לאורך כל הצינור, מה שמבטל את הצורך לשלוח שוב את אותו ההקשר לכל שלב. ביצוע אסינכרוני מובנה מאפשר לענפים עצמאיים לרוץ במקביל, מה שמביא לשיהוי הנמוך ביותר ולמספר הטוקנים המועט ביותר. המחיר הוא נראות: מכיוון שזרימת העבודה מתקיימת בשרשרת מונוליטית אחת, מעקב אחר כשל דורש לעיתים קרובות מעבר על כל ההרצה במקום לבודד צומת בודד.
LangGraph – שליטה מפורשת, קוד נוסף לתנאים
LangGraph מחייבת מפתחים להגדיר את זרימת העבודה כגרף של צמתים, מה שמעניק שליטה מדויקת על סדר הביצוע ומעברי מצב. היא מטפלת במצב טוב יותר מ-CrewAI, ובכך נמנעת מבעיית החזרתיות של ההקשר. עם זאת, כאשר ענף חייב להשתנות בהתבסס על הפלט של ה-LLM, מפתחים צריכים לכתוב קוד תשתית נוסף, מה שעלול לפגוע ביתרון של הבהירות ולהוסיף עומס תחזוקה.
CrewAI – סוכנים מבודדים, ניפוח טוקנים
CrewAI מאמצת מטאפורה של תפקידי סוכנים: כל תפקיד פועל כיחידה עצמאית עם הפרומפט וההוראות שלו. הבידוד הזה יכול להיות שימושי עבור צוותים קטנים של בוטים מתמחים, אך בקנה מידה גדול הוא מאלץ את המערכת לחזור על אותו ההקשר עבור כל סוכן. התוצאה היא צריכת הטוקנים הגבוהה ביותר וההרצות האיטיות ביותר. גם שיתוף המצב חלש, מה שמוביל לשגיאות של נתונים חסרים מדי פעם כאשר נדרש הפלט של סוכן אחד בשלב מאוחר יותר בשרשרת.
שורה תחתונה: אם אתם זקוקים לצינור מהיר ויעיל בטוקנים המחבר בין הרבה שלבים, AutoGen היא הבחירה הפרגמטית למרות טבעה הקשה יותר לניפוי שגיאות. בחרו ב-LangGraph כאשר עליכם לאכוף גרף ביצוע קשיח ואתם מוכנים לכתוב מעט יותר קוד קישור. שמרו את CrewAI לתרחישים עם היקף מצומצם ומספר סוכנים נמוך, שבהם הבידוד הוא תכונה ולא חיסרון.
Source: https://dev.to/priyesh_dave_cb8759cdeca4/agent-frameworks-in-the-real-world-107-task-bakeoff-of-langgraph-crewai-and-autogen-445g Community discussion: https://t.me/GyaanSetuAi
