107 ವೈವಿಧ್ಯಮಯ ಕಾರ್ಯಗಳ ಬೆಂಚ್‌ಮಾರ್ಕ್, ಯಶಸ್ಸಿನ ದರ (success rate), ವಿಳಂಬ (latency) ಮತ್ತು ಟೋಕನ್ ವೆಚ್ಚದ (token cost) ವಿಷಯದಲ್ಲಿ AutoGen, LangGraph ಮತ್ತು CrewAI ಅನ್ನು ಮೀರಿಸಿದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ. ಇದು ಪ್ರತಿ ರನ್‌ಗೆ ಕೇವಲ 10,700 ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸುತ್ತಾ, ಸರಾಸರಿ 10.2 ಸೆಕೆಂಡುಗಳಲ್ಲಿ 90% ಪೂರ್ಣಗೊಳಿಸುವಿಕೆಯನ್ನು ನೀಡುತ್ತದೆ. ಪ್ರೊಡಕ್ಷನ್-ಗ್ರೇಡ್ AI ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಇದು ಮುಖ್ಯವಾಗಿದೆ, ಏಕೆಂದರೆ ಈ ಅಂಕಿಅಂಶಗಳು ಸಾಮಾನ್ಯ ಡೆಮೊಗಳಲ್ಲಿ ಕಾಣಿಸದ ಗುಪ್ತ ವೆಚ್ಚಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ.

ನೈಜ-ಪ್ರಪಂಚದ ಪರೀಕ್ಷೆ ಏಕೆ ಮುಖ್ಯ?

ಏಜೆಂಟ್ ಫ್ರೇಮ್‌ವರ್ಕ್‌ಗಳ ಹೆಚ್ಚಿನ ಸಾರ್ವಜನಿಕ ಡೆಮೊಗಳು ಕೇವಲ ಒಂದೇ ಹಂತದ ಬಳಕೆಯ ಪ್ರಕರಣಗಳಿಗೆ ಸೀಮಿತವಾಗಿವೆ – ಉದಾಹರಣೆಗೆ PDF ಚಾಟ್, ಸರಳ ಸೇಲ್ಸ್ ಬಾಟ್ ಅಥವಾ ಮೂಲಭೂತ ಡೇಟಾ ಫೆಚ್ (data fetch). ಕೆಲಸದ ಹೊರೆ ಡಜನ್‌ಗಟ್ಟಲೆ ಹಂತಗಳು, ಕಂಡಿಷನಲ್ ಬ್ರಾಂಚ್‌ಗಳು (conditional branches) ಮತ್ತು ದೊಡ್ಡ ಪ್ರಾಂಪ್ಟ್ ಕಾನ್ಟೆಕ್ಸ್ಟ್‌ಗಳಿಗೆ (prompt contexts) ವಿಸ್ತರಿಸಿದಾಗ ವ್ಯವಸ್ಥೆಗಳು ಹೇಗೆ ವರ್ತಿಸುತ್ತವೆ ಎಂಬುದನ್ನು ಅಂತಹ ಉದಾಹರಣೆಗಳು ಮರೆಮಾಚುತ್ತವೆ. ಈ ಹೊಸ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಪ್ರತಿಯೊಂದು ಫ್ರೇಮ್‌ವರ್ಕ್ ಅನ್ನು ಸ್ಟೇಟ್ ಶೇರಿಂಗ್ (state sharing), ಪ್ಯಾರಲಲ್ ಎಕ್ಸಿಕ್ಯೂಷನ್ (parallel execution) ಮತ್ತು ಟೋಕನ್ ದಕ್ಷತೆಯ ಮೇಲೆ ಒತ್ತಡ ಹೇರುವ ವ್ಯಾಪಕ ಸನ್ನಿವೇಶಗಳ ಮೂಲಕ ಪರೀಕ್ಷಿಸುತ್ತದೆ, ಇದು ಡೆವಲಪರ್‌ಗಳಿಗೆ ಪ್ರೊಡಕ್ಷನ್ ಸವಾಲುಗಳ ಬಗ್ಗೆ ಒಂದು ನೋಟವನ್ನು ನೀಡುತ್ತದೆ.

ಮುಖಾಮುಖಿ ಅಂಕಿಅಂಶಗಳು

ಫ್ರೇಮ್‌ವರ್ಕ್ ಯಶಸ್ಸಿನ ದರ ಸರಾಸರಿ ವಿಳಂಬ ಸರಾಸರಿ ಟೋಕನ್ ಬಳಕೆ
AutoGen 90 % 10.2 s 10,700
LangGraph 85 % 12.9 s 11,900
CrewAI 78 % 19.1 s 14,350

ಯಶಸ್ಸಿನ ದರವು ಅಂತಿಮ ಔಟ್‌ಪುಟ್ ಕಾರ್ಯದ ನಿಖರತೆಯ ಮಾನದಂಡಗಳನ್ನು ಪೂರೈಸುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಅಳೆಯುತ್ತದೆ. ವಿಳಂಬವು (Latency) ಪ್ರಾರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗಿನ ಸಮಯವನ್ನು ಸೂಚಿಸುತ್ತದೆ, ಮತ್ತು ಟೋಕನ್ ಬಳಕೆಯು ಮಾಡೆಲ್ ಪ್ರೊಸೆಸ್ ಮಾಡುವ ಒಟ್ಟು ಪ್ರಾಂಪ್ಟ್ ಉದ್ದವನ್ನು ಅಳೆಯುತ್ತದೆ, ಇದು ವೆಚ್ಚದ ಅಂದಾಜಾಗಿದೆ.

ಫ್ರೇಮ್‌ವರ್ಕ್‌ನ ಆಳವಾದ ವಿಶ್ಲೇಷಣೆ

AutoGen – ವೇಗ ಮತ್ತು ದಕ್ಷತೆ, ಆದರೆ ಡಿಬಗ್ ಮಾಡುವುದು ತಲೆನೋವು

AutoGen ನ ಆರ್ಕಿಟೆಕ್ಚರ್ ಇಡೀ ಪೈಪ್‌ಲೈನ್‌ನಲ್ಲಿ ಸ್ಟೇಟ್ ಅನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತದೆ, ಇದರಿಂದ ಪ್ರತಿ ಹಂತಕ್ಕೆ ಒಂದೇ ಕಾನ್ಟೆಕ್ಸ್ ಅನ್ನು ಮತ್ತೆ ಕಳುಹಿಸುವ ಅಗತ್ಯವಿರುವುದಿಲ್ಲ. ಇದರಲ್ಲಿರುವ ಅಸಿಂಕ್ರೋನಸ್ ಎಕ್ಸಿಕ್ಯೂಷನ್ (asynchronous execution) ಸ್ವತಂತ್ರ ಬ್ರಾಂಚ್‌ಗಳು ಪ್ಯಾರಲಲ್ ಆಗಿ ಚಲಿಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ, ಇದು ಅತ್ಯಂತ ಕಡಿಮೆ ವಿಳಂಬ ಮತ್ತು ಟೋಕನ್ ಸಂಖ್ಯೆಯನ್ನು ತರುತ್ತದೆ. ಇದರ ಮೈನಸ್ ಪಾಯಿಂಟ್ ದೃಶ್ಯೀಕರಣ (visibility): ವರ್ಕ್‌ಫ್ಲೋ ಒಂದೇ ಮೊನೊಲಿಥಿಕ್ ಚೈನ್‌ನಲ್ಲಿ ಇರುವುದರಿಂದ, ವೈಫಲ್ಯವನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಕೇವಲ ಒಂದು ನೋಡ್ ಅನ್ನು ಪ್ರತ್ಯೇಕಿಸುವ ಬದಲು ಇಡೀ ರನ್ ಅನ್ನು ಪರೀಕ್ಷಿಸಬೇಕಾಗುತ್ತದೆ.

LangGraph – ಸ್ಪಷ್ಟ ನಿಯಂತ್ರಣ, ಕಂಡಿಷನಲ್‌ಗಳಿಗಾಗಿ ಹೆಚ್ಚಿನ ಕೋಡ್

LangGraph ಡೆವಲಪರ್‌ಗಳು ವರ್ಕ್‌ಫ್ಲೋ ಅನ್ನು ನೋಡ್‌ಗಳ ಗ್ರಾಫ್ ಆಗಿ ಘೋಷಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ, ಇದು ಎಕ್ಸಿಕ್ಯೂಷನ್ ಕ್ರಮ ಮತ್ತು ಸ್ಟೇಟ್ ಟ್ರಾನ್ಸಿಷನ್‌ಗಳ ಮೇಲೆ ಸೂಕ್ಷ್ಮ ನಿಯಂತ್ರಣವನ್ನು ನೀಡುತ್ತದೆ. ಇದು CrewAI ಗಿಂತ ಉತ್ತಮವಾಗಿ ಸ್ಟೇಟ್ ಅನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ ಮತ್ತು ಪದೇ ಪದೇ ಕಾನ್ಟೆಕ್ಸ್ ಬರುವ ಸಮಸ್ಯೆಯನ್ನು ತಪ್ಪಿಸುತ್ತದೆ. ಆದಾಗ್ಯೂ, LLM ನ ಔಟ್‌ಪುಟ್ ಆಧಾರದ ಮೇಲೆ ಒಂದು ಬ್ರಾಂಚ್ ಬದಲಾಗಬೇಕಾದಾಗ, ಡೆವಲಪರ್‌ಗಳು ಹೆಚ್ಚುವರಿ ಪ್ಲಂಬಿಂಗ್ ಕೋಡ್ (plumbing code) ಬರೆಯಬೇಕಾಗುತ್ತದೆ, ಇದು ಸ್ಪಷ್ಟತೆಯ ಪ್ರಯೋಜನವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ನಿರ್ವಹಣಾ ಹೊರೆ ಹೆಚ್ಚಿಸಬಹುದು.

CrewAI – ಪ್ರತ್ಯೇಕ ಏಜೆಂಟ್‌ಗಳು, ಟೋಕನ್ ಅತಿಯಾದ ಬಳಕೆ

CrewAI ಏಜೆಂಟ್-ರೋಲ್ ರೂಪಕವನ್ನು (agent-role metaphor) ಅಳವಡಿಸಿಕೊಳ್ಳುತ್ತದೆ: ಪ್ರತಿ ಪಾತ್ರವು ತನ್ನದೇ ಆದ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು ಸೂಚನೆಗಳೊಂದಿಗೆ ಸ್ವತಂತ್ರ ಘಟಕವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಈ ಪ್ರತ್ಯೇಕತೆಯು ವಿಶೇಷ ಬಾಟ್‌ಗಳ ಸಣ್ಣ ತಂಡಗಳಿಗೆ ಉಪಯುಕ್ತವಾಗಬಹುದು, ಆದರೆ ದೊಡ್ಡ ಮಟ್ಟದಲ್ಲಿ ಇದು ಪ್ರತಿ ಏಜೆಂಟ್‌ಗೆ ಒಂದೇ ಕಾನ್ಟೆಕ್ಸ್ ಅನ್ನು ಪುನರಾವರ್ತಿಸಲು ವ್ಯವಸ್ಥೆಯನ್ನು ಒತ್ತಾಯಿಸುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ ಅತಿ ಹೆಚ್ಚು ಟೋಕನ್ ಬಳಕೆ ಮತ್ತು ಅತ್ಯಂತ ನಿಧಾನಗತಿಯ ರನ್‌ಗಳು ಕಂಡುಬರುತ್ತವೆ. ಸ್ಟೇಟ್ ಶೇರಿಂಗ್ ಕೂಡ ದುರ್ಬಲವಾಗಿದೆ, ಇದರಿಂದಾಗಿ ಒಂದು ಏಜೆಂಟ್‌ನ ಔಟ್‌ಪುಟ್ ಮುಂದಿನ ಹಂತದಲ್ಲಿ ಅಗತ್ಯವಿರುವಾಗ ಸಾಂದರ್ಭಿಕವಾಗಿ ಡೇಟಾ ಕಾಣೆಯಾಗುವ ದೋಷಗಳು ಉಂಟಾಗಬಹುದು.

ಸಾರಾಂಶ: ನೀವು ಅನೇಕ ಹಂತಗಳನ್ನು ಒಳಗೊಂಡ ವೇಗವಾದ ಮತ್ತು ಟೋಕನ್-ದಕ್ಷ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಬಯಸಿದರೆ, ಡಿಬಗ್ ಮಾಡುವುದು ಕಷ್ಟವಾಗಿದ್ದರೂ AutoGen ಒಂದು ಪ್ರಾಯೋಗಿಕ ಆಯ್ಕೆಯಾಗಿದೆ. ನೀವು ಕಟ್ಟುನಿಟ್ಟಾದ ಎಕ್ಸಿಕ್ಯೂಷನ್ ಗ್ರಾಫ್ ಅನ್ನು ಜಾರಿಗೊಳಿಸಬೇಕಾದಾಗ ಮತ್ತು ಸ್ವಲ್ಪ ಹೆಚ್ಚು ಗ್ಲೂ ಕೋಡ್ (glue code) ಬರೆಯಲು ಸಿದ್ಧರಿದ್ದಾಗ LangGraph ಅನ್ನು ಆರಿಸಿ. ಪ್ರತ್ಯೇಕತೆಯು ಒಂದು ವೈಶಿಷ್ಟ್ಯವಾಗಿರುವ, ಸೀಮಿತ ವ್ಯಾಪ್ತಿಯ ಮತ್ತು ಕಡಿಮೆ ಏಜೆಂಟ್‌ಗಳ ಸನ್ನಿವೇಶಗಳಿಗಾಗಿ CrewAI ಅನ್ನು ಬಳಸಿ.

Source: https://dev.to/priyesh_dave_cb8759cdeca4/agent-frameworks-in-the-real-world-107-task-bakeoff-of-langgraph-crewai-and-autogen-445g Community discussion: https://t.me/GyaanSetuAi