LiteRT.js, TensorFlow.js को मात दे रहा है
WebGPU के साथ LiteRT.js, MobileNetV2 का इन्फरेंस 0.41 ms में करता है, जो M2 Max डेस्कटॉप GPU पर 2,439 FPS प्रदान करता है—उसी हार्डवेयर पर TensorFlow.js की तुलना में 25 × से भी अधिक तेज़। बड़े मॉडल्स के लिए यह अंतर और भी बढ़ जाता है, जिससे वेब-आधारित मशीन लर्निंग उस परफॉरमेंस स्तर पर पहुँच जाती है जो पहले केवल नेटिव ऐप्स के लिए आरक्षित था।
यह बेंचमार्क क्यों महत्वपूर्ण है
डेवलपर्स ऑन-डिवाइस इन्फरेंस के लिए TensorFlow.js का उपयोग करते रहे हैं, जो आमतौर पर WebGL बैकएंड के माध्यम से होता है। WebGL टेंसर ऑपरेशन्स को ब्राउज़र के 2-D ग्राफिक्स पाइपलाइन पर मैप करता है; यह हर जगह काम करता है लेकिन इसे डीप-लर्निंग मॉडल्स की भारी पैरेललिज्म के लिए नहीं बनाया गया था। WebGPU, जो अगली पीढ़ी का ग्राफिक्स API है, GPU कंप्यूट यूनिट्स तक सीधी पहुँच प्रदान करता है। LiteRT.js पहली ऐसी लाइब्रेरी है जो TensorFlow-Lite मॉडल्स के लिए WebGPU-आधारित इन्फरेंस इंजन पेश करती है, और Google ने तीन गुना गति वृद्धि की रिपोर्ट दी है। स्वतंत्र परीक्षण और भी अधिक लाभ दिखाते हैं, जिससे यह सवाल उठता है कि क्या WebGPU वेब ML के लिए डिफ़ॉल्ट रास्ता बन जाएगा।
टेस्ट कैसे किया गया
हमने दो इमेज-क्लासिफिकेशन मॉडल्स—MobileNetV2 और EfficientNet-Lite4—का बेंचमार्क किया, दोनों को TensorFlow-Lite में बदला गया था। टेस्ट Apple-silicon M2 Max चिप पर चलाए गए। प्रत्येक मॉडल के लिए, हमने कई इटरेशन्स के दौरान एक सिंगल फॉरवर्ड पास की लेटेंसी मापी और फ्रेम्स-पर-सेकंड (FPS) रिपोर्ट किया। हमने WebGL बैकएंड पर TensorFlow.js के साथ वही मॉडल्स चलाए और प्रत्येक लाइब्रेरी के कोल्ड-स्टार्ट समय को रिकॉर्ड किया।
परिणाम: गति और स्टार्टअप
MobileNetV2
- LiteRT.js (WebGPU): 0.41 ms लेटेंसी → 2,439 FPS
- TensorFlow.js (WebGL): 10.82 ms लेटेंसी → 92 FPS
EfficientNet-Lite4
- LiteRT.js (WebGPU): 0.62 ms लेटेंसी → 1,623 FPS
- TensorFlow.js (WebGL): रिपोर्ट नहीं किया गया, लेकिन MobileNetV2 पहले से ही >25× का लाभ दिखा रहा है।
LiteRT.js यह साबित करता है कि WebGPU वेब-आधारित इन्फरेंस को सब-मिलीसेकंड (sub-millisecond) स्तर तक पहुँचा सकता है, जो डेस्कटॉप GPUs पर TensorFlow.js की तुलना में 25 × से अधिक गति प्रदान करता है। यह तकनीक अभी भी परिपक्व हो रही है, और डेवलपर्स को बैचिंग सीमाओं (batching limits), मैन्युअल मेमोरी क्लीनअप और सीमित मोबाइल सपोर्ट जैसी चुनौतियों से निपटना होगा। उन डेस्कटॉप-फर्स्ट अनुभवों के लिए जिनमें रियल-टाइम परफॉरमेंस की आवश्यकता होती है, यह नई लाइब्रेरी एक प्रभावशाली विकल्प प्रदान करती है; वहीं क्रॉस-प्लेटफ़ॉर्म पहुंच के लिए, पुराने WebGL और WASM बैकएंड अभी भी अनिवार्य हैं।
