क्लाउड APIs तब तक सुविधाजनक होते हैं जब तक वे सुविधाजनक नहीं रह जाते। आपका मासिक बिल बढ़ता जाता है। कीमतों में बदलाव आपके बजट को बिगाड़ देता है। और कहीं न कहीं बारीक अक्षरों (fine print) में, आपका प्रोप्राइटरी डेटा किसी और के मॉडल को ट्रेन कर रहा होता है। यही घर्षण (friction) अधिक डेवलपर्स को लोकल AI वर्कस्टेशन बनाने के लिए प्रेरित कर रहा है। आप हार्डवेयर एक बार खरीदते हैं, पूरे स्टैक के मालिक होते हैं, और यह तय करते हैं कि आपकी मशीन से कौन सा डेटा बाहर जाएगा।

इस सप्ताह तीन ठोस विकास हुए हैं जो इस बदलाव को अधिक व्यावहारिक बनाते हैं: एक Dockerized ट्रेडिंग असिस्टेंट जो आपके वित्तीय डेटा को घर पर ही रखता है, NVIDIA GPUs को अपने नियंत्रण में लाने के लिए एक सीधा गाइड, और Hugging Face की एक नई रिलीज़ जो रोबोट लर्निंग को कंज्यूमर डेस्कटॉप की पहुंच में लाती है।

Docker के साथ अपना ट्रेडिंग डेटा लोकल रखें

एक डेवलपर ने TradingSpy पेश किया है, जो विशेष रूप से ट्रेडिंग वर्कफ़्लो के लिए बनाया गया एक लोकल AI रिसर्च असिस्टेंट है। मार्केट डेटा और पर्सनल वॉचलिस्ट को किसी रिमोट एंडपॉइंट पर भेजने के बजाय, आप सब कुछ अपने हार्डवेयर पर एक Docker कंटेनर के अंदर चलाते हैं।

वित्तीय डेटा जितना संवेदनशील हो सकता है, उतना ही है। यदि आप इससे बच सकते हैं, तो आपके पोर्टफोलियो का कंपोजिशन, ट्रेडिंग नोट्स और ऐतिहासिक पोजीशन किसी थर्ड-पार्टी API के माध्यम से नहीं गुजरनी चाहिए। मॉडल को लोकल चलाने से वह जोखिम पूरी तरह से खत्म हो जाता है। कंटेनर इन्फरेंस (inference) को संभालता है, और आपके रॉ ब्रोकरेज डेटा को कभी भी मशीन से बाहर निकलने की ज़रूरत नहीं पड़ती।

Docker उस उलझी हुई डिपेंडेंसी (dependency) की समस्या को भी हल करता है जो Python मशीन लर्निंग प्रोजेक्ट्स को प्रभावित करती है। ट्रेडिंग स्टैक्स में अक्सर pandas जैसी डेटा लाइब्रेरीज़, टेक्निकल एनालिसिस टूलकिट और GPU-एक्सेलेरेटेड इन्फरेंस इंजन का मिश्रण होता है। आइसोलेशन के बिना, एक प्रोजेक्ट CUDA 11.8 की मांग करता है, दूसरा 12.1 चाहता है, और आपका बेस सिस्टम कॉन्फ्लिक्टिंग एनवायरनमेंट वेरिएबल्स का कब्रिस्तान बन जाता है। Docker प्रत्येक डिपेंडेंसी ग्राफ को उसकी अपनी इमेज में लॉक कर देता है। आप इसे एक बार बनाते हैं, और यह एक हेडलेस Ubuntu सर्वर, WSL2 के साथ Windows 11 डेस्कटॉप, या एक छोटे होमलैब NAS पर समान रूप से चलता है। आप अपने लोकल डेटा डायरेक्टरीज़ को कंटेनर में bind-mount भी कर सकते हैं ताकि आपकी फ़ाइलें आपके फ़ाइल सिस्टम पर ही रहें जबकि एक्जीक्यूशन एनवायरनमेंट साफ़ रहे।

यहाँ लागत का तर्क भी है। क्लाउड LLM APIs प्रति टोकन चार्ज करती हैं। यदि आप सैकड़ों टिकर्स पर प्री-मार्केट स्कैन चला रहे हैं, और मॉडल में प्राइस एक्शन, न्यूज़ समरी और टेक्निकल इंडिकेटर्स फीड कर रहे हैं, तो वे कॉल्स तेज़ी से बढ़ती हैं। लोकल मॉडल में कोई मीटर नहीं चलता। GPU की शुरुआती लागत एक बार लगती है; API बिल हर महीने चुभता है।

NVIDIA GPU एनवायरनमेंट को समझना

क्लाउड APIs से लोकल NVIDIA कार्ड पर जाना PyTorch इंस्टॉल करने और .to('cuda') कॉल करने जितना सरल नहीं है। इसमें सीखने की एक वास्तविक प्रक्रिया (learning curve) है, और इसे समझना ही एक हॉबी स्क्रिप्ट और एक भरोसेमंद वर्कस्टेशन के बीच का अंतर तय करता है।

क्लाउड APIs हार्डवेयर को छिपा देती हैं। आप JSON भेजते हैं, आपको JSON मिलता है। लोकल स्तर पर, आप सिस्टम एडमिनिस्ट्रेटर हैं। आपको सही ड्राइवर, एक संगत (compatible) CUDA टूलकिट और आपके GPU आर्किटेक्चर के लिए कंपाइल किया गया PyTorch बिल्ड चाहिए। फिर आपको इसे अपने रनटाइम से जोड़ना होगा, चाहे उसका मतलब कंटेनरों के लिए nvidia-docker रनटाइम कॉन्फ़िगर करना हो या बेयर मेटल पर LD_LIBRARY_PATH को मैनेज करना हो। प्रत्येक लेयर का एक वर्जन टुपल (version tuple) होता है जिसे मैच होना चाहिए, और जब ऐसा नहीं होता है, तो आपको मिसिंग लाइब्रेरीज़ या अनइनिशियलाइज़्ड डिवाइसेस के बारे में रहस्यमयी (cryptic) एरर मिलते हैं।

इसका प्रतिफल (payoff) सीधा हार्डवेयर नियंत्रण है। आप सीखते हैं कि GPU मेमोरी एक हार्ड सीलिंग (hard ceiling) है। सिस्टम RAM के विपरीत, जहाँ OS स्वैप और पेज कर सकता है, VRAM खत्म होने का मतलब आमतौर पर क्रैश हुआ ट्रेनिंग जॉब या तुरंत फेल होने वाला इन्फरेंस बैच होता है। वह बाधा आपको बैच साइजिंग, मिक्स्ड-प्रिसिजन ट्रेनिंग और मेमोरी प्रोफाइलिंग के बारे में सोचने के लिए मजबूर करती है। आप कंप्यूट को एक अनंत उपयोगिता (infinite utility) के रूप में मानना बंद कर देते हैं और इसे एक सीमित संसाधन के रूप में मानना शुरू कर देते हैं जिसे आप मैनेज करते हैं।

इस सप्ताह चर्चा में रहा एक उपयोगी गाइड एंटरप्राइज और कंज्यूमर GPUs को एक ही प्रजाति मानता है। चाहे आप डेटासेंटर-ग्रेड A100 का उपयोग कर रहे हों या कंज्यूमर RTX 4070 का, बुनियादी बातें नहीं बदलतीं। दोनों एक ही CUDA प्रोग्रामिंग मॉडल पर निर्भर करते हैं। दोनों के लिए आपको टेंसर (tensors) को स्पष्ट रूप से डिवाइस पर ले जाने की आवश्यकता होती है। यदि आप बारह-गीगाबाइट के कार्ड पर चौदह-गीगाबाइट का मॉडल आवंटित करने का प्रयास करते हैं, तो दोनों आपको समान रूप से दंडित करते हैं। वे सबक काम आते हैं। आप अपने डेस्कटॉप के कार्ड पर प्रोटोटाइप बना सकते हैं और बाद में बड़े हार्डवेयर (larger iron) पर स्केल करने पर बिल्कुल वही ऑप्टिमाइज़ेशन माइंडसेट लागू कर सकते हैं।

LeRobot v0.6.0 रोबोटिक्स को आपके डेस्क पर लाता है

Hugging Face ने LeRobot का वर्शन 0.6.0 रिलीज़ किया है, जो एक ऐसा फ्रेमवर्क है जो चैटबॉट्स और इमेज जनरेटर के पीछे काम करने वाली Transformers और Diffusers जैसी लाइब्रेरीज़ का उपयोग एक बिल्कुल अलग कार्य के लिए करता है: रोबोट लर्निंग। अगला शब्द या पिक्सेल प्रेडिक्ट करने के बजाय, यह मॉडल कैमरा फीड और भाषा निर्देश (language instruction) के आधार पर अगला मोटर एक्शन प्रेडिक्ट करता है।

रोबोटिक्स लंबे समय से एक ऐसा विषय रहा है जो केवल उन लैब तक सीमित माना जाता था जिनके पास मोशन-कैप्चर रूम और इंडस्ट्रियल GPU क्लस्टर्स तक पहुंच हो। LeRobot उस बाधा को कम करता है। वर्शन 0.6.0 इस बात को सरल बनाता है कि आप रोबोटिक पॉलिसीज़ को कैसे डिज़ाइन, ट्रेन और इवैल्यूएट करते हैं। आप सिमुलेशन में प्रोटोटाइप बना सकते हैं, पॉलिसी आर्किटेक्चर पर काम कर सकते हैं, और फिर हज़ारों लाइनों के लो-लेवल कंट्रोल कोड लिखे बिना एक असली आर्म या मोबाइल बेस पर इसे ट्रांसफर कर सकते हैं।

इस रिलीज़ की खास बात यह है कि यह कंज्यूमर GPUs को लक्षित करती है। प्रयोग करने के लिए आपको सर्वर रैक की आवश्यकता नहीं है। एक सिंगल हाई-एंड कंज्यूमर कार्ड ऐसी पॉलिसीज़ को ट्रेन कर सकता है जो असली ग्रिपर्स और आर्म्स पर भी काम कर सकें। यह एक स्पष्ट संकेत है कि ओपन-वेट मॉडल्स अब क्लाउड से निकलकर फिजिकल हार्डवेयर की ओर बढ़ रहे हैं। वेट्स आपकी ड्राइव पर रहते हैं। रोबोट को किसी API के नेटवर्क राउंड-ट्रिप के बिना कमांड मिलते हैं। जब आप किसी ऐसी चीज़ को कंट्रोल कर रहे हों जो वास्तविक दुनिया में चलती है, तो लेटेंसी और प्राइवेसी के फायदों को नज़रअंदाज़ करना मुश्किल है।

यह सॉफ्टवेयर और हार्डवेयर के बीच की सीमा के बारे में आपकी सोच को भी बदल देता है। रोबोटिक पॉलिसीज़ पहले केवल रिसर्च पेपर्स तक सीमित थीं। अब वे ऐसे रिपॉजिटरीज़ में उपलब्ध हैं जिन्हें आप क्लोन कर सकते हैं, अपने स्वयं के मोशन डेटा पर फाइन-ट्यून कर सकते हैं, और अपने स्वयं के हार्डवेयर पर डिप्लॉय कर सकते हैं।

असली जीत कंट्रोल में है

एक लोकल AI स्टैक बनाना सिद्धांत रूप में क्लाउड को नकारना नहीं है। यह इस बारे में है कि आप अपनी प्राथमिकताओं के आधार पर यह चुनें कि आपका कंप्यूट कहाँ हो। जब आप मॉडल्स को लोकल रूप से चलाते हैं, तो आपका डेटा आपकी ड्राइव पर ही रहता है। आपकी लागत एक अनिश्चित मासिक खर्च से बदलकर एक निश्चित हार्डवेयर निवेश में बदल जाती है। और आप ऐसे कौशल हासिल करते हैं—CUDA को डीबग करना, VRAM को प्रोफाइल करना, वर्कफ़्लो को कंटेनराइज़ करना—जो आपको केवल एक API कंज्यूमर नहीं, बल्कि एक सिस्टम्स इंजीनियर बनाते हैं।

टूल्स तैयार हैं। मॉडल्स इतने छोटे हैं कि कंज्यूमर कार्ड्स पर फिट हो सकें। अब बस एक ही सवाल बचा है: क्या आप इस स्टैक के मालिक बनना चाहते हैं या इसे किराए पर लेना जारी रखना चाहते हैं।