GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

गूगल और एंथ्रोपिक की चेतावनी: ReAct एजेंट क्लाउड बजट को खत्म कर सकते हैं

ReAct लूप मॉडल को अपने कदम खुद चुनने की अनुमति देता है, लेकिन प्रत्येक Thought-Action-Observation चक्र एक और इन्फरेंस चार्ज जोड़ता है, जिससे लेटेंसी बढ़ती है और इस बात की संभावना बढ़ जाती है कि एक छोटी सी गलत व्याख्या पूरे कार्य को पटरी से उतार सकती है।

AI · 3 मिनट पढ़ें

गूगल ने 'स्वार्म एजेंट पैटर्न' को सबसे शक्तिशाली लेकिन सबसे महंगा AI डिज़ाइन बताया

स्वार्म एक एकल पर्यवेक्षक के बजाय पीयर एजेंटों के एक फ्लैट नेटवर्क का उपयोग करता है जो लगातार एक-दूसरे की समीक्षा करते हैं, लेकिन हर बातचीत के लिए एक अलग मॉडल कॉल की आवश्यकता होती है, जिससे कंप्यूटिंग लागत और लेटेंसी में भारी वृद्धि होती है।

AI · 3 मिनट पढ़ें

एजेंटिक रिट्रीवल क्लासिक RAG की तुलना में क्वेरी लागत को 82 गुना तक कम करता है

यह एजेंट क्वेरी को फिर से लिखता है, यह तय करता है कि सर्च की आवश्यकता है या नहीं, जटिल सवालों को छोटे चरणों में विभाजित करता है और सबूत कमजोर होने पर खुद को सुधारता है। यह हर दावे के लिए साइटेशन प्रदान करता है और टोकन के उपयोग को काफी कम कर देता है।

AI · 3 मिनट पढ़ें

टिकटॉक ने पायलट प्रोजेक्ट के तहत अमेरिकी क्रिएटर्स के लिए एआई डीपफेक डिटेक्टर लॉन्च किया

यह वैकल्पिक सेवा अमेरिकी क्रिएटर्स के एक छोटे समूह को एक डैशबोर्ड प्रदान करती है। जुमियो (Jumio) के माध्यम से एक कठिन सेल्फी-और-आईडी सत्यापन प्रक्रिया पूरी करने के बाद, यह डैशबोर्ड उन सभी वीडियो या इमेज को सूचीबद्ध करता है जिन्हें एआई उनके सत्यापित चेहरे के फीचर्स से मेल खाने के रूप में चिह्नित करता है।

AI · 1 मिनट पढ़ें

नया COS API ब्राउज़र्स को विभिन्न साइटों के बीच 33 GB AI मॉडल साझा करने की सुविधा देता है

URL लुकअप को कंटेंट-एड्रेस्ड हैश से बदलकर, COS API किसी भी साइट को ऐसी फ़ाइल का अनुरोध करने की अनुमति देता है जिसका SHA-256 उसे पहले से पता हो, जिससे ब्राउज़र बिना दोबारा डाउनलोड किए एक ही 33 GB AI मॉडल को कई ओरिजिन (origins) को उपलब्ध करा सकते हैं।

AI · 2 मिनट पढ़ें

आपका इवैल्यूएशन हार्नेस मॉडल की गलतियों का भ्रम पैदा कर सकता है—'मैलोफॉर्मेड' (Malformed) लेबल के पीछे छिपे थे दो बग

आपका हार्नेस आपके मॉडल के झूठ बोलने से पहले आपको झूठ बोलेगा। आपके इवैल्यूएशन स्कोरबोर्ड ने बताया कि दोनों इंजन फेल हो गए। Llama3.2 6 में से 5 मामलों में फेल हुआ और Anthropic Sonnet 6 में से 6 मामलों में फेल हुआ...

AI · 2 मिनट पढ़ें

लीनियर-स्केल ट्रांसफॉर्मर्स ने प्रोटीन मॉडल की मेमोरी को क्वाड्रेटिक से घटाकर लीनियर कर दिया

नया आर्किटेक्चर एक ही बार में हजारों अमीनो एसिड वाली पूरी श्रृंखलाओं को प्रोसेस करता है, जिससे लॉन्ग-रेंज इंटरैक्शन सुरक्षित रहते हैं और विशाल सीक्वेंस कॉर्पोरा पर ट्रेनिंग करना तेज़ और सस्ता हो जाता है।

AI · 2 मिनट पढ़ें

AWS ने Bedrock पर AI कॉल्स की ऑटो-बिलिंग के लिए x402 ‘AgentCore Payments’ लॉन्च किया

नया x402 प्रोटोकॉल प्रत्येक HTTP रिक्वेस्ट में एक पेमेंट टोकन शामिल करता है, जिससे AI एजेंट्स डेटा, कंप्यूट या API कॉल्स के लिए शुल्क स्वचालित रूप से काट सकते हैं। AWS का Bedrock इंटीग्रेशन, जिसे AgentCore Payments कहा जाता है, निर्बाध मशीन कॉमर्स के लिए इन-बिल्ट वॉलेट और खर्च की सीमा (spend caps) प्रदान करता है।

AI · 3 मिनट पढ़ें

Chrome का WebMCP React ऐप्स को सीधे AI एजेंट्स के लिए टाइप किए गए टूल्स उपलब्ध कराने की सुविधा देता है

WebMCP, नाजुक DOM-scraping की जगह टाइप किए गए टूल कॉल्स के एक मैनिफेस्ट का उपयोग करता है जिसे React कंपोनेंट्स माउंट टाइम पर रजिस्टर करते हैं, जिससे Chrome 149+ में AI एजेंट्स के लिए तत्काल और लेआउट-स्वतंत्र इंटरैक्शन मिलते हैं।

AI · 3 मिनट पढ़ें

$55M के फंडिंग राउंड के बाद Carebricks एजेंट्स लैब ऑर्डर और केयर प्लान्स को ऑटोमेट करेंगे

Sequoia, Felicis, Optum Ventures और Y Combinator द्वारा समर्थित, Bunkerhill अपने Carebricks एजेंट्स का पायलट रोलआउट करने की योजना बना रहा है—एक ऐसा सॉफ्टवेयर जो EHR डेटा निकाल सकता है, लैब ऑर्डर कर सकता है और केयर प्लान्स को अपडेट कर सकता है—जिसका लक्ष्य चिकित्सकों को नियमित समन्वय कार्यों से राहत देना है।

AI · 2 मिनट पढ़ें

SEED ने ट्रेनिंग डेटा में 40% की कटौती करते हुए ALFWorld स्कोर को बढ़ाकर 91.8 कर दिया

SEED फ्रेमवर्क एक 'पोस्ट-एपिसोड पास' जोड़ता है जहाँ एजेंट अपना खुद का ट्रांसक्रिप्ट पढ़ता है, प्राकृतिक भाषा में सबक लिखता है, और उन्हें पॉलिसी अपडेट में संकलित करता है—जिससे विरल रिवॉर्ड सिग्नल्स (sparse reward signals) एक समृद्ध और पुन: प्रयोज्य ट्रेनिंग सिग्नल में बदल जाते हैं।

AI · 4 मिनट पढ़ें

Google Gemma-4 31B Passes Token Match on AWS Inferentia Yet Spews Gibberish

The Inferentia2 INF2.24xlarge reproduced the exact token stream of the CPU reference, but both runs fed a malformed prompt lacking the chat template and turn markers, sending Gemma-4 into an infinite loop of nonsense. The hardware merely echoed a bug in the reference code.

AI · 3 मिनट पढ़ें

हर टोकन को लॉग करके, एक अकेले शोधकर्ता ने LLM एजेंट के बिल में 31% की कटौती कर उसे $651 तक पहुँचा दिया

एक PostgreSQL लॉगिंग लेयर जोड़कर, जिसने मॉडल का नाम, टोकन की संख्या, कार्य का प्रकार और प्रति-कॉल लागत को रिकॉर्ड किया, शोधकर्ता ने पाया कि कच्चे SEC सर्च परिणाम प्रॉम्प्ट्स को बढ़ा रहे थे। उन परिणामों का सारांश निकालकर और सरल कार्यों को एक सस्ते मॉडल पर भेजकर, 31% की बचत हुई और सटीकता में भी सुधार हुआ।

AI · 3 मिनट पढ़ें

Upper90 ने जनरल कंप्यूट में $400 मिलियन का निवेश किया, इन्फरेंस-ओनली चिप्स पर लगाया दांव

इस ऋण में SambaNova के SN50 इन्फरेंस चिप्स को कोलैटरल के रूप में इस्तेमाल किया गया है, जो एक अनूठी एसेट क्लास है। यह पारंपरिक GPU फार्मों की तुलना में 16 गुना तक तेज़ टोकन प्रोसेसिंग, कम बिजली की खपत और आसान कूलिंग का वादा करती है।

AI · 3 मिनट पढ़ें

लिनस टोरवाल्ड्स ने आलोचकों को दिया एक ही विकल्प: लिनक्स को फोर्क करें या AI को अपनाएं

टोरवाल्ड्स ने मेलिंग लिस्ट को बताया कि नए Sashiko रिव्यूअर जैसे AI टूल्स का विरोध करने वाला कोई भी व्यक्ति बस कर्नेल को फोर्क कर सकता है, जो उनके इस विचार को पुख्ता करता है कि तकनीकी योग्यता वैचारिक विरोध से कहीं अधिक महत्वपूर्ण है।

AI · 2 मिनट पढ़ें

Grok Build का ओपन सोर्स CLI आपको मॉडल बदलने और हर शेल कमांड का ऑडिट करने की सुविधा देता है

यह रिपॉजिटरी CLI, टर्मिनल UI और रनटाइम के लिए Rust सोर्स प्रदान करती है, जिससे आप यह देख सकते हैं कि कॉन्टेक्स्ट कैसे तैयार किया जाता है, टूल्स को कैसे व्यवस्थित किया जाता है और एडिट्स को कैसे मैनेज किया जाता है – और आप वर्कफ़्लो को बाधित किए बिना इसके मूल मॉडल को भी बदल सकते हैं।

AI · 4 मिनट पढ़ें

Moonshot का Kimi K3 AA-Briefcase पर GPT-5.6 को पछाड़ा, स्कोर किया 1,527 बनाम 1,495

Moonshot AI का Kimi K3, जो एक 2.8-ट्रिलियन-पैरामीटर वाला ओपन-वेट मॉडल है, ने वास्तविक दुनिया के AA-Briefcase बेंचमार्क पर GPT-5.6 से बेहतर प्रदर्शन किया है। यह अब API के माध्यम से उपलब्ध है और इसके वेट्स 27 जुलाई को सार्वजनिक रूप से जारी किए जाने वाले हैं।

AI · 2 मिनट पढ़ें

Claude Code, Cursor 2.0 और OpenAI Codex IDEs को फुल-स्टैक कंट्रोल रूम्स में बदल रहे हैं

नवीनतम वर्ज़न टास्क ऑर्केस्ट्रेशन, अप्रूवल वर्कफ़्लो, टेस्टिंग रिग्स और UI-सचेत ब्राउज़िंग की सुविधा जोड़ते हैं, जिससे AI टिकट चुन सकता है, स्वायत्त एजेंट चला सकता है, मानवीय स्वीकृति प्राप्त कर सकता है और विजुअल प्रीव्यू भेज सकता है—वह भी एक ही कंसोल से।

AI · 3 मिनट पढ़ें

मेटा ने प्रति मिलियन टोकन $1.25/$4.25 की दर पर Muse Spark 1.1 API लॉन्च किया

यह सेवा केवल अमेरिका स्थित डेवलपर्स के लिए उपलब्ध है, जिसमें प्रत्येक मिलियन इनपुट टोकन के लिए $1.25 और प्रत्येक मिलियन आउटपुट टोकन के लिए $4.25 का शुल्क लिया जाता है। नए खातों के लिए $20 का क्रेडिट दिया जा रहा है और अंतरराष्ट्रीय उपयोगकर्ताओं के लिए वेटलिस्ट है।

AI · 1 मिनट पढ़ें

मिशिगन वैलिडेशन में एपिक का सेप्सिस अलर्ट दो-तिहाई मामलों को पहचानने में विफल रहा

वह सेप्सिस मॉडल जिसने डॉक्टर की भविष्यवाणी करना सीखा; 2021 में, मिशिगन मेडिसिन ने एपिक सेप्सिस मॉडल का परीक्षण किया। उन्होंने 38,455 अस्पताल में भर्ती होने के मामलों का अध्ययन किया। एपिक ने दावा किया कि इसकी सटीकता बहुत...

AI · 4 मिनट पढ़ें

OpenAI के GPT-Red ने GPT-5.6 की विफलताओं को छह गुना कम कर दिया, लेकिन छोटी टीमों के लिए कोई मुफ्त टूल नहीं है

OpenAI के आंतरिक GPT-Red मॉडल ने GPT-5.6 Sol लाइन में विफलताओं को छह गुना कम कर दिया है, लेकिन शोध पत्र केवल सिद्धांत प्रदान करता है—कोई डाउनलोड करने योग्य टूल नहीं—जिसके कारण छोटी टीमों को अपने स्वयं के नियतात्मक (deterministic) परीक्षण खुद तैयार करने होंगे।

AI · 4 मिनट पढ़ें