GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

گوگل اور اینتھروپک نے خبردار کیا ہے کہ ReAct ایجنٹس کلاؤڈ بجٹ کو ختم کر سکتے ہیں

ReAct لوپ ایک ماڈل کو اپنے اقدامات خود منتخب کرنے کی اجازت دیتا ہے، لیکن ہر 'سوچ-عمل-مشاہدہ' (Thought-Action-Observation) سائیکل ایک اور انفرنس چارج کا باعث بنتا ہے، جس سے تاخیر (latency) بڑھتی جاتی ہے اور اس بات کا خطرہ بڑھ جاتا ہے کہ ایک معمولی سی غلط فہمی پورے کام کو درہم برہم کر سکتی ہے۔

AI · 3 min read

گوگل نے سوارم ایجنٹ پیٹرن کو سب سے طاقتور مگر سب سے مہنگا AI ڈیزائن قرار دیا

سوارم ایک واحد نگرانی کرنے والے کے بجائے ہم پلہ ایجنٹس کے ایک ایسے نیٹ ورک کا استعمال کرتا ہے جو مسلسل ایک دوسرے کا جائزہ لیتے ہیں، لیکن ہر تبادلے کے لیے ایک الگ ماڈل کال کی ضرورت ہوتی ہے، جس سے کمپیوٹنگ کے اخراجات اور لیٹنسی (تاخیر) میں ڈرامائی طور پر اضافہ ہو جاتا ہے۔

AI · 3 min read

ایجنٹک ریٹریول کلاسیک RAG کے مقابلے میں کوئری کے اخراجات میں 82 گنا تک کمی لاتا ہے

ایجنٹ کوئریز کو دوبارہ لکھتا ہے، یہ فیصلہ کرتا ہے کہ سرچ کی ضرورت ہے یا نہیں، پیچیدہ سوالات کو ذیلی مراحل میں تقسیم کرتا ہے اور شواہد کمزور ہونے کی صورت میں خود کو درست کرتا ہے، ہر دعوے کے لیے حوالہ جات فراہم کرتا ہے اور ٹوکن کے استعمال میں نمایاں کمی لاتا ہے۔

AI · 3 min read

ٹک ٹاک نے امریکی تخلیق کاروں کے لیے آزمائشی طور پر اے آئی ڈیپ فیک ڈیٹیکٹر لانچ کر دیا

یہ اختیاری سروس امریکی تخلیق کاروں کے ایک چھوٹے گروپ کو ایک ایسا ڈیش بورڈ فراہم کرتی ہے جو ان کی تصدیق شدہ چہرے کی خصوصیات سے مماثل قرار دی گئی کسی بھی ویڈیو یا تصویر کی فہرست دکھاتا ہے، یہ سب جومیو (Jumio) کے ذریعے سیلفی اور شناختی کارڈ کے سخت تصدیقی عمل سے گزرنے کے بعد ممکن ہوتا ہے۔

AI · 1 min read

نیا COS API براؤزرز کو مختلف سائٹس کے درمیان 33 جی بی کا AI ماڈل شیئر کرنے کی اجازت دیتا ہے

URL لُک اپس کی جگہ کنٹینٹ ایڈریسڈ ہیشز (content-addressed hashes) کا استعمال کرتے ہوئے، COS API کسی بھی ایسی سائٹ کو فائل کی درخواست کرنے کی اجازت دیتا ہے جس کا SHA-256 اسے پہلے سے معلوم ہو، جس سے براؤزرز ایک ہی 33 جی بی کے AI ماڈل کو دوبارہ ڈاؤن لوڈ کیے بغیر مختلف اوریجنز (origins) کو فراہم کر سکتے ہیں۔

AI · 2 min read

آپ کا ایویلیوایشن ہارنس ماڈل کی غلطیاں خود پیدا کر سکتا ہے—دو بگ 'Malformed' لیبلز کے پیچھے چھپے ہوئے تھے

آپ کا ہارنس آپ کے ماڈل سے پہلے آپ سے جھوٹ بولے گا۔ آپ کے ایویلیوایشن اسکور بورڈ نے بتایا کہ دونوں انجن فیل ہو گئے۔ Llama3.2 6 میں سے 5 کیسز میں ناکام رہا۔ Anthropic Sonnet 6 میں سے 6 کیسز میں ناکام رہا۔۔۔

AI · 2 min read

AWS نے Bedrock پر AI کالز کی خودکار بلنگ کے لیے x402 'AgentCore Payments' متعارف کروا دیا ہے

نیا x402 پروٹوکول ہر HTTP ریکویسٹ میں ایک پیمنٹ ٹوکن شامل کرتا ہے، جس کے ذریعے AI ایجنٹس ڈیٹا، کمپیوٹ یا API کالز کے لیے فیس خود بخود کاٹ سکتے ہیں۔ AWS کی Bedrock انٹیگریشن، جسے AgentCore Payments کہا جاتا ہے، مشین کمرس کو ہموار بنانے کے لیے بلٹ ان والٹس اور اخراجات کی حد (spend caps) فراہم کرتی ہے۔

AI · 3 min read

کروم کا WebMCP ری ایکٹ ایپس کو براہ راست AI ایجنٹس کے لیے ٹائپ شدہ ٹولز فراہم کرنے کی سہولت دیتا ہے

WebMCP کمزور DOM-scraping کی جگہ ٹائپ شدہ ٹول کالز کے ایک مینی فیسٹ کو لاتا ہے جسے ری ایکٹ کمپوننٹس ماؤنٹ کے وقت رجسٹر کرتے ہیں، جس سے کروم 149+ میں AI ایجنٹس کے لیے فوری اور لے آؤٹ سے آزاد تعاملات ممکن ہو جاتے ہیں۔

AI · 3 min read

55 ملین ڈالر کے فنڈنگ راؤنڈ کے بعد، کیئر برکس ایجنٹس لیب آرڈرز اور کیئر پلانز کو خودکار بنا دیں گے

سیکویا، فیلکسس، آپٹم وینچرز اور وائی کمبینٹر کی حمایت سے، بنکر ہل اپنے کیئر برکس ایجنٹس کے آزمائشی استعمال کا منصوبہ بنا رہا ہے—یہ ایک ایسا سافٹ ویئر ہے جو EHR ڈیٹا نکالنے، لیب آرڈر کرنے اور کیئر پلانز کو اپ ڈیٹ کرنے کی صلاحیت رکھتا ہے، جس کا مقصد طبی ماہرین کو معمول کے انتظامی کاموں سے سبکدوش کرنا ہے۔

AI · 2 min read

SEED نے ٹریننگ ڈیٹا میں 40% کی کمی کرتے ہوئے ALFWorld کے اسکورز کو 91.8 تک پہنچا دیا ہے

SEED فریم ورک ایک 'پوسٹ ایپی سوڈ پاس' شامل کرتا ہے جہاں ایجنٹ اپنی ٹرانسکرپٹ پڑھتا ہے، قدرتی زبان میں اسباق لکھتا ہے، اور انہیں پالیسی اپ ڈیٹس میں تبدیل کرتا ہے—جو کمزور ریوارڈ سگنلز کو ایک بھرپور اور دوبارہ استعمال کے قابل ٹریننگ سگنل میں بدل دیتا ہے۔

AI · 4 min read

Solo Researcher Cuts LLM Agent Bill 31% to $651 by Logging Every Token

By adding a PostgreSQL logging layer that captured model name, token count, task type, and per-call cost, the researcher identified that raw SEC search results were inflating prompts. Summarizing those results and routing simple checks to a cheaper model drove the 31% savings and nudged accuracy up

AI · 3 min read

Upper90 نے جنرل کمپیوٹ میں 400 ملین ڈالر کی سرمایہ کاری کی، انفرنس-اونلی چپس پر داؤ لگایا

یہ قرض SambaNova کی SN50 انفرنس چپس کو بطور ضمانت استعمال کرتا ہے، جو کہ اپنی نوعیت کا پہلا ایسا اثاثہ ہے جو روایتی GPU فارمز کے مقابلے میں 16 گنا تک تیز ٹوکن پروسیسنگ، کم بجلی کے استعمال اور آسان کولنگ کا وعدہ کرتا ہے۔

AI · 3 min read

لائنس ٹوروالڈز نے ناقدین کو ایک ہی انتخاب دیا: لینکس کو فورک کریں یا اے آئی کو اپنائیں

ٹوروالڈز نے میلنگ لسٹ کو بتایا کہ نئے Sashiko ریویوئر جیسے اے آئی ٹولز کے مخالف کوئی بھی شخص محض کرنل کو فورک کر سکتا ہے، جس سے ان کے اس نظریے کی عکاسی ہوتی ہے کہ تکنیکی برتری نظریاتی مزاحمت پر غالب آتی ہے۔

AI · 2 min read

Grok Build کا اوپن سورس CLI آپ کو ماڈلز تبدیل کرنے اور ہر شیل کمانڈ کا آڈٹ کرنے کی اجازت دیتا ہے

یہ ریپوزٹری CLI، ٹرمینل UI، اور رن ٹائم کے لیے Rust سورس فراہم کرتی ہے، جس سے آپ یہ جائزہ لے سکتے ہیں کہ سیاق و سباق (context) کیسے ترتیب دیا جاتا ہے، ٹولز کو کیسے منظم کیا جاتا ہے، اور ایڈٹس کو کیسے مینیج کیا جاتا ہے—اور آپ ورک فلو کو متاثر کیے بغیر بنیادی ماڈل کو بھی تبدیل کر سکتے ہیں۔

AI · 4 min read

میٹا نے 1.25 ڈالر / 4.25 ڈالر فی ملین ٹوکنز پر Muse Spark 1.1 API لانچ کر دی

یہ سروس، جو صرف امریکہ میں مقیم ڈویلپرز کے لیے دستیاب ہے، ہر ملین ان پٹ ٹوکنز کے لیے 1.25 ڈالر اور ہر ملین آؤٹ پٹ ٹوکنز کے لیے 4.25 ڈالر وصول کرے گی، جبکہ نئے اکاؤنٹس کے لیے 20 ڈالر کا کریڈٹ اور بین الاقوامی صارفین کے لیے ویٹ لسٹ کی سہولت بھی موجود ہے۔

AI · 1 min read

مشی گن میں تصدیق کے دوران ایپک کے سیپسس الرٹ نے دو تہائی کیسز کو نظر انداز کر دیا

وہ سیپسس ماڈل جس نے ڈاکٹر کی پیش گوئی کرنا سیکھا۔ 2021 میں، مشی گن میڈیسن نے ایپک سیپسس ماڈل کا تجربہ کیا۔ انہوں نے 38,455 ہسپتال میں قیاموں کا جائزہ لیا۔ ایپک نے دعویٰ کیا کہ اس کی درستگی بہت زیادہ تھی...

AI · 4 min read

OpenAI کے GPT-Red نے GPT-5.6 کی ناکامیوں میں چھ گنا کمی کی، لیکن چھوٹی ٹیموں کے لیے کوئی مفت ٹول دستیاب نہیں۔

OpenAI کے اندرونی GPT-Red ماڈل نے GPT-5.6 Sol لائن میں ناکامیوں کو چھ گنا کم کر دیا ہے، لیکن تحقیقی مقالہ صرف نظریات پیش کرتا ہے اور کوئی ڈاؤن لوڈ کے قابل ٹول (harness) فراہم نہیں کرتا، جس کی وجہ سے چھوٹی ٹیموں کو اپنے خود مختار ٹیسٹ خود تیار کرنے ہوں گے۔

AI · 4 min read