GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

گوگل و آنتروپیک هشدار می‌دهند: عامل‌های ReAct می‌توانند بودجه‌های ابری را تخلیه کنند

حلقه ReAct به مدل اجازه می‌دهد تا مراحل خود را انتخاب کند، اما هر چرخه «تفکر-عمل-مشاهده» هزینه استنتاج جدیدی را اضافه می‌کند که باعث افزایش تأخیر شده و احتمال مختل شدن کل فرآیند بر اثر یک اشتباه در خواندن را افزایش می‌دهد.

AI · 3 min read

گوگل الگوی عامل‌های Swarm را قدرتمندترین اما پرهزینه‌ترین طراحی هوش مصنوعی دانست

در الگوی Swarm، یک ناظر واحد با شبکه‌ای تخت از عامل‌های همتا جایگزین می‌شود که به‌طور مداوم عملکرد یکدیگر را نقد می‌کنند؛ اما هر تبادل اطلاعات باعث یک فراخوانی مجزا از مدل می‌شود که هزینه‌های پردازشی و میزان تأخیر را به شدت افزایش می‌دهد.

AI · 3 min read

بازیابی عامل‌محور هزینه‌های پرس‌وجو را در مقایسه با RAG کلاسیک تا ۸۲ برابر کاهش می‌دهد

این عامل پرس‌وجوها را بازنویسی می‌کند، نیاز به جستجو را تشخیص می‌دهد، سوالات پیچیده را به مراحل فرعی تقسیم می‌کند و در صورت ضعیف بودن شواهد، خود را اصلاح می‌کند؛ همچنین با ارائه استناد برای هر ادعا، مصرف توکن را به شکلی چشمگیر کاهش می‌دهد.

AI · 3 min read

API جدید COS به مرورگرها اجازه می‌دهد مدل هوش مصنوعی ۳۳ گیگابایتی را بین سایت‌های مختلف به اشتراک بگذارند

با جایگزینی جستجوی URL با هش‌های مبتنی بر محتوا (content-addressed hashes)، API جدید COS به هر سایتی اجازه می‌دهد فایلی را که از قبل مقدار SHA-256 آن را می‌داند درخواست کند؛ این امر به مرورگرها اجازه می‌دهد تا همان مدل هوش مصنوعی ۳۳ گیگابایتی را بدون نیاز به دانلود مجدد، به چندین منشأ (origin) ارائه دهند.

AI · 2 min read

چارچوب ارزیابی شما می‌تواند خطاهای مدل را جعل کند—دو باگ پشت برچسب‌های «نامعتبر» پنهان شده بودند

ابزار ارزیابی شما پیش از خودِ مدل، به شما دروغ خواهد گفت. جدول امتیازات ارزیابی شما نشان داد که هر دو موتور شکست خورده‌اند. Llama3.2 در ۵ مورد از ۶ مورد شکست خورد. Anthropic Sonnet در هر ۶ مورد شکست خورد...

AI · 2 min read

ترنسفورمرهای با مقیاس خطی، حافظه مدل‌های پروتئین را از مرتبه دوم به خطی کاهش می‌دهند

این معماری جدید، زنجیره‌های کامل هزار اسیدآمینه را تنها در یک مرحله پردازش می‌کند و ضمن حفظ تعاملات دوربرد، فرآیند آموزش بر روی مجموعه‌داده‌های عظیم توالی را سریع‌تر و ارزان‌تر می‌کند.

AI · 2 min read

AWS پروتکل x402 «AgentCore Payments» را برای صورت‌حساب خودکار فراخوانی‌های هوش مصنوعی در Bedrock عرضه می‌کند

پروتکل جدید x402 یک توکن پرداخت را در هر درخواست HTTP جاسازی می‌کند که به عوامل هوش مصنوعی اجازه می‌دهد هزینه‌های مربوط به داده، پردازش یا فراخوانی‌های API را به‌طور خودکار کسر کنند. قابلیت ادغام AgentCore Payments در سرویس Bedrock شرکت AWS، با افزودن کیف‌پول‌های داخلی و سقف‌های هزینه، امکان تجارت بی‌وقفه میان ماشین‌ها را فراهم می‌کند.

AI · 3 min read

ایجنت‌های Carebricks پس از جذب ۵۵ میلیون دلار سرمایه، سفارش‌های آزمایشگاه و برنامه‌های مراقبتی را خودکارسازی می‌کنند

شرکت Bunkerhill با حمایت Sequoia، Felicis، Optum Ventures و Y Combinator، قصد دارد اجرای آزمایشی ایجنت‌های Carebricks خود را آغاز کند؛ نرم‌افزاری که می‌تواند داده‌های EHR را استخراج کرده، آزمایش‌ها را سفارش دهد و برنامه‌های مراقبتی را به‌روزرسانی کند تا بار وظایف هماهنگی روتین را از دوش کادر درمان بردارد.

AI · 2 min read

SEED امتیازات ALFWorld را به ۹۱.۸ افزایش داد و همزمان داده‌های آموزشی را ۴۰٪ کاهش داد

چارچوب SEED یک مرحله‌ی پس از اجرا (post-episode pass) اضافه می‌کند که در آن عامل، گزارش عملکرد خود را می‌خواند، درس‌هایی به زبان طبیعی می‌نویسد و آن‌ها را در قالب به‌روزرسانی‌های سیاست (policy updates) استخراج می‌کند؛ این فرآیند سیگنال‌های پاداش پراکنده را به یک سیگنال آموزشی غنی و قابل استفاده مجدد تبدیل می‌کند.

AI · 4 min read

Solo Researcher Cuts LLM Agent Bill 31% to $651 by Logging Every Token

By adding a PostgreSQL logging layer that captured model name, token count, task type, and per-call cost, the researcher identified that raw SEC search results were inflating prompts. Summarizing those results and routing simple checks to a cheaper model drove the 31% savings and nudged accuracy up

AI · 3 min read

لینوس توروالدز به منتقدان یک انتخاب می‌دهد: فورک کردن لینوکس یا پذیرش هوش مصنوعی

توروالدز در لیست ایمیل اعلام کرد که هر کسی با ابزارهای هوش مصنوعی مانند بازبین جدید Sashiko مخالف است، می‌تواند به سادگی هسته (kernel) را فورک کند؛ این موضوع بر دیدگاه او تأکید دارد که شایستگی فنی بر مقاومت‌های ایدئولوژیک برتری دارد.

AI · 2 min read

CLI متن‌باز Grok Build امکان تعویض مدل‌ها و بازرسی تمامی دستورات شل را فراهم می‌کند

این مخزن سورس‌کد Rust را برای CLI، رابط کاربری ترمینال و زمان اجرا (runtime) ارائه می‌دهد تا بتوانید نحوه گردآوری بافت (context)، هماهنگی ابزارها و مدیریت ویرایش‌ها را بررسی کنید؛ همچنین امکان تعویض مدل زیربنایی بدون مختل کردن جریان کاری فراهم شده است.

AI · 4 min read

Kimi K3 از Moonshot در بنچمارک AA-Briefcase از GPT-5.6 پیشی گرفت؛ کسب امتیاز ۱۵۲۷ در مقابل ۱۴۹۵

مدل Kimi K3 از Moonshot AI، یک مدل با وزن‌های باز و ۲.۸ تریلیون پارامتر، در بنچمارک دنیای واقعی AA-Briefcase امتیاز بیشتری نسبت به GPT-5.6 کسب کرد و اکنون از طریق API در دسترس است؛ همچنین قرار است وزن‌های این مدل در تاریخ ۲۷ جولای به‌صورت عمومی منتشر شود.

AI · 2 min read

Claude Code، Cursor 2.0 و OpenAI Codex، محیط‌های توسعه (IDE) را به اتاق‌های کنترل فول‌استک تبدیل می‌کنند

نسخه‌های جدید با افزودن قابلیت‌هایی مانند هماهنگ‌سازی وظایف، گردش‌های کاری تأییدیه، سیستم‌های تست و مرورگری آگاه به رابط کاربری (UI)، به هوش مصنوعی اجازه می‌دهند تا تیکت‌ها را انتخاب کند، عوامل خودگردان را اجرا نماید، تأییدیه انسانی دریافت کند و پیش‌نمایش‌های بصری را عرضه کند؛ همگی این‌ها تنها از طریق یک کنسول واحد.

AI · 3 min read

متا ای‌پی‌آی Muse Spark 1.1 را با قیمت ۱.۲۵ و ۴.۲۵ دلار به ازای هر میلیون توکن راه‌اندازی کرد

این سرویس که تنها در دسترس توسعه‌دهندگان مستقر در ایالات متحده است، برای هر میلیون توکن ورودی ۱.۲۵ دلار و برای هر میلیون توکن خروجی ۴.۲۵ دلار هزینه دریافت می‌کند؛ همچنین ۲۰ دلار اعتبار برای حساب‌های جدید و یک لیست انتظار برای کاربران بین‌المللی در نظر گرفته شده است.

AI · 1 min read

هشدار سپسیس اپیک در اعتبارسنجی میشیگان، دو سوم موارد را نادیده گرفت

مدلی برای سپسیس که یاد گرفت پزشک را پیش‌بینی کند؛ در سال ۲۰۲۱، مرکز پزشکی میشیگان مدل سپسیس اپیک را مورد آزمایش قرار داد. آن‌ها ۳۸,۴۵۵ دوره بستری در بیمارستان را بررسی کردند. اپیک ادعا کرد که دقت آن بالا...

AI · 4 min read