GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Vercel AI SDK 7 ابزارها را تنها به موارد اعلام‌شده محدود می‌کند

این SDK اکنون هر ابزار را ملزم می‌کند که یک طرحواره زمینه (context schema) مبتنی بر Zod ارائه دهد و در زمان اجرا، Vercel تأیید می‌کند که فقط فیلدهای اعلام‌شده ارسال شده باشند؛ در صورت وجود کلیدهای اضافی یا مفقود، اجرای عملیات متوقف خواهد شد.

AI · 3 min read

میزبانی شخصی تنها پس از ۵ تا ۱۰ میلیون توکن در ماه، از هزینه‌های API کمتر است

هزینه واقعی اجرای LLM شخصی در مقابل API. وزن‌های باز رایگان هستند، اما اجرای آن‌ها نه. بسیاری از افراد تصور می‌کنند میزبانی شخصی یک مدل باز باعث صرفه‌جویی در هزینه‌ها می‌شود، اما این یک اشتباه است. شما باید بررسی کنید که...

AI · 3 min read

عامل هوش مصنوعی پاسخگو، میانگین زمان رفع مشکل را در یک هفته از ۴۵ دقیقه به ۲۰ دقیقه کاهش داد

اجازه دادم یک عامل هوش مصنوعی عملیات ابری من را برای یک هفته مدیریت کند. من به یک عامل هوش مصنوعی هفت روز فرصت دادم تا عملیات ابری من را مدیریت کند. این یک محیط واقعی بود، نه یک نسخه نمایشی. من به آن دسترسی خواندن به سیستم مانیتورینگ...

AI · 4 min read

ابزار AWS Agent زمان راه‌اندازی OpenSearch را کاهش می‌دهد اما در پیکربندی وکتور نسل جدید (NextGen) دچار خطا می‌شود

مهارت جدید amazon-opensearch-service فرآیند توالی‌بندی سیاست‌ها و تعیین اندازه نمونه را تسریع می‌کند، اما هنگام پیکربندی جستجوی وکتور در Serverless NextGen، به طور پیش‌فرض از تنظیمات کلاسیک FAISS استفاده می‌کند که باعث بروز خطا در استقرار (deployment) می‌شود.

AI · 4 min read

آنتروپیک با افزودن کانکتورهای MCP، قطعه‌کدهای Claude را به اپلیکیشن‌های زنده تبدیل کرد

با استفاده از کانکتورهای Model Context Protocol، کدهای تولید شده توسط Claude اکنون می‌توانند مستقیماً از طریق چت، پایگاه‌های داده، سرویس‌های ابری یا Slack را فراخوانی کنند. این قابلیت مرحله کپی-پیست را حذف کرده و به توسعه‌دهندگان اجازه می‌دهد تا بلافاصله با داده‌های واقعی تست کنند.

AI · 2 min read

مدل Kimi K3 از Moonshot AI وعده API ارزان را می‌دهد، اما هزینه‌های خروجی آن دو برابر رقبا است

تبلیغات Moonshot بر مدلی با ۲.۸ تریلیون پارامتر و نرخ‌های پایین به‌ازای هر توکن تأکید دارد، اما طراحی Mixture-of-Experts و پرگویی بیش از حد این مدل، حجم خروجی را به ۱۳۰ میلیون توکن می‌رساند که بیش از دو برابر مدل‌های رقیب است و باعث افزایش هزینه‌های واقعی می‌شود.

AI · 3 min read

شکست مدل‌های زبانی بزرگ در آزمون خودشناسی، که نگرانی‌های امنیتی برای به‌کارگیری آن‌ها ایجاد می‌کند

معیار جدید سنجش «آگاهی موقعیتی»، مدل‌ها را وادار می‌کند به پرسش‌های فرامتا (meta-questions) مانند «آیا شما یک هوش مصنوعی هستید؟» پاسخ دهند و با تغییر روند گفتگو، پاسخ‌های خود را تنظیم کنند؛ این موضوع نشان می‌دهد که بسیاری از مدل‌های زبانی بزرگ با امتیاز بالا، همچنان ادعا می‌کنند انسان هستند یا محدودیت‌های خود را پنهان می‌کنند.

AI · 2 min read

محدودسازی در تب‌های مخفی باعث می‌شود کروم خطاهای Canvas را از عوامل تست هوش مصنوعی پنهان کند

عامل هوش مصنوعی نتایج سالم جاوااسکریپت و یک اسکرین‌شات را مشاهده کرد، اما محدودسازی تب‌های مخفی در کروم باعث توقف فراخوانی‌های requestAnimationFrame شد و Canvas را بدون ترسیم رها کرد. اجرای تست‌ها در یک تب قابل مشاهده یا افزودن بررسی «عدم خالی بودن پیکسل‌ها»، این نتیجه‌ی مثبتِ کاذب را اصلاح می‌کند.

AI · 3 min read

یک ایشو عمومی در گیت‌هاب اجازه می‌دهد ربات هوش مصنوعی تنها با یک کلیک، کدهای مخزن خصوصی را لو بدهد

آزمایشگاه Noma نشان داد که یک مهاجم می‌تواند با ارسال یک ایشوی دست‌کاری شده در یک مخزن عمومی، یک عامل هوش مصنوعی متصل به CI را که دارای دسترسی خواندن به مخازن خصوصی است، فعال کند و باعث شود ربات آن فایل‌ها را در همان ایشو منتشر کند؛ تمام این فرآیند بدون سرقت اطلاعات کاربری یا سوءاستفاده از خودِ گیت‌هاب انجام می‌شود.

AI · 2 min read

چرا هزینه‌های عامل‌های LLM در محیط عملیاتی سر به فلک می‌رود – تورم پنهان توکن‌ها

در استقرار‌های واقعی، هر گفته کاربر، طرحواره ابزار، پاسخ API و سند بازیابی‌شده در پرامپت انباشته می‌شوند. این تورم پنهان باعث می‌شود زمان پردازش و هزینه‌ها به صورت درجه دوم رشد کنند و یک دموی روان را به کابوسی پرهزینه از تأخیر تبدیل کنند.

AI · 3 min read

X402 بستری برای استانداردها یافت، اما فاقد مجموعه آزمونی برای تأیید اعتبار پرداخت است

بنیاد جدید X402 متعلق به بنیاد لینوکس، با حمایت ویزا، مسترکارت، استرایپ و گوگل، قالب پیام‌ها را برای پرداخت‌های عامل‌های هوش مصنوعی تعریف می‌کند، اما با نادیده گرفتن هرگونه مجموعه انطباق، پروفایل امنیتی یا فرآیند صدور گواهینامه، ادعای اعتبار این استاندارد را بدون آزمایش باقی گذاشته است.

AI · 3 min read

بنچمارک جدید ۱۶۳ موردی، K8sGPT را وادار می‌کند پیش از اقدام به عدم قطعیت خود اعتراف کند

این بنچمارک که بر پایه ۱۶۳ حادثه برچسب‌گذاری شده ساخته شده است، فراتر از تشخیص رفته تا بررسی کند آیا دستیاران هوش مصنوعی می‌توانند عدم قطعیت را تشخیص داده و آگاهانه از انجام کار خودداری کنند؛ امری که با افزایش سطح اطمینان در مدل‌های زبانی بزرگ (LLM)، یک شکاف امنیتی حیاتی را نمایان می‌کند.

AI · 2 min read

خوشه‌بندی خودکار اختلال‌ها به LIGO امکان شناسایی امواج گرانشی ضعیف‌تر را می‌دهد

سیستم جدید LIGO با بازاستفاده از مدل‌های آموزش‌دیده بر روی مجموعه‌داده‌های تصویری غیرمرتبط، نه تنها انواع شناخته‌شده‌ی اختلال‌ها را با دقتی نزدیک به بی‌نقص طبقه‌بندی می‌کند، بلکه ناهنجاری‌های جدید را نیز خوشه‌بندی می‌نماید؛ این امر به دانشمندان اجازه می‌دهد تا به جای پاکسازی دستی داده‌ها، بر اخترفیزیک تمرکز کنند.

AI · 2 min read

AWS Continuum عامل‌های استدلالی را برای رفع آنی آسیب‌پذیری‌های کد به کار می‌گیرد

عامل‌های هوش مصنوعی AWS Continuum به‌طور مداوم مخازن کنترل نسخه را نظارت کرده و اصلاحات را پیشنهاد می‌دهند؛ این عامل‌ها حتی می‌توانند وصله‌ها را مستقیماً در محیط‌های توسعه (IDE) برنامه‌نویسان یا خط لوله‌های CI اعمال کنند که این امر فرصت وقوع حملات زنجیره تأمین را به‌شدت کاهش می‌دهد.

AI · 3 min read

اینتل با قرارداد جدید TPU گوگل، سلطه TSMC بر بسته‌بندی هوش مصنوعی را می‌شکند

این تغییر، گوگل را مجبور می‌کند تا کل ساختار تراشه، از چیدمان تا آزمایش را بازطراحی کند و توانایی‌های بازدهی اینتل را زیر ذره‌بین قرار می‌دهد. موفقیت در این مسیر می‌تواند زنجیره تأمین تراشه‌های هوش مصنوعی را متنوع کند؛ اما هرگونه لغزش ممکن است باعث تأخیر در ارسال‌ها شده و به TSMC اجازه دهد تا دوباره بر بازار مسلط شود.

AI · 2 min read