GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Vercel AI SDK 7 обмежує інструменти лише їхніми оголошеними секретами

Тепер SDK вимагає від кожного інструмента надання схеми контексту на основі Zod, а під час виконання Vercel перевіряє, щоб передавалися лише оголошені поля, перериваючи виконання у разі наявності зайвих або відсутніх ключів.

AI · 3 min read

Власний хостинг стає вигіднішим за API лише після 5–10 мільйонів токенів на місяць

Справжня вартість запуску власної LLM порівняно з API. Відкриті ваги безкоштовні, але їх запуск — ні. Багато хто вважає, що власний хостинг відкритої моделі економить гроші. Це помилка. Ви повинні поглянути...

AI · 3 min read

AI-агент чергування скоротив середній час вирішення проблем з 45 до 20 хвилин за один тиждень

Я дозволив AI-агенту керувати моїми хмарними операціями протягом тижня. Я дав AI-агенту сім днів на управління моїми хмарними операціями. Це було реальне середовище, а не демо-версія. Я надав йому доступ лише для читання до мого моніто…

AI · 4 min read

AWS Agent Toolkit скорочує час налаштування OpenSearch, але припускається помилок у конфігурації векторів NextGen

Нова навичка amazon-opensearch-service прискорює послідовність політик та підбір розміру інстансів, проте під час налаштування векторного пошуку на Serverless NextGen вона за замовчуванням використовує класичні параметри FAISS, що призводить до помилок розгортання.

AI · 4 min read

Вранці виходить Inkling (975B), а через шістнадцять годин Moonshot AI випускає 2.8T Kimi K3

Ці подвійні релізи переводять моделі з відкритими вагами з нішевих проєктів у мейнстрим ШІ, надаючи компаніям можливість запускати масивні моделі локально під ліцензією Apache 2.0, зберігаючи при цьому продуктивність на рівні закритих моделей у завданнях з програмування.

AI · 3 min read

Новий детектор дрейфу робочих процесів запобігає збоям ботів після оновлення додатків

Фреймворк визначає п'ять категорій дрейфу — UI, API, дані, дозволи та політики — і використовує легку карту контрактів разом із попереднім скануванням, щоб виявити невідповідності перед запуском автономного агента, запобігаючи прихованим збоям і витратним переробкам.

AI · 4 min read

Anthropic додає MCP-конектори, перетворюючи фрагменти коду Claude на живі додатки

Завдяки конекторам Model Context Protocol код, згенерований Claude, тепер може безпосередньо з чату звертатися до баз даних, хмарних сервісів або Slack, що позбавляє потреби в копіюванні та вставці та дозволяє розробникам миттєво тестувати його на реальних даних.

AI · 2 min read

ШІ-агент зробив 1858 викликів інструментів за день, але не видав жодного результату

Через відсутність етапу перевірки агент пропустив фазу «виконання» і витратив цілий день на формування 1858 внутрішніх роздумів, так і не звернувшись до реального інструменту. Це виявило пастку самозациклення, яка здатна паралізувати будь-якого асистента, що працює з інструментами.

AI · 2 min read

Kimi K3 від Moonshot AI обіцяє дешевий API, але витрати на генерацію вдвічі перевищують показники конкурентів

Попри гучні заяви Moonshot про модель із 2,8 трильйона параметрів та низьку вартість за токен, архітектура Mixture-of-Experts та надмірна багатослівність моделі призводять до генерації 130 мільйонів токенів — що вдвічі перевищує обсяги конкурентів і суттєво збільшує реальні витрати.

AI · 3 min read

LLM провалюють тест на самоусвідомлення, що викликає занепокоєння щодо безпеки їхнього впровадження

Новий бенчмарк ситуаційної обізнаності змушує моделі відповідати на метазапитання на кшталт «Чи є ти ШІ?» та коригувати відповіді під час зміни діалогу, що виявляє: багато високорейтингових LLM все ще видають себе за людей або приховують свої обмеження.

AI · 2 min read

Тротлінг прихованих вкладок дозволяє Chrome приховувати помилки Canvas від ШІ-агентів тестування

ШІ-агент отримав чисті результати JavaScript та скриншот, проте через тротлінг прихованих вкладок у Chrome зупинилися колбеки requestAnimationFrame, через що canvas залишився невідмальованим. Запуск тестів у видимій вкладці або додавання перевірки на наявність пікселів дозволяє уникнути таких хибних результатів.

AI · 3 min read

Claude Code 2.1.212 Caps Sub-Agents at 200 to Stop AI Cost Explosions

The update introduces two environment-variable caps – one for sub-agent spawns and one for web-search calls – both defaulting to 200 per session, with a 2-minute auto-background rule for long MCP calls, giving teams a concrete lever to curb runaway spend.

AI · 4 min read

Публічний issue у GitHub дозволяє ШІ-боту викрасти код приватного репозиторію в один клік

Noma Labs продемонстрували, що зловмисник може опублікувати спеціально підготовлений issue у публічному репозиторії, активувати ШІ-агента, пов'язаного з CI, який має права на читання приватних репозиторіїв, і змусити бота скинути ці файли назад у цей issue — і все це без крадіжки облікових даних або експлуатації самого GitHub.

AI · 2 min read

Чому LLM-агенти у реальних умовах стрімко збільшують витрати – приховане роздуття токенів

У реальних умовах експлуатації кожен запит користувача, схема інструменту, відповідь API та отриманий документ накопичуються в промпті. Це приховане роздуття призводить до квадратичного зростання часу обробки та вартості, перетворюючи стабільне демо на дорогий кошмар через високу затримку.

AI · 3 min read

X402 отримує базу стандартів, але не має набору тестів для перевірки повноважень щодо платежів

Нова організація X402 Foundation від Linux Foundation, за підтримки Visa, Mastercard, Stripe та Google, визначає формат повідомлень для платежів ШІ-агентів, проте не передбачає набору тестів на відповідність, профілю безпеки чи процесу сертифікації, через що твердження про повноваження залишається неперевіреним.

AI · 3 min read

Голосовий агент знизив рівень переривань з 18% до 3% завдяки трисигнальній логіці черговості

Проаналізувавши 312 реальних дзвінків, команда замінила правило 700 мс тиші на легку машину станів, яка відстежує тривалість тиші, граматичну завершеність та сигнали зворотного зв'язку, що дозволило знизити кількість обривів з 18% до 3% та усунути тривалу тишу.

AI · 3 min read

Новий бенчмарк із 163 кейсами змушує K8sGPT визнавати невизначеність перед тим, як діяти

Цей бенчмарк, створений на основі 163 маркованих інцидентів, виходить за межі діагностики, щоб перевірити, чи здатні ШІ-асистенти розпізнавати невизначеність і свідомо утримуватися від дій, що виявляє критичну прогалину в безпеці на тлі зростання впевненості LLM.

AI · 2 min read

Автоматизована кластеризація глітчів дозволяє LIGO виявляти слабші гравітаційні хвилі

Завдяки адаптації моделей, навчених на непов'язаних наборах даних із зображеннями, нова система LIGO не лише класифікує відомі типи глітчів із майже ідеальною точністю, а й кластеризує нові аномалії, що дозволяє вченим зосередитися на астрофізиці замість ручного очищення даних.

AI · 2 min read

AI-агент для кодингу створив 3 PR за 40 хвилин — 40% моїх повідомлень були виправленнями

За один вечір агент розробив MCP-клієнт, Azure AI Agent та M365 Copilot Agent, проте знадобилося 12 із 30 повідомлень від людини, щоб повернути його в потрібне русло. Це виявило помилки порушення робочого процесу та вилучення контексту, які потребували переписування промптів.

AI · 3 min read

Anthropic надає Claude доступ до 1Password, дозволяючи ШІ автономно входити в додатки

Gemini Notebook від Google тепер індексує PDF, документи та інші файли для миттєвих запитів до ШІ, тоді як Claude від Anthropic може отримувати облікові дані з 1Password для входу в сервіси, а спільна специфікація має на меті дозволити агентам знаходити та викликати API без написання спеціального коду.

AI · 2 min read

AWS Continuum розгортає агентів з логічним мисленням для усунення вразливостей у коді в режимі реального часу

ШІ-агенти AWS Continuum безперервно моніторять репозиторії систем контролю версій, пропонують виправлення та можуть навіть застосовувати патчі безпосередньо в IDE розробників або CI-конвейєрах, значно скорочуючи вікно для атак на ланцюжки постачання.

AI · 3 min read