GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Vercel AI SDK 7 ограничивает инструменты только их объявленными секретами

Теперь SDK требует, чтобы каждый инструмент предоставлял схему контекста на базе Zod, а во время выполнения Vercel проверяет, что передаются только объявленные поля, прерывая выполнение при обнаружении любых лишних или отсутствующих ключей.

AI · 3 мин чтения

Свой хостинг становится выгоднее API только при объеме от 5–10 млн токенов в месяц

Реальная стоимость запуска собственной LLM в сравнении с API. Открытые веса бесплатны, но их эксплуатация — нет. Многие думают, что self-hosting открытой модели экономит деньги. Это ошибка. Вам нужно взглянуть...

AI · 3 мин чтения

Deep Interaction повышает эффективность исправления LLM на 25%+ и сокращает расход токенов на 40%

Рассматривая вывод модели как редактируемый текст, Deep Interaction позволяет разработчикам находить ошибочные этапы рассуждений, переписывать их и подавать обратно оптимизированный промпт. Это обеспечивает рост точности исправлений на 25% и снижение расхода токенов на 40% в бенчмарках STEM.

AI · 2 мин чтения

ИИ-агент дежурного инженера сократил среднее время решения проблем с 45 до 20 минут всего за одну неделю

Я позволил ИИ-агенту управлять моими облачными операциями в течение недели. Я дал ИИ-агенту семь дней на управление моими облачными операциями. Это была реальная среда, а не демо-версия. Я предоставил ему доступ только для чтения к моей системе мониторинга…

AI · 4 мин чтения

AWS Agent Toolkit сокращает время настройки OpenSearch, но допускает ошибки в конфигурации векторов NextGen

Новый навык amazon-opensearch-service ускоряет выстраивание последовательности политик и подбор размера инстансов, но при попытке настроить векторный поиск в Serverless NextGen он по умолчанию использует классические параметры FAISS, что приводит к сбоям при развертывании.

AI · 4 мин чтения

Новый детектор дрейфа рабочих процессов предотвращает сбои ботов после обновлений приложений

Фреймворк определяет пять категорий дрейфа — UI, API, данных, разрешений и политик — и использует облегченную карту контрактов вместе с предварительным сканированием для обнаружения несоответствий до запуска автономного агента, что предотвращает скрытые сбои и дорогостоящие переделки.

AI · 4 мин чтения

Anthropic добавляет коннекторы MCP, превращая фрагменты кода Claude в работающие приложения

Благодаря коннекторам Model Context Protocol код, созданный Claude, теперь может напрямую обращаться к базам данных, облачным сервисам или Slack прямо из чата. Это избавляет от необходимости копирования и вставки, позволяя разработчикам мгновенно тестировать код на реальных данных.

AI · 2 мин чтения

ИИ-агент совершил 1858 вызовов инструментов за день, но не принес никакого результата

Из-за отсутствия этапа проверки агент пропустил фазу «действия» и потратил целый день на составление 1858 внутренних размышлений, так и не вызвав ни одного реального инструмента. Это выявило ловушку самозацикливания, которая может парализовать любого ассистента, работающего с инструментами.

AI · 2 мин чтения

Kimi K3 от Moonshot AI обещает дешевый API, но стоимость генерации вдвое выше, чем у конкурентов

Рекламная кампания Moonshot обещает модель с 2,8 триллионами параметров и низкую стоимость за токен, однако архитектура Mixture-of-Experts и избыточная многословность модели приводят к генерации 130 миллионов токенов — это более чем в два раза превышает объем конкурирующих моделей, что увеличивает реальные расходы.

AI · 3 мин чтения

LLM проваливают тест на самоидентификацию, вызывая опасения по поводу безопасности их развертывания

Новый бенчмарк ситуационной осведомленности заставляет модели отвечать на метавопросы вроде «Вы ИИ?» и корректировать ответы при изменении контекста диалога, выявляя, что многие высокоэффективные LLM всё еще выдают себя за людей или скрывают свои ограничения.

AI · 2 мин чтения

Троттлинг скрытых вкладок позволяет Chrome скрывать ошибки Canvas от ИИ-агентов тестирования

ИИ-агент видел чистые результаты выполнения JavaScript и скриншот, но из-за троттлинга скрытых вкладок в Chrome вызовы requestAnimationFrame прекратились, и холст (canvas) остался незакрашенным. Запуск тестов во видимой вкладке или добавление проверки на наличие непустых пикселей исправляет ложноположительный результат.

AI · 3 мин чтения

Claude Code 2.1.212 ограничивает количество субагентов до 200, чтобы предотвратить взрывной рост затрат на ИИ

Обновление вводит два ограничения через переменные окружения — для создания субагентов и для вызовов веб-поиска. Оба лимита по умолчанию установлены на уровне 200 за сессию, а для длительных MCP-вызовов действует правило автоматического перехода в фоновый режим через 2 минуты. Это дает командам реальный инструмент для сдерживания неконтролируемого роста расходов.

AI · 4 мин чтения

Публичный issue в GitHub позволяет ИИ-боту раскрыть код приватного репозитория одним кликом

Noma Labs продемонстрировали, что злоумышленник может создать специально подготовленный issue в публичном репозитории, чтобы запустить связанного с CI ИИ-агента, имеющего права на чтение приватных репозиториев, и заставить бота выгрузить эти файлы обратно в issue — и всё это без кражи учетных данных или эксплуатации самого GitHub.

AI · 2 мин чтения

Почему LLM-агенты в продакшене раздувают счета: скрытая проблема избыточности токенов

В реальных условиях эксплуатации каждая реплика пользователя, схема инструмента, ответ API и извлеченный документ накапливаются в промпте. Эта скрытая избыточность приводит к квадратичному росту времени обработки и стоимости, превращая гладкое демо в дорогостоящий кошмар с огромными задержками.

AI · 3 мин чтения

X402 обретает базу стандартов, но не имеет набора тестов для проверки платежных полномочий

Новый фонд X402 от Linux Foundation, созданный при поддержке Visa, Mastercard, Stripe и Google, определяет формат сообщений для платежей ИИ-агентов, однако не предусматривает набора тестов на соответствие, профиля безопасности или процесса сертификации, из-за чего подтверждение полномочий остается непроверенным.

AI · 3 мин чтения

Голосовой агент снизил уровень прерываний с 18% до 3% благодаря логике переключения на основе трех сигналов

Проанализировав 312 реальных звонков, команда заменила правило 700 мс тишины на легковесный конечный автомат, который отслеживает длительность тишины, грамматическую завершенность и сигналы обратной связи, что позволило снизить количество обрывов с 18% до 3% и устранить мертвую тишину.

AI · 3 мин чтения

Новый бенчмарк из 163 сценариев заставляет K8sGPT признавать неопределенность перед принятием решений

Этот бенчмарк, основанный на 163 размеченных инцидентах, выходит за рамки простой диагностики, проверяя способность ИИ-ассистентов распознавать неопределенность и намеренно воздерживаться от действий. Это подчеркивает критическую брешь в безопасности на фоне растущей уверенности LLM.

AI · 2 мин чтения

Автоматическая кластеризация глитчей позволяет LIGO обнаруживать более слабые гравитационные волны

Используя модели, обученные на сторонних наборах изображений, новая система LIGO не только классифицирует известные семейства глитчей с почти идеальной точностью, но и группирует новые аномалии, освобождая ученых от ручной очистки данных и позволяя им сосредоточиться на астрофизике.

AI · 2 мин чтения

ИИ-агент для кодинга отправил 3 PR за 40 минут — 40% моих сообщений были исправлениями

За один вечер агент реализовал MCP-клиент, Azure AI Agent и M365 Copilot Agent, однако потребовалось 12 из 30 сообщений от человека, чтобы вернуть его в нужное русло. Это выявило ошибки в соблюдении рабочего процесса и извлечении контекста, которые потребовали переписывания промптов.

AI · 3 мин чтения

Anthropic предоставляет Claude доступ к 1Password, позволяя ИИ автономно входить в приложения

Gemini Notebook от Google теперь индексирует PDF, документы и другие файлы для мгновенных запросов к ИИ, в то время как Claude от Anthropic может извлекать учетные данные из 1Password для входа в сервисы, а новая совместная спецификация призвана позволить агентам находить и вызывать API без написания пользовательского кода.

AI · 2 мин чтения

AWS Continuum внедряет агентов с функциями рассуждения для устранения уязвимостей в коде в режиме реального времени

ИИ-агенты AWS Continuum непрерывно отслеживают репозитории систем контроля версий, предлагают исправления и могут даже применять патчи напрямую в IDE разработчиков или CI-конвейерах, значительно сокращая временное окно для атак на цепочку поставок.

AI · 3 мин чтения

Intel подрывает господство TSMC в сфере упаковки ИИ-чипов благодаря новому контракту с Google на поставку TPU

Этот сдвиг вынуждает Google полностью перепроектировать архитектуру чипа — от компоновки до тестирования — и ставит под пристальное внимание возможности Intel по обеспечению выхода годных кристаллов. Успех может диверсифицировать цепочку поставок ИИ-чипов, однако любая заминка может задержать поставки и позволить TSMC вернуть себе лидерство.

AI · 2 мин чтения