GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

108 Support Tickets Later: My AI Agent Workflow

108 Support Tickets Later: My AI Agent Workflow I maintain a 20 year old insurance system. It has 2.3 million lines of code and 1,000 PL/SQL packages. For nine months, I used AI a…

AI · 4 мин чтения

Claude Opus 5, Meta Muse Spark 1.1 и Gemini лидируют в рейтингах LLM 2026 года

Бенчмарк с использованием идентичных нагрузок на 20 моделей показал, что подход с маршрутизацией на специализированные модели может значительно сократить расходы на ИИ и уменьшить задержки, в то время как использование флагманской модели по умолчанию часто приводит к росту затрат и увеличению числа повторных попыток.

AI · 3 мин чтения

Cross-Modal AI Cuts Soft-Robot Maintenance Time 34% and Shrinks Model 60%

In a pilot plant, specialist teacher networks for vision, audio and language feed a compact multilingual student that fuses embeddings via contrastive learning. Quantization trims the student by 60%, letting it run on edge devices and slash maintenance cycles by a third.

AI · 3 мин чтения

x402 позволяет ИИ-агентам оплачивать API за считанные секунды с помощью ончейн-микроплатежей

Протокол x402 превращает статус HTTP 402 в триггер для мгновенной коммерции, позволяя агентам считывать цену в формате JSON, подписывать транзакцию в блокчейне и получать данные — и всё это в рамках одного цикла запроса, что устраняет необходимость в API-ключах или подписках.

AI · 3 мин чтения

К 2026 году нагрузки ИИ потребуют 1000 ТВт·ч — ожидается резкий рост использования пиковых электростанций на ископаемом топливе

К 2026 году дата-центры, работающие на базе ИИ, будут потреблять около 1000 ТВт·ч — что эквивалентно совокупному годовому спросу Японии и Германии. Это вынуждает Microsoft, Google и Amazon обращаться к ядерной энергетике, в то время как конкуренты ищут дешевые гидро- и геотермальные ресурсы, чтобы оставаться экологичными и экономичными.

AI · 3 мин чтения

AgenticX Open-Source MCP Server Gets 9.8 CVSS Command-Injection Flaw

Scanning 5,911 source files across 24 mid-tier MCP servers, a security researcher found a single sandbox command-injection bug in AgenticX that lets an attacker inject arbitrary shell commands into the Docker container, earning a 9.8 CVSS rating.

AI · 3 мин чтения

BYD HyWorldVLA достигла 90,59 PDMS на NAVSIM v1

BYD HyWorldVLA достигла 90,59 PDMS на NAVSIM v1. BYD выходит на рынок базовых моделей для автономного вождения. Их новая модель, HyWorldVLA, набрала 90,59 PDMS в бенчмарке NAVSIM v1. Т…

AI · 3 мин чтения

Как внедрить ИИ в производство электроники

Как внедрить ИИ в производство электроники. Перестаньте создавать модели ИИ без веской причины. Начните с производственной проблемы. Успешный проект в области ИИ решает конкретную задачу. Например…

AI · 3 мин чтения

Дашборды ИИ-агентов упускают скрытые сбои: трехслойная сигнальная модель выявляет пробелы

Большинство инструментов мониторинга показывают лишь «зеленый» статус, когда фреймворк сообщает об успехе, но пустые полезные нагрузки, избыточные вызовы инструментов или потерянные передачи управления могут парализовать работу нижестоящих сервисов и привести к потере выручки.

AI · 3 мин чтения

Siemens внедряет Edge AI на 10 000 заводах, сокращая время простоя на 50%

Локальная ИИ-платформа Siemens не только вдвое сокращает количество незапланированных остановок, но и снижает исходящий трафик примерно на 95%, обеспечивая предприятиям явное преимущество в условиях нестабильного интернет-соединения.

AI · 4 мин чтения

OpenAI’s GPT-5.6 Sol Hits 38.3% on ARC-AGI-3 Using Custom Responses API

OpenAI’s 38.3% success rate drops to 7.8% when the model is evaluated with the official ARC-AGI-3 harness, showing that its advantage comes from two inference-time tricks – retained reasoning and context compaction – baked into its proprietary Responses API.

AI · 4 мин чтения

Явный промпт «Используй инструменты» гарантирует исправление ошибок некорректно работающих ИИ-ассистентов

Автор сравнил подсказку, ориентированную только на цель (0,16 восстановления), с промптом «лицензирования действий», который явно разрешает повторное использование инструментов, что позволило достичь идеального показателя восстановления 1,00. Исправление работает только в том случае, если агенты могут вызывать инструменты, а сами инструменты способны помечать некорректные входные данные.

AI · 3 мин чтения

Google выяснил, что лишь 21% задач полностью автоматизируются в рамках 15 миллионов взаимодействий с ИИ

ИИ охватывает лишь 21% задач, заявляет Google. Компания изучила 15 миллионов взаимодействий со своими инструментами ИИ. Результаты демонстрируют огромный разрыв между внедрением ИИ и реальной работой, выполняемой ИИ. Данные: • Gem…

AI · 3 мин чтения

CVE-2026-59726 в Ruflo AI получил максимальную оценку 10.0 — требуется немедленное обновление до версии 3.16.3

Уязвимость вызвана тем, что Docker-контейнеры Ruflo привязывают мост Model Context Protocol ко всем сетевым интерфейсам, что позволяет любому злоумышленнику с доступом в интернет выполнять удаленный код, получать полный доступ к API-ключам LLM и повреждать память модели.

AI · 3 мин чтения

Баг «потерянного обновления» позволяет одному агенту незаметно перезаписать данные четырех других

При тестировании пяти параллельных агентов четыре операции записи бесследно исчезли, что привело к потере токенов, эквивалентной объему потерянной работы. Использование механизма compare-and-set позволило сохранить все результаты, но увеличило расход токенов с 5 до 9 единиц.

AI · 4 мин чтения

Разработчики теперь могут запускать агентов Gemini по расписанию, как cron-задачи, на бесплатном тарифе

Обновление вводит три новых инструмента управления: хуки окружения для проверки вызовов инструментов, жесткие бюджетные ограничения для предотвращения бесконтрольных трат и запланированные триггеры, превращающие API в облегченный cron, при этом ответственность за безопасность перекладывается на пользователя.

AI · 2 мин чтения

Показатели SWE-Bench подскочили до 72,7% после сокращения теста до 500 отобранных задач

Показатель SWE-Bench за 2025 год в 72,7% получен на основе суженного набора из 500 задач, прошедших проверку человеком, тогда как показатель 2023 года в 1,96% относился к полному каталогу из 2294 задач. Столь резкий скачок, попавший в заголовки, обусловлен изменением состава теста, а не внезапным прорывом в области ИИ.

AI · 3 мин чтения

Anthropic снимает ограничения Claude Code с помощью Opus 5, достигая 30% в бенчмарке Arc AGI

Убрав 80% защитных механизмов системного промпта, Opus 5 от Anthropic позволяет Claude Code сохранять контекст в течение нескольких дней, генерировать полноценные кодовые базы и противостоять атакам типа prompt-injection, превращая его в настоящего автономного помощника по разработке.

AI · 3 мин чтения