Мультиагентные рабочие процессы сейчас доминируют на GitHub. Разработчики объединяют большие языковые модели в цепочки, назначая каждому агенту узкую специализацию и оркестрируя их результаты для решения задач, с которыми не справилась бы ни одна модель в одиночку. Результаты могут впечатлять. Один агент проводит исследование, другой составляет черновик, третий проверяет факты, а четвертый форматирует финальный результат. Но за всей этой координацией скрывается хрупкая зависимость. Если самый первый шаг — преобразование пользовательского ввода в машиночитаемые инструкции — выполняется медленно или неточно, вся цепочка рассыпается. Последующий агент не может исправить мусор. Он может лишь транслировать его дальше.

Именно здесь на помощь приходит Iflytek/domux. Это модель с открытым исходным кодом, созданная именно для одной критически важной задачи: быстрого понимания команд. Вместо того чтобы писать эссе или вести открытые диалоги, domux анализирует естественный язык и экспортирует строгие структурированные данные, которые другие агенты могут немедленно использовать. Любая система, нуждающаяся в структурированном вводе в реальном времени — от хабов умного дома до промышленных панелей управления — может использовать её в качестве слоя восприятия.

Самое слабое звено в цепи

Рассмотрим, что происходит, когда пользователь дает простую команду, например: «сделай здесь светлее». В мультиагентной среде это высказывание может проходить через контроллер освещения, монитор энергопотребления и регистратор событий безопасности. Если начальный парсер возвращает нечеткое предложение вроде «пользователь хочет больше света», каждому последующему агенту приходится заново интерпретировать смысл. Кто-то может замереть в ожидании точных параметров. Другие могут ошибочно предположить комнату или уровень яркости. Рабочий процесс замирает.

Задержка усугубляет проблему. Добавьте всего несколько сотен миллисекунд задержки парсинга на входе, и к тому времени, когда информация достигнет третьего агента, система уже будет казаться неисправной. Среды реального времени не прощают медленного старта. Разработчики обнаруживают, что фреймворки оркестрации прекрасно выглядят на архитектурных диаграммах, но рушатся, когда получают неоднозначные или медленные входные данные. Вам нужен выделенный слой, который стандартизирует команды еще до того, как остальная часть рабочего процесса начнет «думать».

Domux спроектирован именно как такой слой. Он принимает неструктурированную человеческую речь и преобразует её в чистую схему, которую последующие агенты могут воспринимать как эталонные данные.

Скорость, структура и точность

Проект заявляет о трех характеристиках, которые напрямую влияют на поведение в продакшене.

Во-первых, он отвечает менее чем за 150 миллисекунд. Этот порог имеет значение. В интерактивных средах отклик менее четверти секунды ощущается как мгновенный, в то время как всё, что приближается к целой секунде, приучает пользователей отказываться от инструмента. Независимо от того, поступает ли ввод через голос или через чат-интерфейс, domux поддерживает непрерывность конвейера.

Во-вторых, он сопоставляет входные данные со строгой схемой из семи полей. Для последующих систем нет неструктурированного текста, который нужно было бы декодировать. Каждая команда вставляется в предсказуемые столбцы.

В-третьих, заявляется точность 98,37% при 100-процентном соблюдении формата. Точность означает, что модель обычно правильно понимает пользователя. Соблюдение формата означает, что выходные данные структурно валидны каждый раз. Парсер с точностью 99%, который время от времени пропускает поле или выдумывает новое, является источником риска в автоматизированной цепочке. Одна некорректная строка может привести к сбою агента-потребителя.

Вот как на самом деле выглядит результат. Когда модель обрабатывает команду, она возвращает запись, разделенную вертикальной чертой (pipe-delimited):

action|device|attribute|value|unit|room|floor
turnOn|light|brightness|80|percent|living room|ground floor

Этот формат намерен. Текст, разделенный вертикальной чертой, тривиально парсится на любом языке программирования без тяжелых зависимостей. Это позволяет избежать избыточности JSON и задержек, вызванных вложенной сериализацией. Агент управления освещением может прочитать столбцы action и device и действовать немедленно. Агент логирования может извлечь room и floor, не запуская еще один проход инференса. Структура исключает двусмысленность по определению.

Обработка неструктурированной человеческой речи

Реальные люди не говорят как документация API. Они говорят вещи вроде «сделай здесь светлее» или «согрей здесь». Хрупкий парсер на этом сломается. Domux справляется с неопределенностью, сопоставляя намерение с действием по корректировке и позволяя последующим системам самостоятельно определять точное значение. Если кто-то говорит «сделай здесь светлее», модель идентифицирует действие как увеличение яркости. Конкретный числовой уровень остается на усмотрение агента управления освещением, который определит его на основе текущих показателей, времени суток или