GPT-5.6 Sol Ultra от OpenAI решила математическую гипотезу 50-летней давности
Последняя модель рассуждения от OpenAI, GPT-5.6 Sol Ultra, по сообщениям, совершила прорыв в теории графов, решив математическую гипотезу, которая оставалась открытой с 1970-х годов. Благодаря исключительной вычислительной настойчивости и мультиагентной архитектуре, модель представила полное доказательство менее чем за час.
Разгадка тайны теории графов
Рассматриваемая гипотеза касается фундаментального вопроса теории графов: можно ли в любой сети вершин и ребер найти набор циклов, который проходит через каждое отдельное ребро ровно дважды. Хотя за последние пять десятилетий математики находили частичные решения для конкретных случаев, общее доказательство оставалось недостижимым.
Томас Блум, математик из Манчестерского университета, описал доказательство как «короткое, элементарное, которое могло быть открыто еще в 1980-х годах». Интересно, что решение не потребовало изобретения совершенно новых математических теорий; вместо этого оно умело синтезировало существующие инструменты и известные математические структуры.
Сила машинной настойчивости
Возникает критический вопрос: если математика была «элементарной», почему люди не могли решить её в течение 50 лет? Блум предполагает, что решение требовало небольшого, контринтуитивного поворота в рассуждениях. Математики-люди часто следуют логическим путям, которые в случае неудачи приводят к выводу, что задача неразрешима.
Напротив, GPT-5.6 Sol Ultra демонстрирует уровень «машинной настойчивости». Она не подвержена когнитивному искажению в виде разочарования. Вместо этого модель непрерывно исследует мельчайшие вариации в логике и маркировке, пока не будет найден верный путь. Эта способность к перебору логических перестановок без «пожимания плечами от поражения» позволила ИИ обойти ментальные барьеры, которые останавливали исследователей-людей.
Продвинутый промпт-инжиниринг и мультиагентная архитектура
Успех Sol Ultra стал результатом не только «чистого» интеллекта, но и высокотехнологичного промпт-инжиниринга. Чтобы модель не выдавала стандартное «я не знаю», исследователи использовали ряд строгих директив:
- Принудительное допущение: Промпт заставлял модель исходить из того, что полное доказательство существует, не позволяя ей заявлять, что гипотеза не решена.
- Изоляция информации: Модели было запрещено искать информацию в интернете, чтобы проверить, была ли задача уже решена.
- Мультиагентное состязательное тестирование: Использовалась система из 64 агентов. Многие из них были «не в курсе» того, какой логический подход работает, чтобы обеспечить независимость рассуждений, в то время как состязательные агенты тщательно проверяли предлагаемые доказательства на наличие специфических ошибок, таких как неверно идентифицированные замкнутые пути.
Дискуссия о креативности ИИ и цитировании
Этот прорыв вновь разжег споры о том, являются ли LLM по-настоящему «креативными» или же они просто являются сложными комбинаторами существующих знаний. Блум отметил, что основные идеи доказательства восходят к работе Бермонда, Джексона и Йегера 1983 года. Он раскритиковал OpenAI за отсутствие ссылок на этот предшествующий труд, отметив, что статьи, созданные ИИ, часто используют существующие стратегии без надлежащего указания авторства.
Хотя научное сообщество всё ещё ожидает полной математической проверки, это событие сигнализирует о сдвиге в ландшафте ИИ. Крупномасштабные модели ИИ всё чаще привлекаются для решения открытых научных проблем, потенциально находя решения, которые всё это время были в пределах досягаемости человека.
Основные выводы
- Настойчивость важнее сложности: ИИ решил давнюю проблему не за счёт изобретения новой математики, а за счёт применения существующих теорий с таким уровнем неутомимого логического варьирования, который недоступен человеку.
- Строгие ограничения приносят результаты: Использование «состязательных» промптов и запрет на поиск в интернете заставили модель искать решение, а не выдавать стандартный ответ «не решено».
- Проблема атрибуции: Инцидент подчеркивает растущую обеспокоенность в исследованиях ИИ относительно отсутствия надлежащего цитирования, когда модели комбинируют существующую научную литературу.
