Рассказ о том как искусственный интеллект научился решать головоломку в виде кубика Рубика

К настоящему времени созданы довольно мощные программыне решения, которые могут играть с вами в шахматы. Относительно недавно была предложена платформа от Deep Mind, которая была обучена игре в ГО на уровне хорошего профессионала. Причем, играет эта удивительная платформа настолько профессионально, что игроков среди людей, равных компьютеру, сейчас нет, и скорее всего, не будет. На днях стало известно, что машина самостоятельно научилась решать еще одну сложную головоломку — кубик Рубика. Причем при обучении ей не демонстрировали, как правильно собирать кубик, программная платформа, созданная учеными из США, всему научилась самостоятельно. Некоторые специалисты считают, что перед машинами пал еще один «бастион, считавшийся владением человека».

Кубик Рубика, вернее, алгоритм его сборки, сложен тем, что каждое действие при сборке несет определенные последствия, но предугадать их влияние на общий процесс сборки достаточно сложно.

Даже для машины. Люди обычно учатся собирать кубик по ранее разработанным алгоритмам, позволяющим решить головоломку в кратчайшие сроки. Некоторые из обучившихся делают просто удивительные успехи на этом поприще. Так, в мае этого года был установлен очередной рекорд по сборке кубика Рубика двумя руками. Чемпион, 22-летний австралиец по имени Феликс Земдегс, смог собрать кубик всего за 4,22 секунды. Он начал тренироваться с 12 лет, просмотрев записи сборки на YouTube.

Что касается машины, то роботы собирают кубик еще быстрее. В этом году рекорд был поставлен за 0,38 секунды. Можно было бы и быстрее, но может не выдержать механика самого кубика. В попытках поставить рекорд разработчикам пришлось усиливать конструкцию кубика, иначе он просто разваливался от слишком быстрых манипуляций машины.

В случае платформы, о которой идет речь выше, работа ведется по заранее введенным в память системы алгоритмам. Но ученые из МИТ смогли обучить собственную систему собирать Кубик самостоятельно.

При создании самого кубика его изобретателем наиболее интересной задачей была разработка способа решить головоломку из любого положения. Инженеру Рубику удалось это сделать за месяц. В дальнейшем алгоритм сборки неоднократно совершенствовался.

С недавних пор специалисты по ИИ начали искать способ научить машину складывать кубик. В ход шло глубокое машинное обучение. Системе давали задачу и объясняли правила. Далее робот должен был действовать уже самостоятельно. В случае прогресса машина получала награду — примерно так и обучают слабые формы ИИ. Ведь компьютер должен знать, что движется в правильном направлении. И ему дают это понять благодаря системе наград. Все это помогает машине обучаться.

В случае с кубиком Рубика это несколько сложнее, чем в обычном случае. Дело в том, что до определенного момента нельзя понять, правильно или нет действует система. А награждать за случайный поворот грани, не приносящий результата, смысла нет. В шахматах все проще — там уже со второго-третьего хода можно понять, в каком направлении движется партия и хорошо или нет действует машина. Соответственно, есть за что награждать.

Для того, чтобы научить компьютер складывать кубик Рубика, была использована специализированная технология глубокого обучения, которая получила название «автодидактическая итерация». Эта технология позволяет «раскручивать» уже собранный кубик, чтобы добиться конфигурации, которая похожа на текущую. Получается нечто вроде реверс-инжиниринга, если этот термин применим к обучению машин. Создается специализированное «дерево решений», которое машина использует для вычисления шагов к каждой конфигурации.

Результат получился впечатляющим. По словам самих разработчиков, алгоритм может решить головоломку примерно в 30 ходов. Причем машина собирает кубик в 100% случаев, какой бы вариант разобранной головоломки ей бы ни попался. В целом, для того, чтобы собрать хорошо фрагментированную головоломку, необходимо от 19 до 23 шагов. Некоторые решения приводят к желаемому результату быстрее, чем прочие. Наиболее быстрый алгоритм сборки состоит из 21 шага.

Платформа, разработанная инженерами МИТ, получила название DeepCube. «Наша платформа в состоянии самообучаться в условиях сложного окружения, получая всего одну награду за весь процесс работы», — говорится в отчете специалистов.

Сейчас эта же команда ученых работает над реализацией своего метода обучения к решению других сложных комбинаторных задач. В числе прочих — предсказание третичной структуры белка.

Для любознательных: Игры разума: как искусственный интеллект научился щелкать головоломки как орехи, и где в этой гонке Россия

До недавнего времени считалось, что сложные логические задачи, ребусы и пространственные головоломки — это последний бастион человеческого превосходства. Компьютеры давно обыграли нас в шахматы и го благодаря колоссальной вычислительной мощности. Но столкнувшись с задачей, где правила меняются на ходу, а готовых шаблонов нет, ИИ пасовал.

Однако ситуация в корне изменилась. Новое поколение нейросетей, обученное рассуждать, а не просто угадывать слова, научилось решать сложнейшие нестандартные задачи.

От «угадывания» к «рассуждению»: в чем прорыв?

Раньше большие языковые модели (LLM) работали как продвинутый Т9 — они предсказывали следующее наиболее вероятное слово. По этой причине они легко заваливали простейшие детские загадки с подвохом или путались в пространственных головоломках вроде сборки кубика Рубика в уме.

Современный прорыв базируется на трех китах:

  • Цепочки рассуждений (Chain-of-Thought): ИИ больше не выдает ответ мгновенно. Он берет паузу, строит внутренний монолог, разбивает сложную головоломку на подзадачи и проверяет сам себя на каждом шаге.
  • Обучение с подкреплением (RL): нейросети тренируют в виртуальных средах, где за правильное решение головоломки они получают «награду». Так ИИ учится искать нестандартные стратегии.
  • Мультимодальность: современные модели одновременно видят картинку, понимают текст и считывают геометрию, что критически важно для визуальных ребусов.

Самым ярким примером триумфа ИИ стал тест ARC-AGI (абстрактный тест на интеллект Франсуа Шолле), состоящий из уникальных визуальных головоломок. Долгое время машины не могли набрать в нем даже 30% правильных ответов, но последние архитектуры вплотную приблизились к показателям взрослого человека.

Что происходит в мире?

Мировые технологические гиганты превратили решение головоломок в главный полигон для испытания «сильного» искусственного интеллекта (AGI).

  • OpenAI и Google (США): последние модели линеек o1/o3 и Gemini Advanced проектировались именно под сложные рассуждения. Они способны решать олимпиадные задачи по геометрии, распутывать детективные загадки и проходить тесты на пространственное мышление, строя многоуровневые гипотезы.
  • DeepMind: их специализированные агенты, наследники знаменитого AlphaGo, теперь решают не только настольные игры, но и сложнейшие научные головоломки — например, предсказывают свертывание белков (AlphaFold) или ищут новые математические алгоритмы, что по сути является высшей формой математического ребуса.
  • DeepSeek и китайская школа ИИ: разработчики из Поднебесной совершили революцию, доказав, что обучить ИИ сложной логике и решению головоломок можно в разы дешевле и быстрее с помощью открытых математических датасетов и алгоритмов рассуждения (Reasoning models).

А что в России?

Российская ИИ-индустрия не отстает от мировых трендов, делая упор на создание собственных суверенных моделей, способных к сложной логике.

  • Яндекс (YandexGPT и семейство Omni): Разработчики Яндекса активно обучают свои нейросети логическому мышлению. Российская модель демонстрирует отличные результаты в решении текстовых логических задач, математических олимпиадных ребусов и тестов на здравый смысл (common sense reasoning), адаптированных под специфику русского языка и культурный контекст.
  • Сбер (GigaChat): Команда Сбера делает ставку на мультимодальность и сильную математическую базу. GigaChat обучают решать не только текстовые головоломки, но и графические задачи, схемы и пространственные ребусы, что необходимо для применения ИИ в реальном инженерном секторе.
  • Академическая среда (Институт ИИ AIRI, РАН, МФТИ): В России сильна фундаментальная математическая школа. Ученые из AIRI и ведущих вузов разрабатывают алгоритмы обучения с подкреплением, которые позволяют ИИ находить выходы из сложных виртуальных лабиринтов и решать комбинаторные задачи, оптимизируя логистику и управление беспилотниками.

Зачем ИИ решать головоломки в реальной жизни?

Умение щелкать ребусы — это не просто развлечение. Для ИИ головоломка — это идеальная модель хаотичного реального мира.

Если нейросеть способна решить задачу с меняющимися правилами на картинке, значит, она сможет:

  1. Найти новую формулу лекарства, перебирая миллиарды комбинаций молекул как элементы мозаики.
  2. Выявить скрытые уязвимости в программном коде, написанном человеком.
  3. Оптимизировать городские транспортные потоки в режиме реального времени, когда каждый затор — это логистическая загадка.

Машины научились играть в наши игры, и теперь этот навык они направляют на решение глобальных задач человечества.