Современные технологии машинного зрения позволяют достигать точности распознавания лиц, сопоставимой с обычным человеческим восприятием, а также обеспечивают реальную возможность генерации визуальных образов. Вместе с тем исследования показали, что системы компьютерного зрения не способны идентифицировать оптические иллюзии и, как следствие, не могут их воспроизводить. Человеческое зрение представляет собой сложный механизм: несмотря на эволюционное происхождение в специфической среде, оно адаптировано к выполнению задач, которые были недоступны ранним зрительным системам, таких как чтение или идентификация техногенных объектов (транспорта, дорожных знаков и прочего). При этом человеческое зрение обладает характерными особенностями восприятия, проявляющимися в виде оптических иллюзий. Учеными уже выявлено множество сценариев, в которых данные искажения приводят к ошибочной оценке цвета, размера, пространственного положения и динамики объектов.

Концентрические круги?
Сами по себе иллюзии интересны тем, что дают представление о природе зрительной системы и восприятия. Поэтому будет очень полезно придумать способ находить новые иллюзии, которые помогут изучить ограничения этой системы.
Здесь нам должно пригодиться глубинное обучение. В последние годы машины научились распознавать объекты и лица на изображениях, а потом создавать похожие изображения. Легко представить, что система машинного зрения должна суметь распознавать иллюзии и создавать свои собственные.
Тут на сцену выходят Роберт Уильямс и Роман Ямпольский из Университета Луисвилля в Кентукки. Эти ребята попробовали провернуть такое дело, но обнаружили, что всё не так просто. Существующие системы машинного обучения не способны выдавать собственные оптические иллюзии – по крайней мере, пока. Почему же?
Сначала общая информация. Недавние подвижки в глубинном обучении основаны на двух прорывах. Первый — доступность мощных нейросетей и парочка программных трюков, позволяющих им хорошо обучаться.
Второй – создание огромных по объёму размеченных баз данных, на базе которых машины способны обучаться. К примеру, чтобы научить машину распознавать лица, требуются десятки тысяч изображений, содержащих чётко размеченные лица. С такой информацией нейросеть может научиться распознавать характерные закономерности лиц – два глаза, нос, рот. Что ещё более впечатляет, пара сетей – т.н. генеративно-состязательная сеть (ГСС) – способны научить друг друга создавать реалистичные и совершенно искусственные изображения лиц.

Уильямс и Ямпольский задумали научить нейросеть определять оптические иллюзии. Вычислительных мощностей достаточно, а подходящих баз данных не хватает. Поэтому их первой задачей стало создание базы данных оптических иллюзий для тренировки.
Это оказалось сложно сделать. «Статических оптических иллюзий существует всего несколько тысяч, а количество уникальных видов иллюзий очень мало – возможно, пара десятков», — говорят они.
А это серьёзное препятствие для современных систем машинного обучения. «Создание модели, способной научиться на таком небольшом и ограниченном наборе данных, станет огромным скачком вперёд для генеративных моделей и понимания зрения человека», — говорят они.
Поэтому Уильямс и Ямпольский собрали базу данных из более чем 6000 изображений оптических иллюзий, и натренировали нейросеть распознавать их. Затем они создали ГСС, которая должна самостоятельно создавать оптические иллюзии.
Результаты их разочаровали. «После семи часов тренировок на Nvidia Tesla K80 ничего ценного создано не было», — говорят исследователи, открывшие базу данных для использования всеми желающими.
Результат, тем не менее, интересный. «Единственные из известных нам оптических иллюзий были созданы эволюцией (к примеру, рисунки глаз на крыльях бабочки) или художниками-людьми», — указывают они. И в обоих случаях люди играли решающую роль в обеспечении обратной связи – люди могут видеть иллюзию.
А системы машинного зрения не могут. «Маловероятно, что ГСС сможет научиться обманывать зрение, не понимая принципов, лежащих в основе иллюзий», — говорят Уильямс и Ямпольский.
Это может оказаться сложной задачей, поскольку между зрительными системами человека и машины есть критически важные различия. Многие исследователи создают нейросети, ещё сильнее напоминающие зрительную систему человека. Возможно, одной из интересных проверок для этих систем будет то, смогут ли они увидеть иллюзию.
А пока Уильямс и Ямпольский не проявляют оптимизма: «Судя по всему, набора данных с иллюзиями может быть недостаточно для создания новых иллюзий», — говорят они. Так что, пока оптические иллюзии остаются бастионом человеческого восприятия, неподвластным машинам.
Для любознательных: Зачем ученые обманывают искусственный интеллект? Роль оптических иллюзий в обучении нейросетей
На первый взгляд, обучение нейросетей распознаванию и созданию оптических иллюзий кажется забавным экспериментом или цифровым развлечением. Зачем тратить огромные вычислительные мощности на то, чтобы заставить машину видеть «несуществующее движение» или прятать лица в пейзажах?
Однако для ученых в области компьютерного зрения и нейробиологов оптические иллюзии стали одним из главных инструментов для проверки зрелости ИИ. Это не просто тест на внимательность, а фундаментальный этап эволюции искусственного интеллекта.
Ниже подробно разобрано, какие глобальные задачи решает это направление исследований.
- Безопасность беспилотного транспорта и робототехники
Для человека оптическая иллюзия — это игра разума. Для беспилотного автомобиля — вопрос жизни и смерти.
Современные автопилоты полагаются на камеры и нейросети для распознавания знаков, разметки и пешеходов. Если алгоритм не умеет справляться с визуальными аномалиями, его можно легко «обмануть»:
- Случайные иллюзии: Необычное сочетание теней от деревьев, блики солнца на мокром асфальте или специфический изгиб забора могут слиться для ИИ в несуществующее препятствие, заставив машину резко затормозить на шоссе.
- Состязательные атаки (Adversarial Attacks): Злоумышленники могут нанести на дорожный знак едва заметный паттерн (своеобразную искусственную иллюзию), который человек даже не заметит, но нейросеть из-за него распознает знак «Стоп» как «Главная дорога».
Уча ИИ понимать контекст иллюзий, инженеры делают зрение роботов устойчивым к визуальному шуму и защищенным от хакерских атак.
- Ключ к пониманию человеческого мозга
Как ни парадоксально, исследуя «ошибки» нейросетей, ученые пытаются лучше понять человека.
Человеческое зрение — это продукт миллионов лет эволюции. Наш мозг не просто фиксирует пиксели, он достраивает картинку на основе опыта: предсказывает траекторию движения, оценивает глубину по теням и группирует объекты. Оптические иллюзии — это побочный эффект этих эффективных эволюционных механизмов.
Когда ученые обучают глубокие нейросети (например, предикативные модели, которые пытаются предугадать следующий кадр видео) и замечают, что ИИ начинает поддаваться тем же иллюзиям, что и человек (например, видит вращение статичных дисков), это доказывает:
- Математические модели ИИ начинают функционировать схоже с нашей зрительной корой.
- Иллюзии служат «лакмусовой бумажкой», проверяющей, научился ли ИИ видеть мир объемным и динамичным, или он все еще просто сканирует плоские пиксели.
- Тест Тюринга нового поколения и защита от ботов
По мере того как генеративный ИИ учится идеально обходить текстовые капчи, ИТ-индустрии требуются новые способы отличать человека от робота.
Оптические иллюзии могут стать основой для капчи нового поколения. Человеческий мозг мгновенно и без усилий считывает контекст иллюзии (например, понимает, какая линия на рисунке кажется длиннее или какой объект спрятан в текстуре). Для стандартной нейросети, не обученной контекстуальному анализу, это неразрешимая задача, так как на уровне “голых” пикселей геометрия рисунка говорит об обратном.
- Генерация иллюзий: от искусства до нейромаркетинга
Зачем учить ИИ не только видеть, но и создавать иллюзии? Здесь открываются огромные прикладные возможности:
- Инновационный дизайн и реклама: ИИ (например, связка Stable Diffusion и ControlNet) позволяет брендам создавать скрытые логотипы и смыслы внутри изображений товаров. Это приковывает внимание потребителя, заставляя его дольше разглядывать вывеску или постер.
- Архитектура и интерьер: Нейросети могут просчитывать генеративные паттерны для обоев, плитки или фасадов зданий, которые визуально расширяют пространство, меняют восприятие высоты потолков или скрывают строительные дефекты.
Вывод
Обучение нейросетей оптическим иллюзиям — это мост между сухой математикой пикселей и глубоким, контекстным пониманием физического мира. Заставляя ИИ «ошибаться» так же, как это делает человек, ученые шаг за шагом приближают компьютерное зрение к полноценному, живому восприятию реальности.
Источник: https://habr.com/
Автор: Вячеслав Голованов

