Классический тест на внимание выявил главную уязвимость ИИ

Системы искусственного интеллекта могут писать эссе, отвечать на вопросы и решать сложные задачи. Но оказалось, что они могут испытывать трудности с тем, что люди делают каждый день: сохранять концентрацию на задаче, когда что-то отвлекает.
Автор новостей
ИИ способен решать сложнейшие задачи, но у него есть серьезная уязвимость.
ИИ способен решать сложнейшие задачи, но у него есть серьезная уязвимость.Источник: Market Power

Группа специалистов под руководством Сукету Пателя проверила несколько ведущих моделей ИИ с помощью классического психологического эксперимента — теста Струпа. Результаты выявили существенную разницу между тем, как обрабатывают информацию системы ИИ, и тем, как управляет вниманием человеческий мозг.

Тест Струпа используется десятилетиями для оценки внимания, концентрации и самоконтроля. В нем слова, обозначающие цвета («красный», «синий», «зеленый»), отображаются цветными чернилами. Иногда слово и цвет чернил совпадают — например, слово «красный» написано красными чернилами. Иногда они конфликтуют: слово «красный» может быть напечатано синим. При этом участнику нужно назвать цвет чернил, а не прочитать слово.

Звучит просто, но для мозга такое расхождение создает проблему, поскольку чтение слов — автоматическая привычка. И во время теста мозг должен подавить желание прочитать слово и вместо этого сосредоточиться на определении цвета чернил. Психологи используют этот тест для измерения исполнительного контроля — набора умственных процессов, которые помогают регулировать внимание, противостоять отвлекающим факторам и оставаться сфокусированными на целях.

Пример последовательности слов в тесте Струпа.
Пример последовательности слов в тесте Струпа.Источник: gpt-image-1

Ученые проверили, справляются ли современные большие языковые модели с этой задачей так же, как люди. Когда ИИ получал короткие списки из пяти цветных слов, системы обычно работали хорошо, даже при несовпадении слов и цветов. Однако картина резко изменилась с увеличением списков.

GPT-4o достиг 91% точности при работе с пятью словами. При десяти словах точность упала до 57%. Когда список расширился до сорока слов, точность упала всего до 15%. Claude 3.5 Sonnet поддерживал стабильную производительность до двадцати слов, но затем испытал резкое падение до 24% точности при списках из сорока слов. Похожие закономерности в работе наблюдались у GPT-5, Claude Opus 4.1 и Gemini 2.5.

Задача становилась еще сложнее, когда совпадающие и несовпадающие цветные слова появлялись вместе в одном списке. В таких условиях точность для несовпадающих элементов падала почти до нуля. ИИ-модели не могли последовательно поддерживать изначальную инструкцию «определи и назови цвет чернил» и все чаще переключались на чтение самих слов — то есть, они не могли подавить действие, на выполнение которого они были больше всего натренированы.

Ученые подчеркивают, что при работе с ИИ важно учитывать его проблему с удержанием внимания.
Ученые подчеркивают, что при работе с ИИ важно учитывать его проблему с удержанием внимания.Источник: Freepik

Авторы работы делают вывод: несмотря на впечатляющие успехи в языке и логике, крупные языковые модели обрабатывают информацию принципиально иначе, чем биологический мозг. Человек может долго удерживать цель и фильтровать помехи, тогда как ИИ, даже следуя простой инструкции, теряет «фокус» по мере роста нагрузки и длины последовательности.

С практической точки зрения нам нужно помнить, что даже самые продвинутые модели уязвимы в задачах, где нужно не просто предсказывать вероятный текст, а последовательно подавлять привычный шаблон и твердо следовать правилу. Для разработчиков это важный ориентир: если мы хотим, чтобы ИИ надежно работал в условиях помех и длинных сценариев, ему придется научиться тому, что для людей стало почти незаметной повседневной функцией — устойчивому контролю внимания.

Ранее ученые выяснили, что обучение ИИ доброжелательности снижает его фактическую точность.