Загадка с подвохом

Представьте ситуацию: автомойка находится всего в 50 метрах от вашего дома. Как вы доберетесь туда — на машине или пешком? Для человека вопрос кажется нелепым. Ответ очевиден: нужно поехать на машине, ведь цель — помыть автомобиль, а не просто прогуляться. Если пойти пешком, машина останется дома, и задача не будет выполнена.

Однако современные нейросети, такие как ChatGPT, Claude и Grok, часто попадаются в эту ловушку. Они выбирают вариант «пешком» и начинают убедительно доказывать, что это рационально. Модели рассуждают логично, но неверно: расстояние короткое, заводить двигатель не имеет смысла, пешком будет быстрее. С точки зрения математической задачи на кратчайший путь это верно, но с точки зрения жизненной логики — это ошибка.

Проблема интерпретации

Этот эксперимент, разгоревшийся на платформе Hacker News, показал, что проблема не в отсутствии знаний. Нейросети прекрасно знают, что такое автомойка и что машину нужно туда доставить. Проблема в том, что они не могут правильно связать эти факты в конкретной ситуации.

У языковых моделей есть паттерн: «на короткие расстояния люди ходят пешком». В данном случае этот шаблон оказывается сильнее, чем общая логика задачи. Модель видит набор признаков — расстояние, выбор способа передвижения и объект — и выбирает наиболее вероятную текстовую комбинацию, игнорируя физический смысл происходящего.

Разница между текстом и реальностью

Главное различие между человеком и ИИ заключается в том, как они воспринимают информацию. Человек получает не просто текст, а описание ситуации. Мы автоматически достраиваем контекст: понимаем, где находится машина, что мы собираемся совершить действие и что объект должен физически переместиться в точку назначения. Нам не нужно проговаривать это отдельно.

Нейросеть же работает исключительно с текстом. Для нее нет «физического мира», есть только статистические вероятности слов. Даже если пользователь уточняет детали, указывая, что машина стоит дома, модель может продолжить ошибаться, выбирая не ту интерпретацию из-за веса других факторов в тексте.

Нестабильность рассуждений

Исследования показывают, что даже одна и та же модель может давать разные ответы на один и тот же вопрос в зависимости от режима работы. Например, в экспериментах с моделями OpenAI было замечено: в стандартном режиме ИИ может предложить идти пешком, но при включении режима расширенного рассуждения (Extended Thinking) он внезапно меняет решение на «ехать на машине».

Это происходит без добавления новых фактов. Меняется только способ, которым модель выстраивает цепочку логических связей. Для обычных программ такое поведение невозможно: один и тот же вход всегда должен давать один и тот же результат. В случае с ИИ результат зависит от выбранного алгоритма обработки информации.

Новый подход к общению с ИИ

Этот феномен заставляет переосмыслить само понятие промпт-инжиниринга. Раньше считалось, что достаточно просто грамотно сформулировать вопрос. Теперь становится ясно, что для сложных задач модели недостаточно простого вопроса — ей нужно предоставить описание состояния мира.

Пользователи замечают: чтобы получить надежный результат, нужно сначала построить для модели широкий контекст. Вместо прямого вопроса лучше сначала описать все вводные: где находится объект, какие есть ограничения и какова конечная цель. Хороший промпт будущего — это не удачная фраза, а детальное техническое задание, описывающее физическую реальность.

Что это значит

Проблема заключается в отсутствии у нейросетей практического интеллекта — способности ориентироваться в повседневных ситуациях на основе жизненного опыта. Из-за этого общение с ИИ требует от человека перехода от простых вопросов к детальному описанию контекста, чтобы модель могла правильно интерпретировать ситуацию.

Первоисточник: Habr AI
Источник материала