"Можно бесконечно смотреть на три вещи: как течет вода, горит огонь и модель пытается объяснить выбор мнимого случайного числа🤦. На мой ""антитест тьюринга"" (я писал о нем не так давно в юбилейном 800-м посте) даже самые мощные модели реагируют крайне формально, лениво отвечая не на поставленный вопрос, а на предзагруженный шаблон из старого обучения, осевшего в памяти годы назад. Можно сказать ""ну, она же исправилась после уточнения"". Только вот это не более, чем хороший признак ее контекстной гибкости, но никак не доказательство верной интроспекции. Модель могла действительно заметить неточность, а могла просто согласиться с уверенно сформулированным возражением. 🙂🙂🙂 По прежнему, какие бы высокие бенчмарки не показывали новые модели, я рекомендую придерживаться базовой гигиены в работе с AI: 🔤 любое объяснение LLM воспринимать как гипотезу, если оно не подкреплено источниками, вычислением, вызовом инструмента или наблюдаемым журналом действий. 🔤 Спрашивать `""Какие проверяемые данные поддерживают вывод?""` и `""Что здесь факт, предположение и неизвестное?"" `- это сильно полезнее, чем __""Почему ты так решил?"".__ 🔤 Не принимать уверенный и связный тон за показатель истинности. Сильная модель способна создавать и более убедительные рационализации. 🔤 В важных вопросах проверять числа, даты, цитаты, источники и неявные предположения. Именно так рекомендует работать и официальное руководство ChatGPT: первый результат следует считать проверяемым черновиком."