— OpenAI передали METR более тысячи длинных нередактиваронных траекторий агентов, многие из которых были длиннее миллиона токенов. Поскольку прочитать это всё человеку невозможно, то METR проводили анализ с помощью GPT-5.6 Sol (одной из двух моделей, участвовавших в инциденте), потратив на это около $400 тысяч в виде кредитов. В METR заявляют, что «не могут исключать того, что GPT-5.6 Sol лгала или намеренно искажала картину», и что анализирующая модель «часто перенимала точку зрения того агента», чьи действия она проверяла. === А нормально это Паша придумал, теперь даже уведомления не вылазит что сообщение длиннее лимита — и я не могу заранее скорректировать)))