Нашёл интересный график. Есть такой бенчмарк, GPQA, в нём достаточно сложные вопросы (...были) и 4 варианта ответа, из которых надо выбрать. По сути, тест. Насколько проседают модели, если не давать им варианты ответа и просить выбрать, а просто давать генерировать решение и ответ, а затем извлекать его и проверять? Модели, ожидаемо, проседают, но из списка всех LLM, которые протестировали авторы, в топе o4-mini-high, а Grok 4 внезапно падает даже ниже Grok 3 mini. Источник