В общем, o3 и o4 mini — классные модели. Как обычно, потестил на своей магистрской работе. Особенно внимание уделил сложному интегралу - на каждом шаге по времени его нужно заново пересчитывать. В этот раз о3 меня немного удивила: она предложила интересную схему численного расчета, показала, как интеграл все-таки можно пересчитывать от предыдущего значения. И хотя при прямом использовании особой пользы в расчетах это не добавляет, но круто вот что: о3 показала, как при таком виде, расчет этого интеграла можно аппроксимировать с помощью Fast Fourier Transform свертки, и вот это уже огонь. Это очень сильно ускоряет расчеты - O(NlogN) вместо O(N^2) - при этом точность практически не страдает. Ни я, ни мой научрук в свое время даже не думали в эту сторону. 🫠 Тут надо глубже разбираться, конечно, но выглядит вкусно на первый взгляд. Сегодня буду тестить на рабочих задачах. P.S. Я натыкался на разные твиты, где модели тупят на простых вопросах. Пробовал это воспроизводить — модели всегда отвечали правильно. Судя по комментам, у других людей оно тоже работает хорошо. Так что, возможно, это какой-то троллинг или байт на комменты - не ведитесь.
В общем, o3 и o4 mini — классные модели. Как обычно, потестил на своей…
Из этого канала
- #2515Наша любимая рубрика «Новости OpenAI за неделю», девиз недели — «думаем…
Наша любимая рубрика «Новости OpenAI за неделю», девиз недели — «думаем наперёд»: — Во вторник появилась новость, что OpenAI находятся на ранних стадиях…
- #2516VideoGameBench В последнее время LLM демонстрируют способность решать…
VideoGameBench В последнее время LLM демонстрируют способность решать невероятно сложные задачи на рассуждения в математике и программировании.
- #25171) GPT-4o играет в Doom II на самом лёгком уровне сложности. Игра стоит на…
1) GPT-4o играет в Doom II на самом лёгком уровне сложности. Игра стоит на паузе, пока модель делает предсказания. 2) GPT-4o играет в Super Mario Land.
- #2513А да, o3 дешевле o1, забыл сказать
А да, o3 дешевле o1, забыл сказать
- #2512o3 набирает 81.3% в Aider Bench, Gemini 2.5 Pro берёт первое место с 72.9%…
o3 набирает 81.3% в Aider Bench, Gemini 2.5 Pro берёт первое место с 72.9% Остальное тут: https://openai.com/index/introducing-o3-and-o4-mini/ ChatGPT Plus,…