Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого исследователя, у него есть другие клёвые работы) вышеупомянутого бенчмарка SWE Bench Verified , который делался совместно с OpenAI. Он говорит примерно то же, что я написал выше — OpenAI имели доступ к решениям и задачам многих бенчмарков, но их не ловили на том, что они читерят и как-то нечестно используют эти данные.
Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого…
Из этого канала
- #2235Mood: https://youtu.be/j5GgGdSwjE?t=29 Пояснение: увидел в твиттере от нонейма…
Mood: https://youtu.be/j5GgGdSwjE?t=29 Пояснение: увидел в твиттере от нонейма (я ни разу его не видел) наброс, что якобы в OpenAI уже есть o4-alpha, и что это…
- #2236Сегодня-завтра DeepSeek должны разродиться полноценной ризонинг-моделью R1,…
Сегодня-завтра DeepSeek должны разродиться полноценной ризонинг-моделью R1, веса уже появились на HuggingFace. Надеюсь, что будет статья + замеры метрик.
- #2237Big if true: Tibor Blaho нашёл в коде сайта OpenAI указания метрик грядущего…
Big if true: Tibor Blaho нашёл в коде сайта OpenAI указания метрик грядущего агента Operator.
- #2233TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю…
TLDR: — Верю ли я, что OpenAI тренировались на решениях этих задач? Нет. — Верю ли я, что OpenAI тренировались на условиях конкретно этих задач? Тоже нет.
- #2232Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут?…
Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут? В нём собраны сложные и очень сложные задачи, которые (пока) не под силу LLM…