Отдельно напишу по-моему очевидную, но для многих нет, мысль: GPT-5 НЕ будет лучше o3 (может даже o1) в математике и алгоритмах. Мы не увидим разрывных графиков «было — стало» для LeetCode/Codeforces/FrontierMath/прочих reasoning-heavy задач, и рекламировать/презентовать модель по идее должны не с помощью вышеуказанных бенчмарков. Однако новая базовая модель может открывать путь к другим, ранее невозможным сценариям. Основные кандидаты на то, что должно существенно улучшится: — мультимодальность и пространственное мышление (лучше работа с документами, картинками, видео, аудио) — длина контекста — знания, представленные в интернете в малом объеме (например, на 1-2 языках), а также специфичные вещи из отдельных профессий — более точно откалиброванная граница «знаю — не знаю», уменьшение галлюцинаций (хотя не уверен, что лучше o3) — In-context learning, то есть умение схватить на лету из примеров, которые будут представлены в промпте. Сложно судить что тут лучше, что хуже, так как я даже для о1 не видел нормальных замеров этого навыка, не говоря про о3 — как следствие In-context learning — меньше контекстных галлюцинаций (когда модель пишет что-то по памяти, а не с опорой на контекст, хотя из промпта явно следует что нужно предпочитать вашу информацию) Не всё из этого может быть сразу, хотя конечно хотелось бы всего да побольше! А вот потенциальная o4, обученная поверх этой модели, уже совместит в себе и всё перечисленное, и крутую размышлялку поверх, которая будет умело пользоваться знаниями и возможностями для решения задач.
Отдельно напишу по-моему очевидную, но для многих нет, мысль: GPT-5 НЕ будет…
Из этого канала
- #2228Paul Schrader, сценарист фильмов «Таксист» и «Бешеный бык» (за режиссёрством…
Paul Schrader, сценарист фильмов «Таксист» и «Бешеный бык» (за режиссёрством Martin «🖐😶🤚» Scorsese ), пишет в фейсбуке: — Я только что осознал что AI умнее…
- #2230What does it take to be an AI skeptic in 2025? (я не смог придумать звучное…
What does it take to be an AI skeptic in 2025? (я не смог придумать звучное название поста на русском, предлагайте варианты в комментариях!) Есть такой AI…
- #2232Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут?…
Новая AI драма! Помните датасет/бенчмарк FrontierMath, про который я писал тут? В нём собраны сложные и очень сложные задачи, которые (пока) не под силу LLM…
- #2226Позавчера Sama вышел ~~в народ~~ в твиттер поотвечать на вопросы про будущие…
Позавчера Sama вышел ~~в народ~~ в твиттер поотвечать на вопросы про будущие модели.
- #2222Картинки! (лучше открыть статью и листать там в конце) Как читать каждую…
Картинки! (лучше открыть статью и листать там в конце) Как читать каждую строчку: — первые 3 изображения: это генерации без поиска (брали первый попавшийся…