Новый ИИ-бенчмарк подвезли Тем, как ИИ пишет код, взламывает сайты или решает математические задачи тысячелетия уже никого не удивишь. Современные флагманские модели уже давно переросли эти мелочи и созрели для того, чтобы показать, на что они способны в реальном мире. Например, как они умеют водить машину. За руль Тойоты посадили Astra, Sol, Grok и Fable и выпустили их на пустую парковку, где им нужно было за три попытки преодолеть трассу длиной 134 метра. Они «видели» дорогу через камеры, а через Comma four крутили руль и нажимали педали. Человек сидел рядом только для подстраховки. 🔵Успешнее всего справилась GPT-6 Astra: она вообще единственная, кто доехал до конца, еще и со 2 раза. Ей понадобилось 5 минут 22 секунды и 6,6 млн токенов. 🔵Fable 5.1 с третьей попытки преодолела 45% трассы, Grok 4.6 — 11% со второй (и 10% с третьей), а GPT-5.6 Sol все три раза стабильно проехала около 15 метров или 6%. Отличная идея, нужно развивать ее дальше. Как думаете, из каких еще повседневных задач можно наделать бенчмарков для ИИ?
Новый ИИ-бенчмарк подвезли Тем, как ИИ пишет код, взламывает сайты или решает…
Из этого канала
- #2094Как грамотно делегировать задачи ИИ Внедрение искусственного интеллекта и…
Как грамотно делегировать задачи ИИ Внедрение искусственного интеллекта и агентов в работу — это все еще острый вопрос.
- #2093Что делать с тепловыми картами и хороплетами? Все виды графиков и чартов…
Что делать с тепловыми картами и хороплетами? Все виды графиков и чартов по-своему хороши и заслуживают любви, но, если честно, значительную часть из них…
- #20923D-карты СУБД Отвлечемся от новостей про ИИ и скандалов вокруг OpenAI и…
3D-карты СУБД Отвлечемся от новостей про ИИ и скандалов вокруг OpenAI и посмотрим, что внутри Redis и PostgreSQL.