"Наконец-то выдали доступ к 4.5 в ChatGPT. Кидайте под этот пост промпты и задачи, завтра буду отбирать, тестировать и скидывать вам ответы на оценку. Критерии идеального запроса: — язык не английский — требует специфичных знаний в вашем домене — модели прошлого поколения проваливают — если больше 10 строк (например, много кода), то в pastebin — не тупая задачка ""а скока буков в слове"", а что-то, имеющее ценность Постараюсь параллельно скидывать ответы o1 Pro для сравнения. В чате один человек уже отозвался вот так: «Вот например с моими тестовыми заданиями про закручивание анкера в узком пространстве и подсчетом зданий на чертеже 4.5 справилась лучше всех. Во-первых она первая ответила правильно и разумно на задачку про закручивание анкера. Первая из всех испробованных мной ранее, включая о1! Во-вторых, первая правильно посчитала здания на плане. Поэтому я могу сказать, что это лучшая модель на сегодня в категории здравого смысла, если можно так выразиться». Гифка для привлечения внимания: генерация 4.5 по запросу `generate some cool visual for manim`: всего 36 строк кода выдало (я аж начал переживать, что получится какой-то пустяк), но выглядит приятно. UPD: спам не по делу в комментах будет баниться."
"Наконец-то выдали доступ к 4.5 в ChatGPT. Кидайте под этот пост промпты и…
Из этого канала
- #2385"По традиции, выход новой модельки тестирую на копипасте про батин суп. На этот…
"По традиции, выход новой модельки тестирую на копипасте про батин суп. На этот раз стих от GPT 4.5 (Preview).
- #2386Немного подвожу итоги вчерашней презентации. Кажется, сами OpenAI не восприняли…
Немного подвожу итоги вчерашней презентации. Кажется, сами OpenAI не восприняли её супер-серьёзно: — никаких C-levels или VP (типа моего любимца Mark Chen) на…
- #2388Всю последнюю неделю DeepSeek проводили «дни открытых дверей» — каждый день…
Всю последнюю неделю DeepSeek проводили «дни открытых дверей» — каждый день публиковали репозиторий с кодом, который так или иначе используется ими для…
- #2382Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный…
Первые независимые бенчмарки подъехали. Маленький шаг от Соннета, но огромный шаг от GPT-4o.
- #2381Про точность знаний и галлюцинации: странно, что в статье этого нет, а на сайте…
Про точность знаний и галлюцинации: странно, что в статье этого нет, а на сайте модели есть, замеры на бенчмарке от самих же OpenAI SimpleQA.