Отдельно про метрику на нашумевшем датасете FrontierMath. o3-mini (high) наконец-то сравнили с o1 по-честному, когда и та, и та генерирует несколько решений. Но главное написано под таблицей: > when prompted to use a Python tool, o3-mini with high reasoning effort solves over 32% of problems on the first attempt, including more than 28% of the challenging (T3) problems. T3 — это самые сложные задачи в бенчмарке, на которые даже ведущие учёные-математики могут потратить больше одного дня. А тут 28% у __мини__ модели.
Отдельно про метрику на нашумевшем датасете FrontierMath. o3-mini (high)…
Из этого канала
- #2284Если вы не хотели платить за подписку и редко пользовались ChatGPT (или вообще…
Если вы не хотели платить за подписку и редко пользовались ChatGPT (или вообще не пользовались) — сейчас самое время пойти завести аккаунт.
- #2285Как бесплатным юзерам пользоваться o3-mini: 1) нужно зайти в аккаунт (это…
Как бесплатным юзерам пользоваться o3-mini: 1) нужно зайти в аккаунт (это бесплатно, но нужен VPN из РФ) на chat.com 2) ввести свой запрос 3) нажать кнопочку…
- #2286Помните я писал про бенчмарк «Быки и коровы», где нужно угадывать, какое…
Помните я писал про бенчмарк «Быки и коровы», где нужно угадывать, какое четырёхзначное число загадал пользователь? (ответы и валидация автоматические) Ну так…
- #2282Заходим на chat.com, видим новую модель OpenAI o3-mini Доступна в двух…
Заходим на chat.com, видим новую модель OpenAI o3-mini Доступна в двух вариантах: обычная (= medium, не low!) и high (думает дольше, но усерднее).
- #2281Муд: придумываю, чем буду заниматься, пока o4 Pro будет генерировать ответ. Это…
Муд: придумываю, чем буду заниматься, пока o4 Pro будет генерировать ответ. Это если сейчас o1 Pro по 5-8 минут пишет, то бОльшая модель с прокачанными…