Отдельно про метрику на нашумевшем датасете FrontierMath. o3-mini (high) наконец-то сравнили с o1 по-честному, когда и та, и та генерирует несколько решений. Но главное написано под таблицей: > when prompted to use a Python tool, o3-mini with high reasoning effort solves over 32% of problems on the first attempt, including more than 28% of the challenging (T3) problems. T3 — это самые сложные задачи в бенчмарке, на которые даже ведущие учёные-математики могут потратить больше одного дня. А тут 28% у __мини__ модели.