Маленький апдейт по загадочной quasar-alpha на Openrouter: — Sam Paech, автор EQ bench и пары других бенчмарков, прогнал её через свои поделия. На бенчмарке креативного письма, где DeepSeek R1, кстати, занимает первое место, её ответы наиболее похожи на модели OpenAI (от 4o до 4.5: одни и те же слова чаще всего встречаются) — Модель лучше всех на Judgemark v2 (оценка того, насколько хорошго LLM автоматически оценивают/выступают в роли судьи), и стабильно выигрывает в онлайн-игре «Дипломатия» — артефакты токенизации (что модель «не видит» или путает некоторые токены), которые присущи моделям OpenAI и не проявляются у других моделей, присутствуют и тут — формат ID вызовов инструментов под капотом схож с тем, что используют OpenAI. Самое близкое, что есть — Qwen, но у них ID содержат 22 знака, а не 24 (как у OpenAI) — на бенчмарке ответов на вопросы по длинным историям (на котором Gemini 2.5 Pro идёт первой с большим отрывом) модель уступает GPT-4.5, но обходит o3-mini и o1 И два фактора, которые я уже упоминал: — 130 токенов в секунду, что примерно как Gemini 2.5 Pro (очень быстро, быстрее GPT-4o и Claude Sonnet), да ещё и контексту миллион токенов. Ну прям как будто точно модель от Google, если бы не часть аргументов выше. — Если модель от Google, то почему она настолько стабильно отвечает, что её сделали OpenAI... почти наверняка это бы вытренировали из неё, даже если это превью эксперимента В общем, мои ставки 80/20 что это OpenAI/Google. Если OpenAI, то это может быть o4-mini, которую Sama на днях анонсировал в твиттере.