Маленький апдейт по загадочной quasar-alpha на Openrouter: — Sam Paech, автор EQ bench и пары других бенчмарков, прогнал её через свои поделия. На бенчмарке креативного письма, где DeepSeek R1, кстати, занимает первое место, её ответы наиболее похожи на модели OpenAI (от 4o до 4.5: одни и те же слова чаще всего встречаются) — Модель лучше всех на Judgemark v2 (оценка того, насколько хорошго LLM автоматически оценивают/выступают в роли судьи), и стабильно выигрывает в онлайн-игре «Дипломатия» — артефакты токенизации (что модель «не видит» или путает некоторые токены), которые присущи моделям OpenAI и не проявляются у других моделей, присутствуют и тут — формат ID вызовов инструментов под капотом схож с тем, что используют OpenAI. Самое близкое, что есть — Qwen, но у них ID содержат 22 знака, а не 24 (как у OpenAI) — на бенчмарке ответов на вопросы по длинным историям (на котором Gemini 2.5 Pro идёт первой с большим отрывом) модель уступает GPT-4.5, но обходит o3-mini и o1 И два фактора, которые я уже упоминал: — 130 токенов в секунду, что примерно как Gemini 2.5 Pro (очень быстро, быстрее GPT-4o и Claude Sonnet), да ещё и контексту миллион токенов. Ну прям как будто точно модель от Google, если бы не часть аргументов выше. — Если модель от Google, то почему она настолько стабильно отвечает, что её сделали OpenAI... почти наверняка это бы вытренировали из неё, даже если это превью эксперимента В общем, мои ставки 80/20 что это OpenAI/Google. Если OpenAI, то это может быть o4-mini, которую Sama на днях анонсировал в твиттере.
Маленький апдейт по загадочной quasar-alpha на Openrouter: — Sam Paech, автор…
Из этого канала
- #2493Ходят слухи (очень непроверенные), что сегодня вечером выйдую первые LLAMA-4, с…
Ходят слухи (очень непроверенные), что сегодня вечером выйдую первые LLAMA-4, с очень длинным контекстом (10M токенов), и что якобы они уже лежат на…
- #2494А лол, они уже на официальном сайте) https://www.llama.com/ Релиз происходит…
А лол, они уже на официальном сайте) https://www.llama.com/ Релиз происходит прямо сейчас, вот один из блогов:…
- #2495Есть модель-бегемот на 2 триллиона параметров (как, по слухам, была GPT-4) вот…
Есть модель-бегемот на 2 триллиона параметров (как, по слухам, была GPT-4) вот метрики, якобы обходит GPT-4.5 и Gemini 2.0 Pro Эта модель использовалась для…
- #2491Я написал Сэму. Он сознался. o3 Pro — быть! Где-то один Денис @denissexy открыл…
Я написал Сэму. Он сознался. o3 Pro — быть! Где-то один Денис @denissexy открыл бутылку шампанского...
- #2490Бомба: объявлены цены на Gemini 2.5 Pro, и они уделывают все модели прошлого…
Бомба: объявлены цены на Gemini 2.5 Pro, и они уделывают все модели прошлого поколения.