Вчера в нашем чате канала обсуждали, что Gemini 2.0 Pro пока по всем демонстрируемым параметрам не выглядит как модель следующего поколения — по бенчмаркам она очевидно отстаёт от рассуждающих моделей (но это ок), но совсем едва-едва выигрывает у базовых моделей текущего поколения, если брать какой-то базовый набор замеров. При этом я не считаю, что из этого следуют выводы «масштабирование предтренировки моделей упёрлось в стену» и «модели Google еле улучшились по отношению к тому, что уже было на рынке». Для меня не ясно, почему в табличке метрик, опубликованной в блоге с анонсом Gemini 2.0 Pro, выбраны эти, а не другие бенчмарки. Я писал ранее в канале, что мои ожидания от дальнейшего роста моделей — в количестве нюансов и деталей, которые они надёжно запомнили (и не галлюцинируют), и в применимости в длинном хвосте распределения задач: сюда входят и разные языки, и непопулярные работы, о которых в интернете не так много написано, и прочее. И моё ожидание, что модели следующего поколения как раз должны продавать (в значении «демонстрировать превосходство») именно в этом. Я вполне OK с тем, что компании сделают свои новые бенчмарки для оценки прогресса там. OpenAI вон за полгода 4 новых выкатили! Никак к чему-то готовятся 🤔 А Google в декабре показали FACTS Grounding для оценки способности LLM генерировать ответы, которые не только фактически точны по отношению к предоставленному в промпте контексту, но и достаточно подробны, чтобы давать удовлетворительные ответы на запросы пользователей. И этот бенчмарк есть в вышеупомянутом блоге. И там есть прирост (не очень большой). И... всё. (и ещё на бенчмарке OpenAI показали рост). Вспомните как было с GPT-4: там показали и замеры на большом наборе экзаменов (НЕ стандартный замер, который долго обсуждали), на большом наборе языков (чтобы показать, что модель стала более доступной людям, для которых английский не родной язык), и затем феноменальные на тот момент мультимодальные навыки, показав новый рекорд с отрывом на 4 из 8 бенчмарков. Может быть к глобальному запуску Pro подвезут ещё что нибудь, но пока я бы сказал, что Google зафейлил часть демонстрации того, почему next gen — это next gen. Да, у них есть агенты, но они в разработке, их и пощупать нельзя, и сами Google про них ничего не пишут (зайдите в блог и сделайте поиск по странице). Если смотреть на картинку из блогпоста, то модель можно было бы спокойно назвать Gemini Pro 1.5-003 (уже были 001 и 002). Если OpenAI покажут Orion aka 4.5 также — я тоже скажу, что они или failed to deliver on model, или failed to deliver the message. UPD: даже больше скажу, я от трёх человек, включая @bogdanisssimo, услышал, что новые Gemini по-русски очень живо общаются, «видно, что больше начитанность, больше данных видели», но... почему Google-то нам это не показывает? В компании на 200 тысяч сотрудников не хватило пиарщиков или рисователей табличек? 😀
Вчера в нашем чате канала обсуждали, что Gemini 2.0 Pro пока по всем…
Из этого канала
- #2313Как раз на днях вышла статья от Google, где они показывают масштабирование…
Как раз на днях вышла статья от Google, где они показывают масштабирование Visual-Language модели на 100 миллиардов картинок и пытаются оценить, становятся ли…
- #2314Слоган пары следующих постов — «what gets measured gets improved». Сначала…
Слоган пары следующих постов — «what gets measured gets improved». Сначала 12-го февраля Nvidia выпустила блогпост.
- #2316Measuring Automated Kernel Engineering Работа от METR в том же направлении,…
Measuring Automated Kernel Engineering Работа от METR в том же направлении, сделанная одним из сотрудников всего за 4 недели.
- #2311Прошла AIME II, авторы снова замерили модели. Топ на свежих задачах не…
Прошла AIME II, авторы снова замерили модели. Топ на свежих задачах не поменялся — o3-mini, o1, потом R1.
- #2310TheInformation пишет — но это и не секрет — что Anthropic близки к выпуску…
TheInformation пишет — но это и не секрет — что Anthropic близки к выпуску своей размышляющей модели.