Как раз на днях вышла статья от Google, где они показывают масштабирование Visual-Language модели на 100 миллиардов картинок и пытаются оценить, становятся ли результаты лучше. Если смотреть только на английские бенчмарки с западными ценностями, то разницы между 10B пар в тренировочной выборке и 100B почти нет. Зато разница существенна на бенчмарках, оценивающих навыки модели по cultural и language diversity. По ним видно, что впереди ещё пахать и пахать, можно получать приросты — и это как раз то, о чём я написал выше; то, чего я жду (и соответственно жду способа проверки, бенчмарк) от моделей следующего поколения. Вот такой же рост (и как следствие метод замера) должен быть для LLM следующего поколения; «да, тут и там мы приросли по 3-7%. А вот мы собрали наши бизнес кейсы, проверили на них и прирост 50%! а на японском вообще 146%!»
Как раз на днях вышла статья от Google, где они показывают масштабирование…
Из этого канала
- #2314Слоган пары следующих постов — «what gets measured gets improved». Сначала…
Слоган пары следующих постов — «what gets measured gets improved». Сначала 12-го февраля Nvidia выпустила блогпост.
- #2316Measuring Automated Kernel Engineering Работа от METR в том же направлении,…
Measuring Automated Kernel Engineering Работа от METR в том же направлении, сделанная одним из сотрудников всего за 4 недели.
- #2317Вот два главных графика, в обоих по вертикали — среднее геометрическое…
Вот два главных графика, в обоих по вертикали — среднее геометрическое достигнутого ускорения относительно бейзлайна (усреднение идёт по всем задачам в…
- #2312Вчера в нашем чате канала обсуждали, что Gemini 2.0 Pro пока по всем…
Вчера в нашем чате канала обсуждали, что Gemini 2.0 Pro пока по всем демонстрируемым параметрам не выглядит как модель следующего поколения — по бенчмаркам она…
- #2311Прошла AIME II, авторы снова замерили модели. Топ на свежих задачах не…
Прошла AIME II, авторы снова замерили модели. Топ на свежих задачах не поменялся — o3-mini, o1, потом R1.