А дальше — конкретно про o1: — OpenAI генерирует огромные объемы данных для обучения o1. Всего есть порядка 10 миллионов исходных задач (и ответов для них). Для каждой генерируется больше количество первых шагов, потом вторых, потом третьих итд. После каждого шага отдельная модель (PRM, Process Reward Model), обученная оценивать прогресс и искать ошибки (см. Let's verify step by step) отсекает самые слабые ветки решений, для них генерируется следующий шаг и так далее. Для каждой задачи генерируется несколько тысяч разных «траекторий» решений (некоторые из которых могут иметь схожее начало, так как отпочковались от одной исходной ветки решений) — Каждая из этих траекторий содержит тысячи или даже десятки тысяч токенов (например, финальные решения задач ARC имеют длину 24000-55000 токенов в среднем). Несложным подсчётом получаем 10M (задач) x 1000 (решений) x 1000 (токенов в решении) = 10 триллионов токенов как нижняя планка (Dylan пишет «сотни триллионов») того, что генерируется в процессе обучения. Не на всех этих токенах происходит тренировка, большая часть выбрасывается, остаются только самые качественные решения, которые а) приводят к правильному ответу б) имеют самые высокие оценки PRM. — Такое обучение с генерацией большого количества решений меняет требуемый инфраструктурный профиль, так как помимо видеокарт теперь нужны процессоры, чтобы запускать верификацию отдельных шагов (например там, где можно посчитать результат математического выражения). Тут Dylan подмечает, что прошлые системы Nvidia имели 8 карт и 2 процессора, а будущие GB200 NVL72 уже 72 карты и 36 процессоров (не ядер), то есть пропорция изменилась от 4:1 к 2:1. От себя добавлю, что Nvidia очень плотно работает с крупными клиентами и обсуждает требования к железу, и что эти изменения могут быть вызваны как запросами, схожими к OpenAI'шным, так и чем-то другим. — Хорошая новость в том, что поскольку генерация решений разных задач независима, процесс хорошо масштабируется географически: одна часть может быть в Техасе, другая в Айове, третья в Вашингтоне, и при этом общая эффективность обучения не падает; обычно это является проблемой для этапа предтренировки моделей, в идеале иметь всё и в одном месте. — Сейчас в тренировке находится модель между 4o и Orion, если оценивать по количеству мощностей, вбаханных в предтренировку. Когда этот этап закончится, из этой модели будут делать две: первая это обычный чатбот, и вторая это Reasoning-модель (прим.: вероятно, не o3— статья вышла 11-го декабря, и скорее всего o3 не успели бы закончить). Утверждается, что в дообучение второй модели вложат больше мощностей, чем в предтренировку — потому что для неё синтетику будет генерировать более крупный Orion, он же будет перепроверять и оценивать решения. — И вот тут снова возвращаемся к тому, что нет никакой сноски об источнике и/или верификации того, что написано в новости. В оценку «1-3 десятка триллионов токенов» я верю, она кажется +- разумной, но «сотни» (с учётом более крупной Orion) пока звучит фантастически, это ооооочень много. Мне субъективно не кажется, что это так, и что сюда в лучшем случае идёт около 10%, то есть на порядок меньше. В большей степени моё мнение тут не имеет аргументов, кроме «ну не могли же они столько влить», что тоже не очень крепкая позиция, а также то, что очень быстро появилась o3. С другой стороны генерировать данные можно в фоне на большом количестве датацентров, которые уже построены и стоят... в общем, хз. — Orion тренировали больше 3 месяцев, что необычно для индустрии (так как важна скорость итераций, и за 3 месяца исследователи+инженеры обычно что-то да улучшат, и можно всё запускать заново): чаще укладываются в 2. Для обучения «мелких» моделей по-прежнему необходимы такие гигантские модели, как Orion, однако до массового появления GPU Blackwell 200й серии обслуживание Orion-like моделей нерентабельно, учитывая их размер (почему? см. этот пост). 😔 прозвучало как «никакого Orion в первой половине года» 😭
А дальше — конкретно про o1: — OpenAI генерирует огромные объемы данных для…
Из этого канала
- #2193Наконец, o1 Pro: — Dylan утверждает, что под капотом та же модель o1, просто в…
Наконец, o1 Pro: — Dylan утверждает, что под капотом та же модель o1, просто в параллель к ней запускается 5 запросов, а затем выбирается лучший ответ…
- #2194Проснулись-потянулись, а тут новое эссе Sama 🚶 «Reflections», посвященное…
Проснулись-потянулись, а тут новое эссе Sama 🚶 «Reflections», посвященное рефлексии прошедших лет.
- #2196Наткнулся на новый ресеч: АИ-фишинговые письма, написанные с помощью АИ – очень…
Наткнулся на новый ресеч: АИ-фишинговые письма, написанные с помощью АИ – очень эффективны: более 50% получателей переходят по вредоносным ссылкам…
- #2191Потихоньку начинаю писать посты по SemiAnalysis, на которых ~~мы~~ мне купили…
Потихоньку начинаю писать посты по SemiAnalysis, на которых ~~мы~~ мне купили подписку.
- #2190Новый трейлер к следующему полёту Starship. А теперь самое главное по миссии…
Новый трейлер к следующему полёту Starship. А теперь самое главное по миссии Flight 7: - Тест вывода полезной нагрузки с 10 макетами Starlink V3; -…