Есть модель-бегемот на 2 триллиона параметров (как, по слухам, была GPT-4) вот метрики, якобы обходит GPT-4.5 и Gemini 2.0 Pro Эта модель использовалась для дистилляции в маленькие модели — причем прямо во время предтренировки.
Есть модель-бегемот на 2 триллиона параметров (как, по слухам, была GPT-4) вот…
Из этого канала
- #2496Итак, пост-выжимка анонса: — Основной упор на том, что модели гораздо лучше в…
Итак, пост-выжимка анонса: — Основной упор на том, что модели гораздо лучше в мультимодальности (понимании изображений, даже нескольких за раз), и что это —…
- #2497С контролем стиля без откровений в общем зачёте, а в остальных вроде и высоко,…
С контролем стиля без откровений в общем зачёте, а в остальных вроде и высоко, но разброс пока большой (так как голосов мало).
- #2502И напоследок удобная картинка-шпаргалка с метриками по всем трём моделям. Тут…
И напоследок удобная картинка-шпаргалка с метриками по всем трём моделям. Тут же по конкурентам можно прикинуть, с кем примерно модели нацелены соревноваться и…
- #2494А лол, они уже на официальном сайте) https://www.llama.com/ Релиз происходит…
А лол, они уже на официальном сайте) https://www.llama.com/ Релиз происходит прямо сейчас, вот один из блогов:…
- #2493Ходят слухи (очень непроверенные), что сегодня вечером выйдую первые LLAMA-4, с…
Ходят слухи (очень непроверенные), что сегодня вечером выйдую первые LLAMA-4, с очень длинным контекстом (10M токенов), и что якобы они уже лежат на…