Есть модель-бегемот на 2 триллиона параметров (как, по слухам, была GPT-4) вот метрики, якобы обходит GPT-4.5 и Gemini 2.0 Pro Эта модель использовалась для дистилляции в маленькие модели — причем прямо во время предтренировки.