Дождались: OpenAI превьюит Ultrafast mode для GPT-5.6 Sol Это тот самый инференс на Cerebras. Ускорение обещают в 14 раз (!), модель сможет генерировать до 750 токенов в секунду. Для такого гиганта как Sol это просто грандиозная скорость. Достигается она за счет того что Wafer-Scale Engine архитектура Cerebras держит веса модели прямо на огромных чипах, и их не приходится гонять между памятью и хранилищем. На видео спидран HLE. На весь бенчмарк ушло чуть больше 11 часов. У Claude Fable тот же прогон занял почти 80. Пока мод будет доступен только избранной группе пользователей в API, но может и до обычных юзеров скоро доберется (но платить придется почку, не меньше). https://openai.com/index/previewing-ultrafast/