"8 месяцев назад вышла Kimi K2 Thinking, и мы слышали то же самое: «Китайская открытая модель заняла топ-1». Через 3 месяца после релиза я собрал аналитику по 16 бенчмаркам, вышедшим после релиза модели, и сравнил с GPT-5 / Sonnet 4.5. Модель была хуже на 13 (!!!) из них, причём на 7 — более чем на 10 процентных пунктов (пп). Повторится ли это с Kimi K3? Свои мысли и предсказания я напишу в конце, а пока пришла пора ретроспективно оценить DeepSeek v4 Pro (Preview) — с его релиза прошло почти 3 месяца. За это время я смог найти 32 новопоявившихся бенчмарка. В релизном блогпосте v4 Pro сравнивали с Opus 4.6 и GPT-5.4, и модель якобы «была лучше» в 4 и 3 бенчмарках из 6 соответственно. Surely результаты на новых будут сопоставимы? Нет. Opus 4.6 и DeepSeek v4 Pro обе были замерены на 10 бенчмарках — на 9 из них китайская модель проигрывает, и на 5 — более чем на 20 (!) относительных процентов. Сравнение с GPT-5.4 выглядит чуть менее жестким: DeepSeek v4 Pro оказался лучше на 3... но всё равно хуже на 13. (Количество бенчмарков разное потому, что не каждый бенчмарк замеряет цифры и для GPT, и для Claude). На 6 бенчмарках разница больше 20 относительных процентов. Но вообще-то стоит вспомнить, что и GPT-5.5, и Opus 4.7 вышли ДО DeepSeek v4 (на самом деле впритык, но всё же). И если добавить эти модели, как будто мы сравниваем со всеми моделями, доступными на момент релиза v4, то ситуация становится просто мрачной. Все 32 бенчмарка проиграны, и средняя разница в абсолютных оценках составляет -18.6 пп. Эта разница вырастает до -23 пп, если брать только те бенчмарки, которые я классифицировал как Agentic Coding (SWE-bench style), где казалось бы падение должно быть не таким существенным. Только подумайте: модель не решает четверть задач, которые решали проприетарные модели, доступные на момент релиза DeepSeek V4 Pro. Повторится ли эта ситуация с Kimi K3? Ведь ей предстоит пережить сравнение с GPT-5.6-Sol и Fable 5. Я уверен, что да — по сумме показателей на десятках бенчмарков мы точно увидим разницу, хотя, возможно, не настолько значительную. В конце концов по тем веб-сайтам, что я вижу в своей твиттер-ленте, модель действительно не хуже Fable на фронтенд-задачах, даже на очень креативных промптах. Вполне возможно, что на широком наборе других задачах на программирование модель тоже конкурентна или хотя бы отстаёт не так сильно. Может быть даже сможет потягаться в подготовке презентаций и экселек. Условно, если снова соберётся 30 бенчмарков, мы можем увидеть, скажем, 8 побед за Kimi, 5 ничьих и 17 поражений. А может быть, она покажет себя даже лучше — поживём увидим. Главное то, что Kimi K3 может быть той моделью, которая покажет, что существуют некоторые поддомены, в которых Китайские модели действительно не отстают систематически. Это не качество по всем направлениям, и ""в среднем"" проприетарные всё равно будут лучше — речь именно про поддомены (например, «вебсайты с 3D-графикой на three.js» или «веб-игры», по которым многие делают слишком далекоидущие выводы). (Не воспринимайте этот текст как «Kimi / DeepSeek говно и никто не должен их использовать». Пожалуйста, прочитайте детали моей позиции в блогпосте по ссылке). Все графики и данные тут: ссылка."
"8 месяцев назад вышла Kimi K2 Thinking, и мы слышали то же самое: «Китайская…
Из этого канала
- #3818"Две новости в утро воскресенья, 2026-й год: 1. Huggingface, платформа для…
"Две новости в утро воскресенья, 2026-й год: 1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке…
- #3819Принёс вам перевод нашумевшего твита Dean W. Ball — в прошлом это американский…
Принёс вам перевод нашумевшего твита Dean W. Ball — в прошлом это американский исследователь политтехнологии, эксперт по регулированию искусственного…
- #38205. Рискну предположить, что администрация Трампа в какой-то момент поймет: их…
5. Рискну предположить, что администрация Трампа в какой-то момент поймет: их лучшей стратегией здесь будет создание огромных регуляторных рисков вокруг…
- #3814А теперь наша любимая рубрика...
А теперь наша любимая рубрика...
- #3808На неделе вышла Kimi K3, это большая модель и большое событие. По замерам…
На неделе вышла Kimi K3, это большая модель и большое событие. По замерам создателей модели в некоторых бенчмарках обходит даже Fable 5 и GPT-5.6, а модели…