Появился рейтинг GPT-4.5-preview на LMSYS Arena, где люди вслепую выбирают, какая модель из пары лучше отвечает на их вопрос. Без лишних слов: смогли (на вайбе). С учётом контроля стиля (штраф за длину ответа, количества заголовков и списков, итд) модель существенно отрывается от Grok 3 (Early)и Gemini 2.0 Pro Experimental. В общей таблице (вторая картинка) не все категории имеют контроль стиля, поэтому отдельно сделал ещё скриншот Coding и Multi Turn (диалоги с более чем 1 ответом модели). Смотреть остальные срезы — тут.
Появился рейтинг GPT-4.5-preview на LMSYS Arena, где люди вслепую выбирают,…
Из этого канала
- #2396В Anthropic инвестировали ещё 3.5 миллиарда После раунда финансирования от…
В Anthropic инвестировали ещё 3.5 миллиарда После раунда финансирования от группы инвесторов, компания теперь оценивается в 61.5 миллиард долларов.
- #2397Через 3 часа намечается восьмой тестовый пуск системы Starship. Корабль снова…
Через 3 часа намечается восьмой тестовый пуск системы Starship. Корабль снова второй версии, и надеемся, что с ним всё будет в порядке — прошлый-то взорвался,…
- #2398"Недавно помогал ребенку подготовиться к контрольной по программированию…
"Недавно помогал ребенку подготовиться к контрольной по программированию (школьному предмету; они учат C#).
- #2390Первая картинка здесь — к прошлому посту, а вторая будет объяснена ниже.…
Первая картинка здесь — к прошлому посту, а вторая будет объяснена ниже. Директор EpochAI, работы которых я разбирал в канале раз 10, в целом говорит то же…
- #2389Что-то уже воскресенье, а бенчмарков GPT-4.5 не то чтобы много появилось (за…
Что-то уже воскресенье, а бенчмарков GPT-4.5 не то чтобы много появилось (за вчера ни одного нового не увидел), поэтому напишу пост по тому что есть ¯\(ツ)/¯ На…