LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону. Jev не может генерировать тексты, но может на лету выбирать из предложенных вариантов. Поэтому модель можно использовать в задачах вроде классификации входящей почты, проверки запросов на красные флаги. Главное - не делать задачу слишком сложной. А вот насколько сложные задачи сложны для Jev? Мне стало интересно, и я адаптировал агентский бенчмарк BitGN, выбрав оттуда те задачи, которые можно свести к задачам классификации. Это разовый бенчмарк, который создан исключительно для Jev, чтобы можно было примерно прикидывать его когнитивные способности - насколько сложные задачи можно давать на вход. Понятно, что Jev не сравниться с нормальными LLM по гибкости и мощности (там даже Loop/Cascade из SGR толком не сделаешь), но вот в качестве узкоспециализированного инструмента под ряд задач - это стоящий вариант. И получается очень приятная картина - Jev на 14 месте, причем работает очень быстро и стоит сущие копейки. В данном бенчмарке задачи за пределами возможностей Jev. А если давать ему задачи “по плечу”, то картина получается еще красивее. Айгиз написал статью для TimeToAct как раз про такие задачи. Будем ждать новых гибридных моделей, которые могут работать по SGR подходам. Причем делать это без двойной работы через JSON Schema + inference + constrained decoding (то есть работать быстрее и дешевле). Ваш, @llm_under_hood 🤗
LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в…
Из этого канала
- #945"Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого…
"Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky, как на YouTube выложили видео с моим выступлением с этой…
- #946GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6…
GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах.
- #943Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш,…
Давно я не публиковал эссе. Вот новое. We never wanted human code. Ваш, @llmunderhood 🤗
- #942Вчера я решил попрактиковать нативную разработку агентами. Для этого попросил…
Вчера я решил попрактиковать нативную разработку агентами. Для этого попросил Codex переписать свой task manager для Codex-a (из этого поста) из web приложения…
- #941Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши…
Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые ниши Человеку без опыта работы с железом захотелось разработать свою печатную плату…