BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф». Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги. Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности. Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5. Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели…
Из этого канала
- #10089Cloudflare тоже сделали свои версии Jev Они выпустили Clef и Clef-flash, две…
Cloudflare тоже сделали свои версии Jev Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).
- #10087Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный…
Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный индексы можно держать в одной СУБД YDB — распределённая платформа обработки данных…
- #10086Ученый из Гарварда придумал, как искать задачи специально под ИИ Мэтью Шварц,…
Ученый из Гарварда придумал, как искать задачи специально под ИИ Мэтью Шварц, который ранее за две недели написал с Claude полноценную работу по теоретической…
- #10085OpenAI уволили трех рисерчеров из отдела safety: они поделились…
OpenAI уволили трех рисерчеров из отдела safety: они поделились конфиденциальной информацией с внешней организацией, которая занимается безопасностью ИИ Ни…