В карточке тоже есть интересные метрики, но хотел выделить вот это: «Мы оцениваем фактологическую точность на обезличенных диалогах из ChatGPT, которые пользователи наших предыдущих моделей отметили как содержащие фактические ошибки. Эти примеры специально отобраны для выявления случаев, наиболее подверженных галлюцинациям, поэтому ожидается, что их абсолютная частота ошибок будет намного выше реального уровня ошибок в продакшене. Эту метрику не следует интерпретировать как частоту галлюцинаций, наблюдаемую при реальной эксплуатации. Мы используем две метрики: (1) допускает ли модель вообще какую-либо ошибку (частота галлюцинаций на уровне ответа) и (2) воспроизводит ли модель ту самую конкретную ошибку, на которую указал пользователь. Мы обнаружили, что Astra допускает существенно меньше фактических ошибок, чем GPT-5.6 Sol, и с гораздо меньшей вероятностью воспроизводит галлюцинации, о которых сообщали пользователи. Эти улучшения особенно ярко выражены при очень низких настройках длины рассуждений»
В карточке тоже есть интересные метрики, но хотел выделить вот это: «Мы…
Из этого канала
- #3910Наконец-то OpenAI догнали GLM-5.3 🙃
Наконец-то OpenAI догнали GLM-5.3 🙃
- #3911Вышла новая GPT 6 (в течение недели дадут всем) – я ее активно потестировал…
Вышла новая GPT 6 (в течение недели дадут всем) – я ее активно потестировал (спасибо JetBrains), и я честно впечатлен – я все громкие модели видел, все эти…
- #3908У кого не открывается страница — вот зеркало: https://gpt-astra.netlify.app/
У кого не открывается страница — вот зеркало: https://gpt-astra.netlify.app/
- #3907Для тех кто не хочет листать 10 таблиц и графиков — саммари качества в одной…
Для тех кто не хочет листать 10 таблиц и графиков — саммари качества в одной картинке.
- #3899Чтож, GPT-6 действительно вышла до GTA VI — на большинстве бенчмарков, в том…
Чтож, GPT-6 действительно вышла до GTA VI — на большинстве бенчмарков, в том числе и очень свежих (TBv4, TB Science v0.1, SRE-Bench) модель Astra — новый…