DS 4.1 Flash и галлюцинации Там новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победитель по Парето-фронт (наиболее оптимальная модель по соотношению цены и качества). Но есть один нюанс, о котором мало кто говорит - это показатель модели в бенчмарке AA-Omniscience. И из топовых моделей довольно слабый результат: -5 в общем забеге (AA-Omniscience Index) и 95% в рейтинге галлюцинаций, и это прям антирекорд. Для сравнения у GLM-5.3-Flash 7 в AA-Omniscience Index и 28% показатель галлюцинаций. Понятно, что AA-Omniscience измеряет родные знания моделей, без внешних tools - тем не менее, если ваш RAG агент все-таки не найдет релевантное, дипсик с большей вероятностью выдумает ответ. Ну и конечно, напомню, что всегда следует проверять новые модельки на ваших evals, измеряющих возможности модели в ваших конкретных задачах - сейчас наличие таких бенчмарков особенно важно, т. к. новые модели выходят практически каждый месяц и потенциально могут уменьшить расходы компании на LLM в разы, не теряя при этом в качестве. Поэтому когда я на консультациях узнаю, что у команда до сих пор нет автоматизированных evals, это удивляет - ведь без них компания теряет как в деньгах, так и в качестве и вообще приходится двигаться практически вслепую. Гибкость, кстати, тоже уменьшается, т. к. с ручными проверками эксперименты становятся слишком трудозатратными, да и попросту необъективными. А возвращаясь к ds flash - предыдущая версия на наших бенчмарках работала очень медленно нестабильно, и от коллег тоже слышал подобные отзывы. Поэтому конкретно дипсики еще более важно тщательно тестировать. А как вам DeepSeek 4.1 Flash? Особенно интересно как она себя показала на ваших бенчмарках. @ai_driven