"Сработаемся? Навеяно обсуждением бенчмарков на недавнем стриме и тестированием Fable. Смотрите, какая штука: кажется, фронтирные модели уже пересекли планку ""достаточно"" для ""средних"" задач во многих проектах по разработке. А раз модели выдают решения, разницы между которыми по качеству не видно, то выбор перестаёт быть вопросом оценки модели в абстрактных попугаях. Вместо этого на первый план выходит характеристика, которую не измерить публичными бенчами: ""__а сработаемся ли?__"". В ней и то, впишется ли модель в ваши процессы, и насколько она инициативна, и даже попадает ли она в удобный для вас стиль общения (нередко - определяющая характеристика, как оказывается!). ● Ну т.е. бенчмарки - резюме модели, сигнал к тому, чтобы в принципе обратить на неё внимание. ● Эвалы - тестовое задание, вы даёте модели какие-то типовые для вашей работы задачи. ● Вайб-чеки - испытательный срок, с моделью нужно провести некоторое время, чтобы понять, сможете ли вы с ней эффективно работать. И именно совместная работа на реальных задачах становится самым информативным этапом выбора. — Кстати, взял бы я на работу Fable? Вайб-чек ещё в процессе, но в рамках подписки - да, это __no brainer__, как говорят в наших деревнях. А какой модели/агента вам достаточно? И достаточно ли :) #короткопост"
"Сработаемся? Навеяно обсуждением бенчмарков на недавнем стриме и тестированием…
Из этого канала
- #314"AgenticOps, часть №4 - агенты и сценарии Тут расскажу про основных агентов,…
"AgenticOps, часть №4 - агенты и сценарии Тут расскажу про основных агентов, которые пользуются платформой - у них разные роли и доступные сценарии.
- #317"AI-вангование, итоги 8 месяцев назад довелось мне поучаствовать в круглом…
"AI-вангование, итоги 8 месяцев назад довелось мне поучаствовать в круглом столе на FrontEnd Conf 2025, где мы обсуждали тему внедрения AI в SDLC.
- #318В программировании всегда были такие задачи, за которые часто брались новички.…
В программировании всегда были такие задачи, за которые часто брались новички. Некоторые из них оказывались крайне ценными для становления специалиста, а…
- #311"AgenticOps, часть №3 - платформа Общие принципы ● агенты общаются с платформой…
"AgenticOps, часть №3 - платформа Общие принципы ● агенты общаются с платформой через CLI + SKILL.md ● CLI-команды - плоские и максимально простые ● топология…
- #310Бенчмарки! Новый митап про DeepSWE, SWE-rebench v2 и др Друзья, вы все еще…
Бенчмарки! Новый митап про DeepSWE, SWE-rebench v2 и др Друзья, вы все еще верите бенчмаркам? Я вот все меньше.