"Сработаемся? Навеяно обсуждением бенчмарков на недавнем стриме и тестированием Fable. Смотрите, какая штука: кажется, фронтирные модели уже пересекли планку ""достаточно"" для ""средних"" задач во многих проектах по разработке. А раз модели выдают решения, разницы между которыми по качеству не видно, то выбор перестаёт быть вопросом оценки модели в абстрактных попугаях. Вместо этого на первый план выходит характеристика, которую не измерить публичными бенчами: ""__а сработаемся ли?__"". В ней и то, впишется ли модель в ваши процессы, и насколько она инициативна, и даже попадает ли она в удобный для вас стиль общения (нередко - определяющая характеристика, как оказывается!). ● Ну т.е. бенчмарки - резюме модели, сигнал к тому, чтобы в принципе обратить на неё внимание. ● Эвалы - тестовое задание, вы даёте модели какие-то типовые для вашей работы задачи. ● Вайб-чеки - испытательный срок, с моделью нужно провести некоторое время, чтобы понять, сможете ли вы с ней эффективно работать. И именно совместная работа на реальных задачах становится самым информативным этапом выбора. — Кстати, взял бы я на работу Fable? Вайб-чек ещё в процессе, но в рамках подписки - да, это __no brainer__, как говорят в наших деревнях. А какой модели/агента вам достаточно? И достаточно ли :) #короткопост"