если интересно, то можно расшарить пост - Провел небольшой A/B-тест моделей Spark, mini и 5.5-medium на реальной задаче обогащения базы своего теннисного сайта. Зачем: у нас большой объем data scraping и обработки фактов, и хотелось понять, можно ли снизить расход токенов за счет дешевых subagents без потери качества. Как известно, у Spark отдельные лимиты и в теории выглядит очень привлекательно использовать его для простых data scraping задач. Задача была такая: извлечь source-backed данные с официальных страниц академий: контакты, цены, лагеря/программы, затем сохранить raw JSONL для строгой проверки перед добавлением в базу. Итог: Spark не подходит как дефолтный worker для такого workflow. Почему: Хрупкий в длинных тредах Spark один раз упал на скрытом ограничении контекста/инструментов, и его пришлось перезапускать с fork_context=false. Для автономных batch-задач это риск. Слабая дисциплина схемы Все модели немного отклонялись от заданного формата, но Spark чаще уходил от нужной vocabulary для type/status. Его выход нельзя считать готовым к выдаче в базу. Плохо подходит для broad discovery Spark нормален, если есть точный URL и очень маленькая задача: например, “достань email и телефон с этой страницы”. Но он слабее, когда надо ходить по ссылкам, отличать официальный сайт от third-party, разбирать неоднозначные цены или отделять настоящие academy facts от общей информации о клубе/кортах. Экономия токенов может исчезнуть на QA Если main agent потом тратит много времени на исправление слабого extraction, отклонение vague facts и починку malformed JSONL, выгода от дешевой модели быстро уменьшается. Текущий routing после теста: Spark — только для очень маленьких exact-URL, text-only задач или bounded QA. Короткий prompt, fork_context=false. 5.5-mini — дефолтный worker для обычных небольших batch-задач, если official URLs уже известны. 5.5 medium — для сложных случаев: non-English pages, PDFs, несколько связанных официальных страниц, booking/form gates, contact repair, ambiguity. Главный вывод: дешевые subagents должны генерировать только raw candidates. Main agent все равно делает строгую нормализацию, duplicate checks, helper dry-run и только потом promotion. То есть Spark не бесполезен, но как general scraping/research agent он ОЧЕНЬ слабый. Это узкий инструмент для простого extraction, а не надежный enrichment worker.
если интересно, то можно расшарить пост - Провел небольшой A/B-тест моделей…
Из этого канала
- #874В нашем тесте mini выглядит заметно эффективнее 5.5-medium для типовых…
В нашем тесте mini выглядит заметно эффективнее 5.5-medium для типовых extraction-задач, но не как полная замена.
- #875Продолжение после реального A/B-теста 5.5-low vs 5.5-medium. Прогнали обе…
Продолжение после реального A/B-теста 5.5-low vs 5.5-medium. Прогнали обе модели на одинаковом sample из 8 академий, без promotion в базу.
- #876⚪️ Software Factory Тут Factory.ai (авторы droid, довольно крутого агента)…
⚪️ Software Factory Тут Factory.ai (авторы droid, довольно крутого агента) разродился интро-постом о том, что мы переходим от индивидуальных агентов к…
- #871"⚪️ Расценки для Claude -p / Agents SDK Мы все помним как в мае антропики всех…
"⚪️ Расценки для Claude -p / Agents SDK Мы все помним как в мае антропики всех ""обрадовали"" что с 15 июня програмное использование их агента - Claude -p или…
- #870⚪️ Xiaomi MiMo UltraSpeed Тут вторая новость про высокоскоростную генерацию -…
⚪️ Xiaomi MiMo UltraSpeed Тут вторая новость про высокоскоростную генерацию - вот Сяоми предлагает бэту своего высокоскоростного решения.