Пока все сравнивают модели по SWE-bench и обсуждают, у кого лимит закончился быстрее, я решил посмотреть на вайб-кодинг с другой стороны. Допустим, агент уже написал код, потратил токены, запустил инструменты и объяснил, почему выбрал именно такое решение. А что от всей этой работы останется через месяц? Оказывается, у каждого CLI-харнесса свой ответ: - один пишет аккуратный JSONL, который можно открыть обычным `tail` - другой складывает историю в SQLite - третий сохраняет reasoning открытым текстом - четвертый шифрует его, но хотя бы оставляет summary - пятый записывает токены, но не деньги - шестой вообще не ставит версию формата, поэтому сторонние парсеры узнают об изменениях уже после поломки Так появился Session-Bench: я сравнил форматы сессий десяти CLI-агентов по 19 критериям. https://jazzyalex.github.io/agent-sessions/bench/