Токенфляция: проблема продвинутых ИИ моделей Пользователь из Threads (принадлежат запрещенной в РФ Meta) написал GPT-5.4 Pro «Привет, я Дарио Амадей», и она так переволновалась, что думала над ответом 5 минут. Каждая новая ИИ-модель умнее предыдущих, и это подтверждают результаты бенчмарков. Каждый анонс очередных GPT или Opus сопровождают табличками и графиками, где показывают, насколько лучше они справляются со все более сложными задачами. Но у этого прогресса есть и отрицательная сторона: более простые, тривиальные задачи теперь у поумневшего ИИ требуют намного больше ресурсов. У этого явления даже появилось отдельное название — токенфляция. Суть в том, что для выполнения одной и той же задачи и достижения одинаковых результатов более продвинутой модели понадобится больше токенов, чем ее предшественнице попроще. 🔜 Например, вот тут автор протестировал, как разные ИИ реагируют на простые запросы: «Hi», «commit» и «WTF». 5 минут никто не размышлял, но Claude на простой «привет» сделал 33 вызова инструментов. Проблема не только в деньгах и растранжиривании токенов, но и в том, что это просто нерациональная трата времени пользователя, который ждет, когда модель наконец-то что-то ему ответит. Для тех, кто строит ИИ-продукты и агентные системы, это хороший повод задуматься не только о качестве ответов, но и об эффективности. Иногда лучший агент — не тот, который исследовал весь репозиторий, а тот, который понял, что на «Привет» достаточно просто ответить: «Привет!» А вы сталкивались с токенфляцией? 👀