Бенчмарки перестали быть чем-то полезным: - METR уже не имеет смысла, потому что агенты делают автономную работу которая измеряется неделями человеческого времени - ARC-AGI, все три версии полностью решены на 99% - FrontierMath (все четыре редакции), где каждая задача заняла недели времени топовых математиков для составления решен на 98% Мы пришли в ту стадию, где ИИ нужно оценивать только по экономическому эффекту. Я сгенерировал график роста выручки ИИ компаний за последние кварталы. Выручка это некоторый прокси пользы модели в экономике, но важно понимать что стоимость токена, который может решать одну и ту же задачу все еще падает примерно в 10 раз в год. Например, в 2024 году модель o3 первой решила все задачи ARC-AGI и это стоило больше чем $4,500 за одну задачу. В 2026 DeepSeek V4 решает все те же задачи примерно за 2 цента на задачу. То есть, способность, появившаяся в новой модели неизбежно станет коммодити в течении года-двух и станет доступна многим. При этом, конечно, использование вырастет. Astra является прекрасной моделью для 3D и CAD дизайна, редактирования видео и анимации, но пока еще дорогая для того чтобы запускать миллионы агентов для не-крупных компаний. Это изменится. Вчера на интервью у Дваркеша Джон Шульман (кофаундер OpenAI) сказал что примерно 3-4 года осталось до того момента, когда модели будут лучше людей во всех когнитивных или интеллектуальных задачах. Пока что, нет никаких причин сомневаться в этих прогнозах учитывая насколько часто они были правдивы. Вопрос в другом: как адаптировать экономику и собственную стратегию до этого момента, чтобы не остаться за бортом? Да, очевидно, для большинства людей это будет шоком, неожиданностью и громом среди ясного неба, но вам не обязательно быть этими людьми. Да, очевидно, это приведет к экономическим и социальным шокам, которые потребуют радикальных мер сравнимых или больших чем во время ковида. Но здоровая реакция тут не всепропало, а попытаться адаптироваться и адаптировать других к изменениям.