Токены дешевеют, а счёт за ИИ растёт в пять раз: Gartner назвал это Inference Paradox

Токены дешевеют, а счёт за ИИ растёт в пять раз: Gartner назвал это Inference Paradox
Расходы на инференс в расчёте на один агентский процесс вырастут более чем в пять раз к 2028 году, хотя цена отдельного токена продолжает падать. Это прогноз Gartner от 17 августа 2026 года: явление назвали Inference Paradox — удешевление единицы интеллекта не экономит деньги компании, а разгоняет общий счёт. Механика такая: ИИ-агент, в отличие от чат-бота, постоянно размышляет, переспрашивает себя и проверяет собственные шаги, поэтому маршрутизация задачи на агентскую модель повышает стоимость инференса минимум в пять раз по сравнению с простым диалогом. Ответ индустрии появился на следующий день: 18 августа Snowflake выпустила dynamic model routing в Cortex AI Gateway — механизм, который отправляет рутину на дешёвые модели, а сложные задачи — на флагманские. Внутренние замеры Snowflake показывают до трёхкратной экономии токенов без потери качества, но проверять эти цифры на своём документообороте придётся самостоятельно.
Парадокс, в котором нет логического противоречия
17 августа Gartner опубликовал пресс-релиз с прогнозом: расходы на инференс в расчёте на один агентский workflow вырастут более чем в пять раз к 2028 году. Термин Inference Paradox аналитики определяют так: улучшающаяся удельная экономика токенов разгоняет совокупные затраты на ИИ, не давая при этом понятного пути к соразмерной и предсказуемой ценности.
Противоречия здесь нет, есть арифметика. Дешевеет единица, а потребление растёт быстрее. Если билет подешевел вдвое, но летать вы стали в десять раз чаще, транспортный бюджет семьи не скажет вам спасибо.
Уилл Симмер, старший директор-аналитик Gartner, формулирует жёстко: «Лидерам продуктов нельзя оправдывать расходы на ИИ более эффективной токен-экономикой. Каждое следующее поколение ИИ-возможностей требует больше токенов, и часто более дорогих. Надёжной и экономичной модели на все случаи жизни на горизонте нет. Конкурентные ИИ-продукты потребуют разработки и поддержки сложных мультимодельных экосистем».
Сразу оговорка, чтобы вы не переписывали бюджеты на основании одной цифры. «В пять раз» — это прогнозная экстраполяция до 2028 года, а не замер. Методика спрятана в клиентском отчёте The Inference Paradox: Inference Tiering Is Critical to Protect Margins, открытого доступа к нему нет. Я этот отчёт не читал и признаю это прямо здесь, в начале текста, а не в последней строчке.
Почему агент ест в пять раз больше чат-бота
Симмер объясняет разницу физикой процесса. Простой чат-бот должен прочитать вопрос, интерпретировать его и быстро выдать статистически правдоподобный ответ — один цикл, одно списание токенов. Агент работает иначе: он должен «постоянно рассуждать, вести переговоры и подвергать сомнению самого себя». Сформулировал план, сходил в инструмент, посмотрел результат, усомнился, перепроверил, исправил, собрал ответ — и каждый круг этого цикла оплачивается токенами, входными и выходными.
Gartner выделяет три тенденции, которые сходятся в одну точку. Первая: базовая экономика моделей быстро улучшается — токен-килограмм дешевеет. Вторая: эта самая эффективность разблокирует запуск более мощных и более дорогих моделей там, где раньше их вписать в бюджет было нельзя. Третья: сложные агентские процессы потребляют несопоставимо больше токенов, чем диалог с чат-ботом. Итог: скорость удешевления единицы интеллекта отстаёт от скорости усложнения того, что компании запускают в продакшн. Темп инноваций обгоняет кривую затрат — так это сформулировано в самом релизе.
Ключевая фраза прогноза, на которую стоит повесить красный флажок: «Дефолт к универсальной автономной интеллектуальности приведёт к неограниченным расходам, на порядки превышающим затраты оптимизированных продуктовых экосистем». Перевод с языка аналитиков: если выгонять на каждую задачу самую умную доступную модель, счёт перестаёт быть предсказуемым вообще.
Ответ Snowflake: роутинг моделей вместо ручного выбора
На следующий день после релиза Gartner, 18 августа, Snowflake анонсировала dynamic model routing второго поколения в составе Cortex AI Gateway — шлюза, который компания представила в июле 2026-го как основу для управления подключениями ИИ-агентов. Идея прямолинейная: не человек решает, какую модель позвать на задачу, а шлюз. Рутинные и повторяющиеся операции уходят на дешёвые модели, задачи, требующие глубокого рассуждения, — на флагманские.
Цитата главы Snowflake Шридхара Рамасвами из пресс-релиза: «Компании становятся куда требовательнее к экономике ИИ. Вопрос уже не в том, сколько ИИ они используют, а в том, превращается ли этот ИИ в значимую ценность». И вторая его фраза, которая мне нравится больше первой: «Snowflake берёт на себя сложность выбора модели, чтобы клиенты сосредоточились на результате, а мы оптимизировали выбор модели под капотом».
Snowflake подтверждает диагноз Gartner, но со своей колокольни: проблема не в том, какую модель выбрать, а в операционных издержках выбора правильной модели для каждой задачи в масштабе. Если у вас сто сотрудников и тысяча вопросов в день, ручной подбор модели на каждый запрос — это не оптимизация, а новый отдел.
Цифры из внутреннего тестирования Snowflake: агенты с динамическим роутингом собрали пайплайн dbt с трёхкратной экономией токенов относительно пути только через флагманскую модель при том же качестве. В отдельном тесте инженерные команды закрыли то же число пул-реквестов с 25-процентной экономией токенов. Звучит солидно. Теперь обязательная ложка дёгтя: это внутренние замеры вендора на собственных сценариях, методика не опубликована, повторить их на своём документообороте можно только самому. Я не знаю, как эти цифры проецируются на компанию из сорока человек с потоком договоров — данных нет. Это честный предел моего знания, и я его фиксирую, а не замалчиваю.
Независимый аналитик Санджив Мохан (консалтинг SanjMo) в том же релизе ставит диагноз точнее: «Компании тонут в выборе моделей, но настоящая проблема не в том, какую выбрать. Она в операционных издержках выбора правильного для каждой задачи — в масштабе». Столько новых моделей выходит, что перестраивать инфраструктуру под каждую новую — сама по себе работа на полный департамент.
Перевод на язык жизни
Если убрать аналитический жаргон, картина такая. Раньше вы платили за каждый ответ ИИ, как за билет в автобусе: вопрос — ответ — списание. Теперь вы нанимаете сотрудника, который думает вслух, сам себя переспрашивает, ходит проверять каждую бумажку и не всегда уверен в результате. Такой работник берётся за задачи посложнее, но и ест он соответственно — не за билет, а за каждый шаг размышления.
Пять раз — это не про то, что ИИ подорожал. Это про то, что задачи, которые вы ему делегируете, стали в пять раз толще. И никто в этой цепочке не отдаёт вам денег обратно за то, что токен стал дешевле.
Что делать, если вы не Snowflake
У большинства читателей этого блога нет Cortex AI Gateway и выделенной команды платформенной разработки. Отсюда практический вопрос: как обычной компании не попасть в число тех, кого Gartner описывает словом «неограниченные расходы».
Первое — не покупайте агентские сценарии там, где хватает чат-бота. Если восемьдесят процентов вопросов сотрудников — это «где лежит договор», «когда у клиента день рождения» и «какой лимит у этого контрагента», агент с рассуждением на каждую такую задачу — это деньги на ветер, в пять раз больше, чем нужно. Простые вопросы должны уходить на дешёвый быстрый путь.
Второе — считайте не токены, а стоимость решённой задачи. Мы уже разбирали, почему индустрия перестала соревноваться в самой умной модели и начала соревноваться в самой дешёвой за задачу: за одну неделю июля Anthropic и Google выпустили модели, чьё главное преимущество — цена завершённой операции, а не бенчмарки. Inference Paradox — продолжение той же истории, только теперь счёт выставляется не за модель, а за процесс целиком.
Третье — не верьте вендорским цифрам экономии на слово. Трёхкратная экономия Snowflake получена на пайплайнах dbt, то есть на инженерных задачах. Ваш документооборот — не dbt. Замерьте базовую линию до внедрения любого роутинга, потом замерьте после, и только потом делайте выводы.
Четвёртое — держите агентские процессы под регламентом. Gartner ещё в июне 2025-го предупреждал о массовых отменах агентских проектов: больше 40 процентов будут свёрнуты к концу 2027 года. Неограниченный счёт за инференс — один из механизмов, которыми эти проекты убиваются.
Стена, о которую всё это упирается
Inference Paradox — не отдельная аномалия, а следующая глава истории, которую этот блог ведёт с весны. Компании массово не окупают ИИ: 57 процентов второй год не видят возврата вложений, а три четверти всей экономической ценности ИИ достаются двадцати процентам компаний. Дешёвые токены сами по себе экономии не дают — мы разбирали это на примере GPT-5.6, упавшего в цене на 80 процентов без экономии для предприятий.
Gartner добавляет к этой картине новый штрих: даже если модель дешевеет, процессы дорожают. Snowflake предлагает лечить это роутингом. Оба правы по-своему, и между их позициями остаётся зазор, в котором живёт обычная компания: ей нужно, чтобы ответы на вопросы сотрудников стоили копейки, а не пять раз по копейке.
Мой ответ на этот зазор — советник с системой памяти. Если контекст компании — регламенты, договоры, принятые решения — уже загружен в память, рутинные вопросы закрываются без агентских циклов рассуждения: система знает, где лежит документ и что в нём написано, и ей не нужно рассуждать, догадываться и перепроверять себя по пять кругов. Дорогая агентская модель нужна только там, где задача действительно сложная. Как устроена система памяти и чем она отличается от обычного чата — разбирали отдельно.
Посмотреть, как recall решает это на практике
Источники
- Gartner, пресс-релиз от 17 августа 2026: AI inference costs per agentic workflow will increase more than fivefold through 2028 (Inference Paradox), аналитик Will Sommer.
- Snowflake, пресс-релиз от 18 августа 2026: dynamic model routing 2 в Cortex AI Gateway, цитаты CEO Sridhar Ramaswamy, замеры 3x и 25% token efficiency.
- Gartner, пресс-релиз от 25 июня 2025: свыше 40% агентских ИИ-проектов будут отменены к концу 2027.
recall — ИИ-советник с системой памяти для бизнеса. Не забывает контекст между разговорами, помнит решения и договорённости.
Попробовать бесплатно