Токены дешевеют, а счёт за ИИ растёт в пять раз: Gartner назвал это Inference Paradox

Токены дешевеют, а счёт за ИИ растёт в пять раз: Gartner назвал это Inference Paradox

Токены дешевеют, а счёт за ИИ растёт в пять раз: Gartner назвал это Inference Paradox

Расходы на инференс в расчёте на один агентский процесс вырастут более чем в пять раз к 2028 году, хотя цена отдельного токена продолжает падать. Это прогноз Gartner от 17 августа 2026 года: явление назвали Inference Paradox — удешевление единицы интеллекта не экономит деньги компании, а разгоняет общий счёт. Механика такая: ИИ-агент, в отличие от чат-бота, постоянно размышляет, переспрашивает себя и проверяет собственные шаги, поэтому маршрутизация задачи на агентскую модель повышает стоимость инференса минимум в пять раз по сравнению с простым диалогом. Ответ индустрии появился на следующий день: 18 августа Snowflake выпустила dynamic model routing в Cortex AI Gateway — механизм, который отправляет рутину на дешёвые модели, а сложные задачи — на флагманские. Внутренние замеры Snowflake показывают до трёхкратной экономии токенов без потери качества, но проверять эти цифры на своём документообороте придётся самостоятельно.

Парадокс, в котором нет логического противоречия

17 августа Gartner опубликовал пресс-релиз с прогнозом: расходы на инференс в расчёте на один агентский workflow вырастут более чем в пять раз к 2028 году. Термин Inference Paradox аналитики определяют так: улучшающаяся удельная экономика токенов разгоняет совокупные затраты на ИИ, не давая при этом понятного пути к соразмерной и предсказуемой ценности.

Противоречия здесь нет, есть арифметика. Дешевеет единица, а потребление растёт быстрее. Если билет подешевел вдвое, но летать вы стали в десять раз чаще, транспортный бюджет семьи не скажет вам спасибо.

Уилл Симмер, старший директор-аналитик Gartner, формулирует жёстко: «Лидерам продуктов нельзя оправдывать расходы на ИИ более эффективной токен-экономикой. Каждое следующее поколение ИИ-возможностей требует больше токенов, и часто более дорогих. Надёжной и экономичной модели на все случаи жизни на горизонте нет. Конкурентные ИИ-продукты потребуют разработки и поддержки сложных мультимодельных экосистем».

Сразу оговорка, чтобы вы не переписывали бюджеты на основании одной цифры. «В пять раз» — это прогнозная экстраполяция до 2028 года, а не замер. Методика спрятана в клиентском отчёте The Inference Paradox: Inference Tiering Is Critical to Protect Margins, открытого доступа к нему нет. Я этот отчёт не читал и признаю это прямо здесь, в начале текста, а не в последней строчке.

Почему агент ест в пять раз больше чат-бота

Симмер объясняет разницу физикой процесса. Простой чат-бот должен прочитать вопрос, интерпретировать его и быстро выдать статистически правдоподобный ответ — один цикл, одно списание токенов. Агент работает иначе: он должен «постоянно рассуждать, вести переговоры и подвергать сомнению самого себя». Сформулировал план, сходил в инструмент, посмотрел результат, усомнился, перепроверил, исправил, собрал ответ — и каждый круг этого цикла оплачивается токенами, входными и выходными.

Gartner выделяет три тенденции, которые сходятся в одну точку. Первая: базовая экономика моделей быстро улучшается — токен-килограмм дешевеет. Вторая: эта самая эффективность разблокирует запуск более мощных и более дорогих моделей там, где раньше их вписать в бюджет было нельзя. Третья: сложные агентские процессы потребляют несопоставимо больше токенов, чем диалог с чат-ботом. Итог: скорость удешевления единицы интеллекта отстаёт от скорости усложнения того, что компании запускают в продакшн. Темп инноваций обгоняет кривую затрат — так это сформулировано в самом релизе.

Ключевая фраза прогноза, на которую стоит повесить красный флажок: «Дефолт к универсальной автономной интеллектуальности приведёт к неограниченным расходам, на порядки превышающим затраты оптимизированных продуктовых экосистем». Перевод с языка аналитиков: если выгонять на каждую задачу самую умную доступную модель, счёт перестаёт быть предсказуемым вообще.

Ответ Snowflake: роутинг моделей вместо ручного выбора

На следующий день после релиза Gartner, 18 августа, Snowflake анонсировала dynamic model routing второго поколения в составе Cortex AI Gateway — шлюза, который компания представила в июле 2026-го как основу для управления подключениями ИИ-агентов. Идея прямолинейная: не человек решает, какую модель позвать на задачу, а шлюз. Рутинные и повторяющиеся операции уходят на дешёвые модели, задачи, требующие глубокого рассуждения, — на флагманские.

Цитата главы Snowflake Шридхара Рамасвами из пресс-релиза: «Компании становятся куда требовательнее к экономике ИИ. Вопрос уже не в том, сколько ИИ они используют, а в том, превращается ли этот ИИ в значимую ценность». И вторая его фраза, которая мне нравится больше первой: «Snowflake берёт на себя сложность выбора модели, чтобы клиенты сосредоточились на результате, а мы оптимизировали выбор модели под капотом».

Snowflake подтверждает диагноз Gartner, но со своей колокольни: проблема не в том, какую модель выбрать, а в операционных издержках выбора правильной модели для каждой задачи в масштабе. Если у вас сто сотрудников и тысяча вопросов в день, ручной подбор модели на каждый запрос — это не оптимизация, а новый отдел.

Цифры из внутреннего тестирования Snowflake: агенты с динамическим роутингом собрали пайплайн dbt с трёхкратной экономией токенов относительно пути только через флагманскую модель при том же качестве. В отдельном тесте инженерные команды закрыли то же число пул-реквестов с 25-процентной экономией токенов. Звучит солидно. Теперь обязательная ложка дёгтя: это внутренние замеры вендора на собственных сценариях, методика не опубликована, повторить их на своём документообороте можно только самому. Я не знаю, как эти цифры проецируются на компанию из сорока человек с потоком договоров — данных нет. Это честный предел моего знания, и я его фиксирую, а не замалчиваю.

Независимый аналитик Санджив Мохан (консалтинг SanjMo) в том же релизе ставит диагноз точнее: «Компании тонут в выборе моделей, но настоящая проблема не в том, какую выбрать. Она в операционных издержках выбора правильного для каждой задачи — в масштабе». Столько новых моделей выходит, что перестраивать инфраструктуру под каждую новую — сама по себе работа на полный департамент.

Перевод на язык жизни

Если убрать аналитический жаргон, картина такая. Раньше вы платили за каждый ответ ИИ, как за билет в автобусе: вопрос — ответ — списание. Теперь вы нанимаете сотрудника, который думает вслух, сам себя переспрашивает, ходит проверять каждую бумажку и не всегда уверен в результате. Такой работник берётся за задачи посложнее, но и ест он соответственно — не за билет, а за каждый шаг размышления.

Пять раз — это не про то, что ИИ подорожал. Это про то, что задачи, которые вы ему делегируете, стали в пять раз толще. И никто в этой цепочке не отдаёт вам денег обратно за то, что токен стал дешевле.

Что делать, если вы не Snowflake

У большинства читателей этого блога нет Cortex AI Gateway и выделенной команды платформенной разработки. Отсюда практический вопрос: как обычной компании не попасть в число тех, кого Gartner описывает словом «неограниченные расходы».

Первое — не покупайте агентские сценарии там, где хватает чат-бота. Если восемьдесят процентов вопросов сотрудников — это «где лежит договор», «когда у клиента день рождения» и «какой лимит у этого контрагента», агент с рассуждением на каждую такую задачу — это деньги на ветер, в пять раз больше, чем нужно. Простые вопросы должны уходить на дешёвый быстрый путь.

Второе — считайте не токены, а стоимость решённой задачи. Мы уже разбирали, почему индустрия перестала соревноваться в самой умной модели и начала соревноваться в самой дешёвой за задачу: за одну неделю июля Anthropic и Google выпустили модели, чьё главное преимущество — цена завершённой операции, а не бенчмарки. Inference Paradox — продолжение той же истории, только теперь счёт выставляется не за модель, а за процесс целиком.

Третье — не верьте вендорским цифрам экономии на слово. Трёхкратная экономия Snowflake получена на пайплайнах dbt, то есть на инженерных задачах. Ваш документооборот — не dbt. Замерьте базовую линию до внедрения любого роутинга, потом замерьте после, и только потом делайте выводы.

Четвёртое — держите агентские процессы под регламентом. Gartner ещё в июне 2025-го предупреждал о массовых отменах агентских проектов: больше 40 процентов будут свёрнуты к концу 2027 года. Неограниченный счёт за инференс — один из механизмов, которыми эти проекты убиваются.

Стена, о которую всё это упирается

Inference Paradox — не отдельная аномалия, а следующая глава истории, которую этот блог ведёт с весны. Компании массово не окупают ИИ: 57 процентов второй год не видят возврата вложений, а три четверти всей экономической ценности ИИ достаются двадцати процентам компаний. Дешёвые токены сами по себе экономии не дают — мы разбирали это на примере GPT-5.6, упавшего в цене на 80 процентов без экономии для предприятий.

Gartner добавляет к этой картине новый штрих: даже если модель дешевеет, процессы дорожают. Snowflake предлагает лечить это роутингом. Оба правы по-своему, и между их позициями остаётся зазор, в котором живёт обычная компания: ей нужно, чтобы ответы на вопросы сотрудников стоили копейки, а не пять раз по копейке.

Мой ответ на этот зазор — советник с системой памяти. Если контекст компании — регламенты, договоры, принятые решения — уже загружен в память, рутинные вопросы закрываются без агентских циклов рассуждения: система знает, где лежит документ и что в нём написано, и ей не нужно рассуждать, догадываться и перепроверять себя по пять кругов. Дорогая агентская модель нужна только там, где задача действительно сложная. Как устроена система памяти и чем она отличается от обычного чата — разбирали отдельно.

Посмотреть, как recall решает это на практике

Источники

R

Команда recall

Разрабатываем recall — ИИ-советника с системой памяти для бизнеса. Делимся кейсами, цифрами и наблюдениями из практики.

recall — ИИ-советник с системой памяти для бизнеса. Не забывает контекст между разговорами, помнит решения и договорённости.

Попробовать бесплатно