Память ИИ-агентов стала услугой: что значит Agents API от OpenAI и автокомпакция контекста

Память ИИ-агентов стала услугой: что значит Agents API от OpenAI и автокомпакция контекста

Память ИИ-агентов стала услугой: что значит Agents API от OpenAI и автокомпакция контекста

10 сентября 2026 года OpenAI открыла публичную бету Agents API — управляемого сервиса, который отдаёт сторонним разработчикам ту же обвязку (harness), что крутит Codex и ChatGPT for Work: оркестрацию вызовов модели, инструменты, долгоживущие сессии и управление контекстом. Главная для бизнеса часть — автоматическая компакция: когда сессия агента приближается к лимиту контекстного окна, платформа сама сжимает раннюю историю, чтобы агент мог продолжать работу. До этой недели команду, запускавшую агентов в продакшне, ждала своя логика забывания — самописная, на LangGraph или CrewAI. Теперь OpenAI пишет: «Developers can build workflows that span multiple context windows without implementing their own compaction logic». Рабочая память агента перестала быть кодом вашей команды и стала строчкой в чужом прайсе — платите за токены, инструменты и контейнеры, дополнительной платы за harness нет.

Ниже — механика, дословные цитаты клиентов с цифрами, вопрос с форума OpenAI, на который у платформы нет полного ответа, и перевод всего этого на язык компании, у которой нет своей платформенной команды.

Что именно выпустили: четыре понятия и один вызов API

Agents API устроена вокруг четырёх понятий из официальной документации: агент (модель, инструкции, инструменты, MCP-серверы), окружение (опциональная песочница с файлами и командами), сессия (долговечный экземпляр агента, который живёт через задачи, а не умирает после ответа) и события-элементы (вход и выход). Продакшн-агент собирается одним вызовом API: задача, модель, инструменты, окружение — всё.

Код исполняется в одном из трёх мест: песочница OpenAI (та же инфраструктура, что у Codex), своя инфраструктура через codex exec-server (регистрация по ограниченному ключу, соединения только исходящие, WebSocket) или песочница партнёра. Партнёров девять: Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel. Сам harness — открытый код, логику координации модели, инструментов и контекста можно читать строка за строкой.

Плата — только за токены, инструменты и контейнерное время. С одной стороны, это щедро: слой, который каждая команда строила сама, отдали бесплатно. С другой — бесплатный слой всегда означает, что монетизация сидит на уровне ниже. Токены. Чем больше агентов и чем длиннее сессии, тем больше токенов. Я не утверждаю, что это злой умысел, — я фиксирую экономику: продавец harness и продавец токенов теперь одно лицо.

Компакция: как работает забывание, которое вы не контролируете

Теперь физика главной фичи. У языковой модели есть контекстное окно — грубо говоря, рабочий стол, на который выкладываются инструкция, история разговора, результаты инструментов. Стол конечный. У длинных агентных сессий история растёт часами и в какой-то момент перестаёт помещаться. Что делать? Сжимать раннюю часть: суммаризировать, выбрасывать детали, оставлять «важное».

Формулировка OpenAI: компакция происходит автоматически, когда сессия приближается к лимиту, и «preserving information the agent needs to continue» — сохраняет информацию, нужную агенту, чтобы продолжить. Обратите внимание на пассивный залог. Кто решает, что нужно? Не вы. Критерии важности зашиты в harness, вы их не настраиваете и, судя по документации, даже не читаете список выброшенного.

Сравните с тем, как это работало до 10 сентября. Команда писала свою компакцию — и хотя бы видела, что именно выкидывает: какие шаги, какие результаты инструментов, какие решения агента. Это было больно, и половина команд делала это плохо — AlphaSignal прямо пишет, что это «the parts most teams end up reimplementing badly». Зато потеря была видимой. Теперь она удобная и невидимая.

Рядом — tool search (определения инструментов подгружаются по мере надобности, экономия токенов без ломки кэша модели) и programmatic tool calling (агент гоняет вызовы параллельно, фильтрует и склеивает результаты кодом, в контекст возвращает только выжимку). Это честная инженерия, и она реально снижает расход контекста. Но она же означает: в контекст агента попадает всё меньше сырых данных и всё больше чьей-то предварительной обработки. Каждый такой слой — место, где можно потерять деталь, и ни один не открывает журнал потерь.

Цифры клиентов: во что обходится чужая память

Теперь цифры — они же главная приманка анонса. OpenAI привела восемь клиентов, и не все цифры в пресс-релизе одинаковые. Разложу их по степени доверия.

Первый уровень — цифры с базой сравнения. Jack Weissenberger, CTO Ciridae, в пресс-релизе OpenAI говорит дословно: «With the Agents API, our evaluation score went from 0.71 to 0.85. The subagent support in the API is great and drastically sped up our workflow. Previously it was pretty cumbersome to observe and orchestrate subagents in our old setup but the new APIs gave us a 4x latency reduction». Сухой остаток: 0,71 → 0,85 (это примерно «четыре удачные попытки из пяти» против «семи из десяти») и в четыре раза быстрее на потоках с сабагентами — против старой самописной связки. Это не «стало лучше» — это «стало лучше относительно измеренной раньше величины», и это самый честный тип цифры из возможных.

Второй уровень — цифры без методологии. Bhavyansh Sabharwal, Member of Technical Staff в SafetyKit: «After migrating our case review workflow to the Agents API, we saw a 60% reduction in cost per case, lower latency, and significantly improved token efficiency while maintaining existing performance». Минус 60% стоимости на кейс — звучит громко. Но что было в кейсе раньше, сколько стоил кейс до миграции и как считали — не раскрывается. Я сначала думал, что это маркетинговая отбивка, но потом сообразил: для команды миграция с самописной оркестрации на управляемую и правда снимает целую категорию затрат — вы больше не платите инженерам за поддержку кода, который делает то, что теперь делает платформа. Хотя, честно говоря, меня в этих цифрах раздражает одно: все они от одного дня запуска, ни одна не от месяца продакшна.

Третий уровень — самое интересное для темы памяти. Serhii Shchoholiev, Lead Engineer в Hypha (финансовые сервисы): «Earning customers’ trust is critical in financial services. OpenAI’s Agents API enables us to build more reliable agents, giving customers the confidence to use them in production. By separating the agent harness from the sandbox, we reduced failed agent responses by 86%». Обратите внимание, за счёт чего Hypha получила минус 86% неудачных ответов: разделение harness и песочницы. Не модель. Не промпты. Архитектурное решение о том, где живёт контекст и где живёт исполнение. Это первая статья серии, где источник эффекта — не «умная модель», а устройство памяти и среды.

И максимальный масштаб — Aziz Alghunaim, Co-founder & CTO Nash.ai, про агентов в глобальной логистике: «At Nash, we deploy thousands of long-running AI agents that manage hundreds of millions of deliveries across global logistics networks. OpenAI’s Agents API gives us the durable session and orchestration layer we need for agents operating continuously in production managing context, recovery, and multi-step execution». Тысячи агентов, сотни миллионов доставок, сессии длиной в часы и дни. Вот тут видно, зачем вся эта механика затевалась: не для чат-бота на сайте, а для инфраструктуры, которая работает непрерывно.

Все четыре цитаты — из пресс-релиза OpenAI, все четыре — заявления заинтересованных сторон в день запуска. MarkTechPost прямо предупреждает: «They are vendor-supplied, not independent benchmarks». Независимых замеров пока нет — бета вышла пять дней назад. Я это фиксирую не чтобы обнулить цифры, а чтобы вы держали в голове их статус: это ориентиры, а не гарантии.

«Не проще ли всё-таки написать свою обвязку?»: вопрос, который задаёт каждый второй

Живой вопрос с форума разработчиков OpenAI, от участника под ником nextnet, 13 сентября: когда работа расползается между сабагентами и контекстными окнами, что остаётся как авторитетная запись — идентичность, права, происхождение данных, неудачные действия? Есть ли долговечный аудит-след вне контекста самой модели? Ответ участника merefield: похоже, что да — можно писать в файлы и артефакты и скачивать их позже. Обмен длиной в две реплики — на вопрос, который в любой регулируемой отрасли решает, можно ли вообще пускать агентов в прод.

И вот тут я скажу вещь, за которую меня будут пинать обе стороны. Если ваш продукт — агент, который живёт на вашей инфраструктуре и работает с вашими процессами, своя обвязка с читаемым журналом потерь честнее. Если ваш продукт — сама задача (разобрать инцидент, проверить кейс, свести отчёт), и вам всё равно, как устроен контекст, управляемый harness снимает месяцы работы. Оба факта верны одновременно. Выбор зависит не от того, что «правильнее», а от того, что является вашим активом: процесс или его программирование.

Вопрос nextnet — это вопрос любого комплаенс-отдела, пересаженный на язык форума. В финансовой отчётности есть принцип: запись либо есть в неизменяемом журнале, либо её нет. Компакция по умолчанию означает: журнал, который сжимается по правилам, которые вы не задавали. Для документов, решений и договорённостей компании это не техническая деталь, а вопрос «на чём основан ответ агента». Ответ «на контексте, который частично сжала платформа» — юридически новый жанр.

Что это значит для компании без платформенной команды

Перевод на язык работы, а не на язык API и песочниц. Если вы не Stripe и не Nash.ai, у вас нет команды, которая годами писала оркестрацию агентов. До этой недели это означало отставание: длинные автономные сессии были привилегией тех, кто может построить себе harness. Теперь порог входа упал — но упал он в сторону аренды, а не в сторону понимания.

Тест тот же, что и всегда: где живёт память о вашем документообороте, ваших регламентах, ваших договорённостях с клиентами. Если ответ «в контексте сессии, которой управляет платформа» — вы арендуете рабочую память агента, и правила забывания в ней написаны не вами. Если ответ «в системе, которая разворачивается на вашей инфраструктуре и хранит источники целиком» — память ваша, включая журнал того, что и почему было найдено.

Тут я обязан признаться в заинтересованности: мы делаем recall — советника с системой памяти, который хранит ваши документы, регламенты и решения целиком, на вашей инфраструктуре, и не сжимает ничего по чужим правилам. Мне легко рассуждать о рисках аренды памяти — я продаю альтернативу. Но факт остаётся фактом: то, что OpenAI называет compaction, в терминах документооборота называется «уничтожение документов по регламенту, который вы не читали». В финансах за такое штрафуют. В ИИ это фича.

При этом не буду делать вид, что Agents API — плохо. Для команд, которые строят агентов на задачах с короткой памятью, это лучший подарок года: Ciridae получила свои 0,85 и вчетверо быстрее — не написав ни строки оркестрации. Экономия SafetyKit в 60% на кейс — если подтвердится месяцем продакшна — это реальная money-строка в отчёте. Я лишь о том, что «бесплатный harness» — это тоже цена. Просто платите вы не деньгами, а контролем над тем, что агент помнит.

Как это соотносится с остальным рынком

Один продукт — не рынок. Но Agents API встраивается в картину, которая складывалась весь год. Пять крупных игроков независимо пришли к выводу, что модель без обвязки не продаётся: Accenture и Google Cloud собрали тысячу инженеров внедрения, Microsoft Frontier заложила $2,5 млрд, а цены на инференс продолжали падать — модель становится дешёвым сырьём, а ценность переезжает в слои вокруг неё. Agents API — это следующая ступень той же лестницы: если внедрение ещё продаётся людьми, то память и контекст уже продаются как сервис.

Есть и вторая параллель, менее очевидная. Неделей раньше я разбирал, как агенты OpenAI взломали Hugging Face: тогда выяснилось, что песочница — не граница безопасности, а агент без журнала — незакрытый риск. Agents API усиливает обе стороны: журнал событий стал богаче (события-элементы фиксируются платформой), но и автономии у агентов стало больше (сабагенты, долгие сессии, параллельные вызовы инструментов). Вопрос nextnet про аудит-след — это тот же вопрос, который британский NCSC задавал операторам агентных систем: у вас всегда должна быть возможность выдернуть вилку. Теперь добавлю от себя: и прочитать, что агент делал до того, как вы её выдернули.

Что до концепции «память как услуга» — она шире одного OpenAI. MCP-инструменты, которые Agents API поддерживает из коробки, позволяют подключать внешние системы памяти к сессии агента. То есть архитектурно ничего не мешает комбинировать: управляемый harness от OpenAI — для короткой рабочей памяти сессии, внешняя система памяти — для долговременной, с источниками целиком. Вопрос лишь в том, кто из этих двух слоёв будет главным, когда они разойдутся во мнениях о том, что «важно сохранить».

Итог: память агента теперь кому-то принадлежит — вопрос кому

10 сентября 2026 года рынок получил ответ на вопрос, который каждая команда с агентами решала в одиночку: управлять контекстом длинных сессий можно не писать самим. Ответ хороший. Цифры первых клиентов — от вчетверо быстрее до минус 86% неудачных ответов — выглядят правдоподобно именно потому, что источник эффекта архитектурный, а не «модель стала умнее».

Неизвестное осталось тем же, что и в анонсе: автокомпакция сжимает историю по правилам, которые не публикуются, и списка выброшенного не видно. Для задач, где контекст — расходник, это не имеет значения. Для задач, где контекст — договорённости, решения, регламенты, это единственное, что имеет значение. Насколько велика вторая категория в вашей работе — я не знаю. У меня есть предположение (большинство рабочих задач среднего бизнеса — из второй), и у меня есть продукт, который из этого предположения сделан. Совпадение? Возможно. Проверить мне пока не удалось.

Если задача «агент должен помнить наши процессы и документы, а не сессию» — про вас, посмотрите, как устроен recall: советник с системой памяти, который разворачивается на вашей инфраструктуре и отвечает сотрудникам из ваших источников целиком. А если вы уже устали читать про контекстные окна и компакции — закройте этот текст и вернитесь, когда понадобится. Он никуда не денется.

R

Команда recall

Разрабатываем recall — ИИ-советника с системой памяти для бизнеса. Делимся кейсами, цифрами и наблюдениями из практики.

recall — ИИ-советник с системой памяти для бизнеса. Не забывает контекст между разговорами, помнит решения и договорённости.

Попробовать бесплатно