Рост затрат на потребление может замедлить внедрение генеративного и агентного ИИ в корпоративном секторе: компании с трудом соотносят растущее использование токенов с измеримой отдачей.
«Токен-шок» — это бюджетное давление, возникающее, когда потребление ИИ растёт быстрее, чем снижается цена за токен. Поставщики программ всё активнее отказываются от фиксированных безлимитных подписок в пользу тарификации по факту использования, чтобы покрыть затраты на инференс и защитить маржу.
Агентный ИИ усугубляет ситуацию. Многоэтапная задача может потребовать многократных обращений к модели, более широких контекстных окон и большего числа токенов для рассуждений, чем простой запрос. В одном проекте, изученном компанией EY, переход от прямых запросов к большим языковым моделям к агентным рабочим процессам увеличил стоимость одного взаимодействия примерно в 30 раз.
Корпоративные пользователи уже реагируют введением ограничений на расходы. По имеющимся данным, Uber Technologies (Нью-Йорк:UBER) исчерпала свой бюджет на ИИ-программирование на 2026 год за четыре месяца и установила лимит в $1 500 на одного сотрудника для каждого агентного инструмента разработки.
Кроме того, крупный французский страховщик сократил использование Claude от Anthropic спустя два месяца после запуска, когда затраты превысили ожидания. Walmart (Нью-Йорк:WMT) также ограничил доступ сотрудников к внутреннему ИИ-агенту, хотя ранее предоставлял неограниченное количество токенов.
В ходе переговоров с технологическими и консалтинговыми компаниями выяснилось, что многие клиенты отложили, сократили или отменили как минимум один ИИ-проект из-за опасений по поводу затрат и неопределённой экономики. Один из поставщиков оценил, что менее четверти его пилотных проектов принесли положительную отдачу.
Расходы на инференс могут составлять около 80% совокупных затрат на протяжении всего жизненного цикла ИИ-модели. Это смещает акцент с первоначальных затрат на обучение моделей на долгосрочные издержки их эксплуатации в производственной среде.
Компании управляют этими расходами, резервируя продвинутые модели для сложных задач и направляя более простые запросы к меньшим и дешёвым альтернативам. Открытые модели и собственная инфраструктура также привлекают всё больше внимания для предсказуемых высокообъёмных рабочих нагрузок.
Прогноз остаётся осторожно оптимистичным, хотя корпоративное внедрение может занять больше времени, чем ожидалось. Компании-разработчики программ могут ответить специализированными моделями, улучшенной маршрутизацией и ценообразованием, привязанным к результатам. HubSpot (Нью-Йорк:HUBS), например, уже ввёл тарификацию, связанную с результатами, а не с потреблением токенов.
