Один вопрос за 7 долларов: сколько на самом деле стоит ИИ в проде
Один зациклившийся вопрос ушёл в 117 итераций и стоил 6,87 доллара при среднем чеке в доли цента. Разбираю реальные расходы на ИИ в работающей системе: откуда они берутся, кто их на самом деле создаёт и какие четыре ограничителя надо поставить до запуска, а не после.

Есть расход, который в бизнес-планах внедрения ИИ обычно отсутствует как класс. Не разработка, не подписка, не сервер, а сами вычисления: каждый ответ модели стоит денег, и стоимость зависит не от прайса, а от того, как система написана.
Мы это увидели прямым способом. На одном из проектов однажды утром на общем счёте оставалось 10,79 доллара при расходе 23,76 доллара за предыдущие сутки. То есть меньше чем через сутки всё, что работает на ИИ, просто перестало бы отвечать. Дальше был разбор, и он оказался поучительнее любой теории.
Откуда берётся расход
Модель считает деньги за токены - куски текста на входе и выходе. Пока вы играете в чате, это копейки. В проде появляются три множителя, каждый из которых способен увеличить счёт в разы.
Длина контекста. Агент, который перед ответом подтягивает документы, историю переписки и описание инструментов, отправляет в модель не вопрос пользователя, а несколько страниц текста. Каждый раз.
Количество шагов. Современный ИИ-агент не отвечает одним запросом: он думает, зовёт инструмент, читает результат, снова думает. Один диалог - это десяток обращений к модели.
Фоновые процессы. Самое коварное. Обработка данных по расписанию, разметка, обогащение записей - работают без человека, круглосуточно и никем не наблюдаются.
Что показал разбор
Первое, и самое неприятное: собственного учёта расходов в системе не было. Считать пришлось постфактум, выковыривая цифры из журналов исполнений - а они хранились две недели. Всё, что старше, не восстановить.
Второе: жгли бюджет не пользователи. Тридцать шесть процентов расхода за две недели пришлось на одного сотрудника, который тестировал функциональность. Ещё двадцать один процент - на фоновую разметку профилей, работавшую по расписанию. То есть больше половины денег ушло не на то, ради чего система построена.
Третье, и главное. У агентных узлов не был выставлен потолок числа шагов. В нормальном режиме агент делает три-пять итераций и отвечает. Один вопрос, на котором агент зациклился, ушёл в 117 итераций и стоил 6,87 доллара. Один. Вопрос. При среднем чеке в доли цента.
Это классическая авария из мира облаков, просто в новой одежде: процесс без ограничителя, работающий за деньги.
Что мы поставили
Ничего сложного - и в этом суть. Все меры дешёвые, но их нужно вводить заранее, а не после того, как счёт кончился.
Потолок итераций для каждого агента. Основному ассистенту - 10 шагов, вспомогательным поисковым агентам - 6, фоновой разметке - 5. Если агент не уложился, он останавливается и честно говорит, что не смог, вместо того чтобы крутиться дальше за деньги.
Уменьшение выдачи поиска. Агент, ищущий по базе знаний, тянул в контекст по 25-31 фрагменту, а один процесс - 60. Снизили до 15 и 20. Расход упал, а качество ответов - нет: лишние фрагменты не помогали модели, а разбавляли её внимание. Это частая история - "дадим побольше контекста" ухудшает ответ и увеличивает счёт одновременно.
Разделение ключей. Один ключ на все среды означает, что тестирование на разработческом стенде выедает боевой бюджет. Разные ключи с отдельными лимитами - копеечная организационная мера, которую все откладывают.
Свой учёт. Не отчёты провайдера постфактум, а собственная запись: какой процесс, сколько токенов, по какому поводу. Иначе разбор начинается с археологии по журналам с двухнедельной глубиной.
Что с этим делать, если вы только внедряете
Считать надо не "сколько стоит запрос", а "сколько стоит процесс в месяц при ожидаемой нагрузке". Формула грубая, но рабочая: количество обращений умножить на среднее число шагов агента, умножить на средний объём контекста, умножить на цену модели. Полученную цифру умножить на два - на фоновые задачи и на людей, которые будут это тестировать.
И сразу заложить четыре вещи: лимит на ключ, потолок шагов у каждого агента, отдельные ключи для сред и оповещение при исчерпании порога. Ни одна из них не требует ни дня работы. Их не делают не потому, что дорого, а потому, что на старте расход выглядит как погрешность.
Что забрать себе
- ИИ в проде - это переменные расходы, а не разовая покупка. Бюджетируется помесячно, как электричество.
- Ограничитель числа шагов у агента обязателен. Без него один зациклившийся диалог стоит как месяц нормальной работы.
- Больше контекста не значит лучше ответ. Часто наоборот - и всегда дороже.
- Основной расход обычно создают не клиенты, а сотрудники и фоновые процессы. Пока вы не считаете отдельно, вы этого не увидите.
- Если учёта нет, глубина разбора равна сроку хранения журналов у провайдера. Обычно это две недели.
Новые разборы - на почту
Разборы задач автоматизации: что автоматизировать, сколько это стоит и что даёт в цифрах. Одно письмо на статью, без рекламы чужих продуктов.


