Маржа при 100 пользователях ничего не доказывает
У раннего AI-продукта счёт за инференс настолько мал, что его никто не разбирает. Сто пользователей, три обращения в день на каждого, и месячный расход на модель укладывается в несколько десятков долларов, дешевле домена с мониторингом. На этом этапе любая команда рапортует о 90% маржи: в знаменателе сидят ещё не нагруженные фиксированные затраты, а переменная часть просто не успела вырасти. Настоящий вопрос всплывает через два года, когда трафик вырастает в тысячу раз: во сколько раз вырос счёт. Ответ зависит от того, какие структуры вы зашили в продукт в те полгода, когда стоимость никого не волновала.
В отличие от классического SaaS, у AI нет почти нулевой предельной стоимости. Каждое обращение к модели порождает вычислительные затраты, и они складываются в переменную себестоимость запроса, которой в подписочной экономике раньше просто не было. Поэтому финансовую масштабируемость нельзя откладывать на этап зрелости: она формирует архитектуру продукта с первого дня. Ниже разберём, как моделировать затраты, снижать себестоимость инференса, строить цену и удерживать маржу при росте.
Затраты делятся по форме кривой, а не по названию
Полезнее классифицировать расходы не по источнику, а по тому, как они растут вместе с использованием.
Линейная часть предсказуема: логи, объектное хранилище, исходящий трафик. Каждый новый пользователь добавляет фиксированную долю, ошибка прогноза редко превышает 10%.
Сублинейная часть — векторный поиск и индексация. Разница во времени выборки между 100 тысячами и миллионом векторов много меньше десятикратной, а фиксированная стоимость построения индекса размазывается по головам тем тоньше, чем больше пользователей.
Суперлинейная часть и есть источник проблем: ручная модерация, разбор инцидентов, повторные запросы из-за галлюцинаций и всё, что усиливается длинным контекстом. Именно эта категория незаметно утаскивает маржу с 72% к 41%, пока вы смотрите на линейные строки бюджета.
Отдельно стоит стоимость жизненного цикла модели: обнаружение дрейфа, переобучение, пайплайны оценки, резервирование, мониторинг безопасности. В корпоративных внедрениях TCO определяет именно эксплуатация, а не первичная разработка: этот расход не исчезает при выходе на PMF, а растёт вместе с нагрузкой на поддержку.
Посчитаем одну сессию до конца
Пусть на входе 1800 токенов, на выходе 400, модель среднего класса: вход по 3 доллара за миллион токенов, выход по 15. Тогда одно обращение стоит 1800 / 1 000 000 × 3 + 400 / 1 000 000 × 15 = 0,0054 + 0,006 = 0,0114 доллара. Выглядит несущественно. Но средний активный пользователь делает 12 обращений в день, 360 в месяц — это уже 4,10 доллара инференса на человека. При подписке в 19 долларов модель съедает 21,6% ещё до retrieval, хранилища и комиссии платёжного канала. Пока вы не проделали этот расчёт для своего распределения нагрузки, разговор про маржу беспредметен.
Снижение себестоимости инференса даёт результат быстрее всего
Маршрутизация между моделями — первый рычаг. Каскад small → medium → large, переключение по уровню уверенности, конвейеры retrieval-first и reasoning-first, кеш повторяющихся ответов. Отдайте 70% запросов дешёвой модели с ценой в десять раз ниже — счёт становится 0,7 × 0,1 + 0,3 × 1 = 0,37, экономия 63%. Но при низкой уверенности приходится откатываться к большой модели: если по этому пути идёт 12% запросов, за них платят дважды, реальная себестоимость 0,49, чистая экономия 51%. Разница в 12 пунктов — налог самого маршрутизатора, плюс два набора промптов, две системы оценки и вопрос, который никто не хочет разбирать: при ошибке в продакшене виновата модель или маршрут. Поэтому маршрутизацию не включают без готового набора оценки.
Оптимизация промптов работает без риска для качества: убрать избыточный контекст, вынести неизменную часть в системную инструкцию, перейти на структурированный вывод. Здесь же живёт префиксный кеш: если из 1800 токенов входа 1200 приходятся на фиксированный системный промпт, при попадании в кеш эта часть тарифицируется по 10% от цены, и вход дешевеет с 0,0054 до 0,0022 доллара, сессия в целом — на 28%.
Управление длиной вывода недооценивают: длинные ответы дороже всего, а стриминг, прерванный пользователем на середине, оплачивается полностью при нулевой ценности. Замерьте долю «сгенерировано наполовину и брошено»; выше 15%, переводите длинные ответы на поэтапное подтверждение: сначала план на 200 токенов, тело по кнопке.
Оптимизация retrieval снимает три расхода — эмбеддинг, векторный поиск, ранжирование — через кеш эмбеддингов, разреженную индексацию и доменную компрессию. Пакетная обработка снижает нагрузку на GPU при массовом анализе и генерации, а асинхронность выносит тяжёлые операции за пределы критичных пользовательских путей.
Модель ценообразования решает больше, чем любая оптимизация
Чистая подписка ломается об AI сразу: она предполагает стабильную стоимость на пользователя и предсказуемое использование, а AI нарушает оба допущения. Тяжёлые пользователи уничтожают маржу: при типичном распределении 5% пользователей выбирают больше половины бюджета инференса.
Оплата по факту чинит эту связь (выручка растёт вместе с затратами), но пугает нового пользователя, который не может оценить свой объём: никто не знает, на что хватит миллиона токенов. Поэтому для большинства AI-продуктов оптимален гибрид: фиксированная цена с явной квотой плюс оплата сверх неё, и остаток квоты вынесен в интерфейс как цифра, которую пользователь видит постоянно.
Единицу тарификации выбирают не по токенам, которые пользователю ничего не говорят, а по завершённой задаче: одна генерация отчёта, один разбор кода, одно сравнение договоров. Такая единица осмысленна для клиента, коррелирует с реальной себестоимостью обычно выше 0,8 и позволяет менять модель и добавлять кеш в бэкенде, не переписывая прайс.
Прибыльность живёт на стыке использования, удержания и контроля затрат
LTV для AI считают за вычетом переменных затрат:
LTV_net = LTV_revenue − Total Variable Cost,
где в переменные входят вычисления, поддержка и инфраструктура. CAC тоже специфичен: новый пользователь сразу нагружает вычисления, а интенсивное использование бесплатного тарифа удлиняет окупаемость. Ориентиры по сроку возврата: B2C AI — до 6 месяцев, prosumer — 6–9, B2B AI SaaS — 12–18. Окупаемость и задаёт допустимую скорость масштабирования: пока LTV_net нестабилен, наращивать go-to-market рано.
Маржу считают по когортам, а не общим числом. Слить в один показатель самообслуживание с ценником 19 долларов и enterprise с ценником 2000 — самый частый способ обмануть себя: усреднённые 86% прячут тот факт, что self-serve после CAC уходит в минус. У enterprise к тому же главный расход не инференс, а внедрение, аудит и выделенная поддержка: давить на них стоимость модели бессмысленно.
Сценарии важнее точечного прогноза
Рост при AI ломает маржу не там, где ждёшь, поэтому команда прогоняет несколько сценариев: скачок стоимости вычислений, ускоренный рост пользователей, злоупотребление длинным контекстом, перегрузку RAG, злоупотребление бесплатным тарифом. Анализ чувствительности показывает, какой параметр двигает экономику сильнее — размер модели, длина контекста, длина вывода, top-k в retrieval или повторные запросы из-за галлюцинаций. В прогнозе стоит явно заложить нулевое снижение цены токенов от поставщиков: цена падает рывками и однажды остановится, а рост использования — нет. Маржа, выросшая на удешевлении токенов, не ваша заслуга; ваша — короткие промпты, меньше повторов, ранние условия остановки.
У маржи должен быть конкретный владелец
Когда затраты висят на инженерии, цена — на маркетинге, а удержание — на продукте, за маржу не отвечает никто. Рабочий вариант — вписать её в квартальные цели продакт-менеджера и дать два реальных полномочия: право заблокировать фичу, чья себестоимость запроса выше порога, и право менять квоты и правила маршрутизации без правки прайса. К этому добавляется недельная разбивка счёта по фичам, тарифам и перцентилям пользователей. Без атрибуции команда режет бюджет целиком, а целиком всегда режется самая ценная часть опыта.
Экономические ограничители задают тот же PM: максимальная стоимость запроса, лимиты бесплатного тарифа, пороги fallback-логики, правила маршрутизации, целевой срок окупаемости. Они и защищают маржу при масштабировании.
Несколько неудобных ответов
Стоит ли делать AI-продукт с маржой 55%
Стоит, если вы можете объяснить, за счёт чего она вырастет, и назвать срок. «Подрастёт с масштабом» не считается: масштаб делает хуже именно суперлинейные строки бюджета.
Кеш или маршрутизация первым
Кеш. Он не меняет качество ответа, риск только в консистентности. Маршрутизация качество меняет и требует набора оценки. Включить её без оценки — обменять проблему затрат на более дорогую проблему качества.
Отпугнёт ли оплата по факту
Отпугнёт часть новых пользователей, которые не могут спрогнозировать объём. Гибрид устойчивее: фиксированная цена с понятной квотой плюс оплата сверх неё и видимый остаток в интерфейсе.
Что за метрика у финансово масштабируемого AI
Стоимость успешно выполненной задачи: в знаменателе только успешные задачи, деньги за повторы после сбоя идут в числитель. Слепое пятно: она нечувствительна к сложности, и при сдвиге структуры пользователей искажается.
Главный финансовый риск при масштабировании
Неконтролируемое использование: прежде всего длинные контексты и многошаговые запросы, которые резко поднимают вычислительные затраты.