РУКОВОДСТВО · ОБНОВЛЕНО 2026-09-15
Стоимость AI API: как сравнивать тарифы моделей
Цена за миллион токенов — исходная ставка, а бюджет продукта зависит от состава запросов, ответов, дополнительных операций и доли ошибок.
Рассчитайте стоимость каждого этапа по фактическому usage, затем добавьте кэш, tools, изображения, retries и проверку человеком. Сравнивайте модели по цене принятой операции при одинаковом качестве, а не только по самой низкой ставке input-токенов.
1. Разложите счёт на единицы
Сначала установите, какие единицы тарифицирует маршрут: текстовые input и output tokens, cached input, reasoning, изображения, секунды аудио или отдельные tools. Для каждой части берите актуальную ставку из каталога. Маркетинговое слово «дешёвая» ничего не значит без среднего объёма входа и ответа в вашем процессе.
2. Снимите usage на реальных запросах
Подготовьте выборку с короткими, обычными и тяжёлыми случаями. Сохраняйте usage и итог приёмки, не записывая ключи и лишние персональные данные. Медиана показывает типичный расход, высокий перцентиль — всплески. Один демонстрационный prompt почти всегда занижает будущий бюджет: в приложении появятся system instructions, история и результаты инструментов.
3. Посчитайте полную операцию
Операция может включать извлечение текста, классификацию, генерацию и проверку. Сложите все вызовы, а также retries и fallback. Если десять процентов ответов требуют повторной генерации, их нельзя прятать за средней ставкой. Для бизнес-сценария добавьте время редактора или оператора: более дорогая модель может снизить общую себестоимость за счёт меньшего числа исправлений.
4. Сравните кандидатов при одинаковом качестве
Задайте минимальный проходной уровень task success. Модели, которые его не достигают, не участвуют в ценовом финале. Для остальных считайте рубли на тысячу принятых операций, p95 задержки и долю fallback. Конвертацию валюты фиксируйте датой и добавляйте комиссию платёжного канала, чтобы финансовая таблица совпадала с фактическим списанием.
5. Поставьте технические ограничители
Используйте max output, суточный и месячный budget cap, rate limit и предупреждения по проекту. Отдельные ключи упрощают атрибуцию команд и отключение утечки. Аномальный рост контекста, повторов или среднего ответа должен попадать в мониторинг. После смены цены или модели пересчитывайте прогноз на сохранённой выборке, не экстраполируя старую ставку.
Частые вопросы
Почему output обычно дороже input?
Это тарифное решение провайдера; для бюджета ставки всегда читают раздельно.
Нужно ли учитывать reasoning-токены?
Да, если они входят в usage и тарификацию выбранного маршрута.
Что такое цена принятого результата?
Все расходы делятся на число операций, прошедших критерий качества.
Как оценить месяц до запуска?
Умножьте распределение usage тестовой выборки на прогноз объёма и добавьте retries.
Можно ли зафиксировать цену в статье?
Лучше показывать её из актуального каталога с датой обновления.