Себестоимость минуты разговора голосового робота для техподдержки провайдера

Сейчас стоимость ключевых компонентов заметно снизилась, а часть обработки можно оставить внутри инфраструктуры оператора.

В этой статье считаем не абстрактную стоимость ИИ, а примерную себестоимость одной минуты разговора голосового робота для техподдержки провайдера по основным компонентам речевого бота.

Что входит в расчет

Расчет ниже показывает ориентировочную переменную стоимость минуты разговора. В него не включены разработка, внедрение, поддержка, телефония, серверы, мониторинг, лицензии сторонних систем и труд специалистов. Если STT, VAD, обезличивание и логика сценариев работают локально, у них нет отдельной поминутной тарификации, но инфраструктурные расходы все равно остаются.

Компонент Где работает Что делает
VAD (например, Silero VAD) Локально Определяет, когда клиент закончил говорить
STT / распознавание речи (например, Sber GigaAM-v3) Локально Преобразует речь клиента в текст
Биллинг / CRM Локально Дает данные о балансе, тарифе, заявках, блокировках и авариях
Обезличивание Локально Убирает ФИО, адреса, номера договоров и другие идентификаторы до передачи текста в модель
LLM Облако Формирует ответ на основе сценария, контекста и данных из биллинга/CRM
TTS / синтез речи Облако или локально Озвучивает ответ робота

В такой архитектуре аудиопоток, распознавание речи, биллинг и логика сценариев остаются внутри инфраструктуры оператора. В облачную LLM можно передавать уже подготовленный текст и только те признаки, которые нужны для ответа: есть задолженность или нет, активна услуга или заблокирована, есть открытая заявка, авария или назначенный визит мастера.

Локальные компоненты на одновременные 5-10 вызовов сможет поддерживать очень скромное железо с видеокартой до 30 тыс. руб., а подавляющему большинству небольших провайдеров больше и не нужно.

Полнота ответа важнее мгновенной реакции

Один из основных параметров, по которым формально сравнивают ботов — задержка. Она складывается из нескольких этапов: система ждет окончание фразы клиента (для провайдера VAD 1-1,3 сек, потому что часто обращаются пожилые люди), распознает речь (STT 0,2-0,3 сек), передает и получает текст в/из LLM (1,5-1,8 сек), синтезирует голосовой ответ (TTS 0,2-0,3 сек). На практике это часто дает задержку порядка 3-4 секунд.

Для большинства задач провайдера это допустимо. Клиенту важнее получить правильный ответ по балансу, заявке, тарифу, блокировке или визиту мастера, чем услышать быстрый, реалистичный, но бесполезный ответ. Сверхбыстрый realtime-диалог и перебивание клиента можно рассматривать как следующий этап, но для робота техподдержки начинать обычно разумнее с полноты и надежности ответа.

Практика показывает: важнее полнота ответа. Люди почти никогда не жалуются на медленных роботов, а на тупых жалуются очень часто.

Почему сценарий влияет на стоимость

Стоимость LLM сильно зависит от того, как устроен робот. Чем ближе поведение к алгоритмическому сценарию, тем дешевле один диалог. Чем больше робот сам строит свободный ответ на большом контексте, тем дороже запрос.

Пример алгоритмического сценария для ситуации: абонент думает что вчера успешно оплатил и звонит спросить почему у него до сих отрицательный баланс.

Фраза абонента при звонке: У меня интернет не работает. Баланс показывает минус, но я вчера через Сбер оплатил тысячу рублей. Мне интернет нужен прямо сейчас.

Алгоритмический бот не воспринимает запрос целиком, он снимает первый интент «Клиенте утверждает что оплатил, баланс отрицательный, значит надо уйти в ветку проверки оплаты», и начинает задавать вопросы

Бот: вы оплачивали через приложение банка или терминал? да/нет

Бот: у вас сохранился чек? да/нет

Бот: номер лицевого счёта в чеке правильный? да/нет

Модель не получает весь профиль абонента целиком, а работает по заранее спроектированным «рельсам». Разговор ощущается механистическим, часто бот не может вернуться в другую ветку, например с техподдержки, уйти в оплату.

В более свободном LLM-сценарии в запрос обработается за один заход:

Клиент: У меня интернет не работает. Баланс показывает минус, но я вчера через Сбер оплатил тысячу рублей. Мне интернет нужен прямо сейчас

Бот: не вижу платежа в переданных данных, возможно допустили ошибку в номере лицевого счёта. Если интернет нужен срочного могу поставить обещанный платеж или могу продиктовать номер вашего счёта для проверки.

Такой подход гибче в ответах абоненту, но увеличивает контекст и стоимость.

Расчетная модель

Возьмем реализацию LLM-робота из описания выше и приведем к условной минуте разговора. Половину времени говорит клиент, половину – робот. За минуту получается примерно два обмена: клиент задает вопрос, робот отвечает, затем клиент уточняет или подтверждает.

Параметр Допущение
Длительность разговора 1 минута
Говорит клиент Около 30 секунд
Говорит робот Около 30 секунд
Количество LLM-вызовов 2 вызова в минуту
Большой промпт по финансовой ветке + финансовые данные биилинга, информация об услугах, история обращений и т.п. 10 000 токенов на вызов
Новая реплика + изменяемый контекст 500 токенов на вызов
Ответ модели 150 токенов на вызов, включая служебную информацию json
Итого ответов модели за минуту 300 токенов

При первом обращении к финансовой ветке большой промпт и данные еще не находятся в кеше, поэтому считаются как обычные входящие токены. Во втором и последующих вызовах повторяющаяся часть может тарифицироваться дешевле как кешированные токены.

Такой размер промта и схемы данных для финансовой ветки получается исходя из условия, что он закрывает любой финансовый вопрос, касающийся оплат, начислений, тарифов, акций, учитывает историю предыдущих обращений и т.п.

Вариант 1. DeepSeek V4 Flash через Yandex AI Studio

На 22 июня 2026 года по тарифам Yandex AI Studio для DeepSeek V4 Flash: 0,3 ₽ за 1000 входящих токенов, 0,075 ₽ за 1000 кешированных токенов и 0,5 ₽ за 1000 исходящих токенов. Цены указаны с НДС.

Часть Объем Тариф Стоимость
1-й вызов: большой промпт без кеша 10 000 токенов 0,3 ₽ / 1000 3,00 ₽
1-й вызов: новая реплика и контекст 500 токенов 0,3 ₽ / 1000 0,15 ₽
1-й вызов: ответ модели 150 токенов 0,5 ₽ / 1000 0,075 ₽
2-й вызов: большой промпт уже в кеше 10 000 токенов 0,075 ₽ / 1000 0,75 ₽
2-й вызов: новая реплика и контекст 500 токенов 0,3 ₽ / 1000 0,15 ₽
2-й вызов: ответ модели 150 токенов 0,5 ₽ / 1000 0,075 ₽
Итого LLM за первую минуту ветки 4,20 ₽

Если разговор продолжается в той же финансовой ветке и кеширование работает, последующие минуты считаются дешевле.

Часть Объем Тариф Стоимость
2-й вызов: большой промпт уже в кеше 10 000 токенов 0,075 ₽ / 1000 0,75 ₽
Новые реплики и изменяемый контекст 1 000 токенов 0,3 ₽ / 1000 0,30 ₽
Ответы модели 300 токенов 0,5 ₽ / 1000 0,15 ₽
Итого LLM за расчетную минуту 1,20 ₽

Вариант 2. DeepSeek V4 Flash напрямую

Для прямого API DeepSeek используем условный курс 100 ₽ за $1 (это оправдано, т.к. есть комиссии за пополнение через посредников). При другом курсе цифры меняются линейно. В пересчете на рубли получается примерно: входящие токены без кеша – 0,014 ₽ за 1000 токенов, входящие токены из кеша – 0,00028 ₽ за 1000 токенов, исходящие токены – 0,028 ₽ за 1000 токенов.

Часть Объем Тариф Стоимость
1-й вызов: большой промпт без кеша 10 000 токенов 0,014 ₽ / 1000 0,140 ₽
1-й вызов: новая реплика и контекст 500 токенов 0,014 ₽ / 1000 0,007 ₽
1-й вызов: ответ модели 150 токенов 0,028 ₽ / 1000 0,0042 ₽
2-й вызов: большой промпт уже в кеше 10 000 токенов 0,00028 ₽ / 1000 0,0028 ₽
2-й вызов: новая реплика и контекст 500 токенов 0,014 ₽ / 1000 0,007 ₽
2-й вызов: ответ модели 150 токенов 0,028 ₽ / 1000 0,0042 ₽
Итого LLM за первую минуту ветки около 0,17 ₽
Часть Объем Тариф Стоимость
2-й вызов: большой промпт уже в кеше 10 000 токенов 0,00028 ₽ / 1000 0,0028 ₽
Новые реплики и изменяемый контекст 1 000 токенов 0,014 ₽ / 1000 0,014 ₽
Ответы модели 300 токенов 0,028 ₽ / 1000 0,0084 ₽
Итого LLM за расчетную минуту около 0,03 ₽

Сколько добавляет синтез речи

Если использовать Yandex SpeechKit API v3, тарификация идет за запросы на синтез. Один базовый запрос – до 250 символов, стоимость одной единицы тарификации составляет 0,1626 ₽. Если робот говорит примерно 30 секунд в минуту разговора, это часто укладывается примерно в 500-750 символов текста, то есть в 2-3 единицы тарификации. Поэтому для грубой модели можно закладывать около 0,5 ₽ на минуту разговора на TTS.

Если синтез речи вынесен локально, поминутная облачная тарификация может исчезнуть, но появятся расходы на инфраструктуру и обслуживание модели.

Итоговая ориентировочная себестоимость минуты

Сценарий LLM TTS Итого переменная стоимость минуты
DeepSeek V4 Flash через Yandex AI Studio, первая минута финансовой ветки около 4,20 ₽ около 0,50 ₽ около 4,70 ₽
DeepSeek V4 Flash через Yandex AI Studio, расчетная минута с кешированием около 1,20 ₽ около 0,50 ₽ около 1,70 ₽
DeepSeek V4 Flash напрямую, первая минута финансовой ветки около 0,17 ₽ около 0,50 ₽ около 0,67 ₽
DeepSeek V4 Flash напрямую, расчетная минута с кешированием около 0,03 ₽ около 0,50 ₽ около 0,53 ₽

Эти цифры не нужно воспринимать как окончательный коммерческий тариф. Это расчет переменной себестоимости при заданной архитектуре и допущениях.

Где на самом деле сложность

Практика показывает, что главная сложность сегодня не в цене токенов, не в синтезе голоса и даже не в интеграциях, которые можно быстро прототипировать за несколько часов. Сложнее всего описать бизнес-процессы провайдера так, чтобы робот не фантазировал, а действовал по понятным правилам. И потом отладить до состояния, что робот может обработать практически любой речевой оборот.

Нужно разобрать, что делать при задолженности, не поступившем платеже, аварии, открытой заявке, повторном обращении, проблеме Wi-Fi, блокировке услуги или переносе визита мастера. Фактически нужно поднять сценарии, по которым сейчас работают операторы контакт-центра, отслушать десятки реальных диалогов по разным темам, и превратить их в управляемую логику.

Поэтому главный вопрос не только в том, сколько стоит минута разговора. Главный вопрос – какие сценарии нужно автоматизировать, насколько хорошо они описаны.

Чтобы получить бесплатную оценку стоимости минуты работы голосового робота для вашей компании и понять, какие сценарии он может взять на себя, оставьте заявку в форме ниже.

Источники тарифов