
Сейчас стоимость ключевых компонентов заметно снизилась, а часть обработки можно оставить внутри инфраструктуры оператора.
В этой статье считаем не абстрактную стоимость ИИ, а примерную себестоимость одной минуты разговора голосового робота для техподдержки провайдера по основным компонентам речевого бота.
Что входит в расчет
Расчет ниже показывает ориентировочную переменную стоимость минуты разговора. В него не включены разработка, внедрение, поддержка, телефония, серверы, мониторинг, лицензии сторонних систем и труд специалистов. Если STT, VAD, обезличивание и логика сценариев работают локально, у них нет отдельной поминутной тарификации, но инфраструктурные расходы все равно остаются.
| Компонент | Где работает | Что делает |
|---|---|---|
| VAD (например, Silero VAD) | Локально | Определяет, когда клиент закончил говорить |
| STT / распознавание речи (например, Sber GigaAM-v3) | Локально | Преобразует речь клиента в текст |
| Биллинг / CRM | Локально | Дает данные о балансе, тарифе, заявках, блокировках и авариях |
| Обезличивание | Локально | Убирает ФИО, адреса, номера договоров и другие идентификаторы до передачи текста в модель |
| LLM | Облако | Формирует ответ на основе сценария, контекста и данных из биллинга/CRM |
| TTS / синтез речи | Облако или локально | Озвучивает ответ робота |
В такой архитектуре аудиопоток, распознавание речи, биллинг и логика сценариев остаются внутри инфраструктуры оператора. В облачную LLM можно передавать уже подготовленный текст и только те признаки, которые нужны для ответа: есть задолженность или нет, активна услуга или заблокирована, есть открытая заявка, авария или назначенный визит мастера.
Локальные компоненты на одновременные 5-10 вызовов сможет поддерживать очень скромное железо с видеокартой до 30 тыс. руб., а подавляющему большинству небольших провайдеров больше и не нужно.
Полнота ответа важнее мгновенной реакции
Один из основных параметров, по которым формально сравнивают ботов — задержка. Она складывается из нескольких этапов: система ждет окончание фразы клиента (для провайдера VAD 1-1,3 сек, потому что часто обращаются пожилые люди), распознает речь (STT 0,2-0,3 сек), передает и получает текст в/из LLM (1,5-1,8 сек), синтезирует голосовой ответ (TTS 0,2-0,3 сек). На практике это часто дает задержку порядка 3-4 секунд.
Для большинства задач провайдера это допустимо. Клиенту важнее получить правильный ответ по балансу, заявке, тарифу, блокировке или визиту мастера, чем услышать быстрый, реалистичный, но бесполезный ответ. Сверхбыстрый realtime-диалог и перебивание клиента можно рассматривать как следующий этап, но для робота техподдержки начинать обычно разумнее с полноты и надежности ответа.
Практика показывает: важнее полнота ответа. Люди почти никогда не жалуются на медленных роботов, а на тупых жалуются очень часто.
Почему сценарий влияет на стоимость
Стоимость LLM сильно зависит от того, как устроен робот. Чем ближе поведение к алгоритмическому сценарию, тем дешевле один диалог. Чем больше робот сам строит свободный ответ на большом контексте, тем дороже запрос.
Пример алгоритмического сценария для ситуации: абонент думает что вчера успешно оплатил и звонит спросить почему у него до сих отрицательный баланс.
Фраза абонента при звонке: У меня интернет не работает. Баланс показывает минус, но я вчера через Сбер оплатил тысячу рублей. Мне интернет нужен прямо сейчас.
Алгоритмический бот не воспринимает запрос целиком, он снимает первый интент «Клиенте утверждает что оплатил, баланс отрицательный, значит надо уйти в ветку проверки оплаты», и начинает задавать вопросы
Бот: вы оплачивали через приложение банка или терминал? да/нет
Бот: у вас сохранился чек? да/нет
Бот: номер лицевого счёта в чеке правильный? да/нет
Модель не получает весь профиль абонента целиком, а работает по заранее спроектированным «рельсам». Разговор ощущается механистическим, часто бот не может вернуться в другую ветку, например с техподдержки, уйти в оплату.
В более свободном LLM-сценарии в запрос обработается за один заход:
Клиент: У меня интернет не работает. Баланс показывает минус, но я вчера через Сбер оплатил тысячу рублей. Мне интернет нужен прямо сейчас
Бот: не вижу платежа в переданных данных, возможно допустили ошибку в номере лицевого счёта. Если интернет нужен срочного могу поставить обещанный платеж или могу продиктовать номер вашего счёта для проверки.
Такой подход гибче в ответах абоненту, но увеличивает контекст и стоимость.
Расчетная модель
Возьмем реализацию LLM-робота из описания выше и приведем к условной минуте разговора. Половину времени говорит клиент, половину – робот. За минуту получается примерно два обмена: клиент задает вопрос, робот отвечает, затем клиент уточняет или подтверждает.
| Параметр | Допущение |
|---|---|
| Длительность разговора | 1 минута |
| Говорит клиент | Около 30 секунд |
| Говорит робот | Около 30 секунд |
| Количество LLM-вызовов | 2 вызова в минуту |
| Большой промпт по финансовой ветке + финансовые данные биилинга, информация об услугах, история обращений и т.п. | 10 000 токенов на вызов |
| Новая реплика + изменяемый контекст | 500 токенов на вызов |
| Ответ модели | 150 токенов на вызов, включая служебную информацию json |
| Итого ответов модели за минуту | 300 токенов |
При первом обращении к финансовой ветке большой промпт и данные еще не находятся в кеше, поэтому считаются как обычные входящие токены. Во втором и последующих вызовах повторяющаяся часть может тарифицироваться дешевле как кешированные токены.
Такой размер промта и схемы данных для финансовой ветки получается исходя из условия, что он закрывает любой финансовый вопрос, касающийся оплат, начислений, тарифов, акций, учитывает историю предыдущих обращений и т.п.
Вариант 1. DeepSeek V4 Flash через Yandex AI Studio
На 22 июня 2026 года по тарифам Yandex AI Studio для DeepSeek V4 Flash: 0,3 ₽ за 1000 входящих токенов, 0,075 ₽ за 1000 кешированных токенов и 0,5 ₽ за 1000 исходящих токенов. Цены указаны с НДС.
| Часть | Объем | Тариф | Стоимость |
|---|---|---|---|
| 1-й вызов: большой промпт без кеша | 10 000 токенов | 0,3 ₽ / 1000 | 3,00 ₽ |
| 1-й вызов: новая реплика и контекст | 500 токенов | 0,3 ₽ / 1000 | 0,15 ₽ |
| 1-й вызов: ответ модели | 150 токенов | 0,5 ₽ / 1000 | 0,075 ₽ |
| 2-й вызов: большой промпт уже в кеше | 10 000 токенов | 0,075 ₽ / 1000 | 0,75 ₽ |
| 2-й вызов: новая реплика и контекст | 500 токенов | 0,3 ₽ / 1000 | 0,15 ₽ |
| 2-й вызов: ответ модели | 150 токенов | 0,5 ₽ / 1000 | 0,075 ₽ |
| Итого LLM за первую минуту ветки | 4,20 ₽ |
Если разговор продолжается в той же финансовой ветке и кеширование работает, последующие минуты считаются дешевле.
| Часть | Объем | Тариф | Стоимость |
|---|---|---|---|
| 2-й вызов: большой промпт уже в кеше | 10 000 токенов | 0,075 ₽ / 1000 | 0,75 ₽ |
| Новые реплики и изменяемый контекст | 1 000 токенов | 0,3 ₽ / 1000 | 0,30 ₽ |
| Ответы модели | 300 токенов | 0,5 ₽ / 1000 | 0,15 ₽ |
| Итого LLM за расчетную минуту | 1,20 ₽ |
Вариант 2. DeepSeek V4 Flash напрямую
Для прямого API DeepSeek используем условный курс 100 ₽ за $1 (это оправдано, т.к. есть комиссии за пополнение через посредников). При другом курсе цифры меняются линейно. В пересчете на рубли получается примерно: входящие токены без кеша – 0,014 ₽ за 1000 токенов, входящие токены из кеша – 0,00028 ₽ за 1000 токенов, исходящие токены – 0,028 ₽ за 1000 токенов.
| Часть | Объем | Тариф | Стоимость |
|---|---|---|---|
| 1-й вызов: большой промпт без кеша | 10 000 токенов | 0,014 ₽ / 1000 | 0,140 ₽ |
| 1-й вызов: новая реплика и контекст | 500 токенов | 0,014 ₽ / 1000 | 0,007 ₽ |
| 1-й вызов: ответ модели | 150 токенов | 0,028 ₽ / 1000 | 0,0042 ₽ |
| 2-й вызов: большой промпт уже в кеше | 10 000 токенов | 0,00028 ₽ / 1000 | 0,0028 ₽ |
| 2-й вызов: новая реплика и контекст | 500 токенов | 0,014 ₽ / 1000 | 0,007 ₽ |
| 2-й вызов: ответ модели | 150 токенов | 0,028 ₽ / 1000 | 0,0042 ₽ |
| Итого LLM за первую минуту ветки | около 0,17 ₽ |
| Часть | Объем | Тариф | Стоимость |
|---|---|---|---|
| 2-й вызов: большой промпт уже в кеше | 10 000 токенов | 0,00028 ₽ / 1000 | 0,0028 ₽ |
| Новые реплики и изменяемый контекст | 1 000 токенов | 0,014 ₽ / 1000 | 0,014 ₽ |
| Ответы модели | 300 токенов | 0,028 ₽ / 1000 | 0,0084 ₽ |
| Итого LLM за расчетную минуту | около 0,03 ₽ |
Сколько добавляет синтез речи
Если использовать Yandex SpeechKit API v3, тарификация идет за запросы на синтез. Один базовый запрос – до 250 символов, стоимость одной единицы тарификации составляет 0,1626 ₽. Если робот говорит примерно 30 секунд в минуту разговора, это часто укладывается примерно в 500-750 символов текста, то есть в 2-3 единицы тарификации. Поэтому для грубой модели можно закладывать около 0,5 ₽ на минуту разговора на TTS.
Если синтез речи вынесен локально, поминутная облачная тарификация может исчезнуть, но появятся расходы на инфраструктуру и обслуживание модели.
Итоговая ориентировочная себестоимость минуты
| Сценарий | LLM | TTS | Итого переменная стоимость минуты |
|---|---|---|---|
| DeepSeek V4 Flash через Yandex AI Studio, первая минута финансовой ветки | около 4,20 ₽ | около 0,50 ₽ | около 4,70 ₽ |
| DeepSeek V4 Flash через Yandex AI Studio, расчетная минута с кешированием | около 1,20 ₽ | около 0,50 ₽ | около 1,70 ₽ |
| DeepSeek V4 Flash напрямую, первая минута финансовой ветки | около 0,17 ₽ | около 0,50 ₽ | около 0,67 ₽ |
| DeepSeek V4 Flash напрямую, расчетная минута с кешированием | около 0,03 ₽ | около 0,50 ₽ | около 0,53 ₽ |
Эти цифры не нужно воспринимать как окончательный коммерческий тариф. Это расчет переменной себестоимости при заданной архитектуре и допущениях.
Где на самом деле сложность
Практика показывает, что главная сложность сегодня не в цене токенов, не в синтезе голоса и даже не в интеграциях, которые можно быстро прототипировать за несколько часов. Сложнее всего описать бизнес-процессы провайдера так, чтобы робот не фантазировал, а действовал по понятным правилам. И потом отладить до состояния, что робот может обработать практически любой речевой оборот.
Нужно разобрать, что делать при задолженности, не поступившем платеже, аварии, открытой заявке, повторном обращении, проблеме Wi-Fi, блокировке услуги или переносе визита мастера. Фактически нужно поднять сценарии, по которым сейчас работают операторы контакт-центра, отслушать десятки реальных диалогов по разным темам, и превратить их в управляемую логику.
Поэтому главный вопрос не только в том, сколько стоит минута разговора. Главный вопрос – какие сценарии нужно автоматизировать, насколько хорошо они описаны.
Чтобы получить бесплатную оценку стоимости минуты работы голосового робота для вашей компании и понять, какие сценарии он может взять на себя, оставьте заявку в форме ниже.
Получить бесплатную оценку
Оставьте контакты — оценим себестоимость минуты голосового робота для вашей компании и подскажем, какие сценарии техподдержки можно автоматизировать первыми.