Карта ИИ/Инструменты/Голос и музыка
Обновили 08.10.2026
Yandex SpeechKit
РуОзвучивает текст и расшифровывает речь с оплатой за объём в рублях.
Вход от 0,1626 ₽
general, за расчётную единицу; НДС включён
Модель своя
general и livetts
Из РФ работает
Оплата в рублях по условиям вендора; платёж не проверяли
Код открыт частично
Клиентский SDK; модель BrandVoice остаётся у Яндекса
Берите, если нужен API для русской озвучки и расшифровки с оплатой в рублях. Не берите, если ищете бесплатный безлимит или монтаж видео по тексту.
Yandex SpeechKit превращает текст в голос и запись разговора в текст. В браузере можно озвучить одну реплику или загрузить аудиофайл, через API встроить эти операции в своё приложение. Это речевой сервис Яндекса внутри AI Studio; для разговора с пониманием смысла и вызовом инструментов нужен отдельный голосовой агент.
Где Yandex SpeechKit на большой карте ИИ
Рядом: ElevenLabs·Silero·SaluteSpeech
1. Брать или нет
Онлайн-озвучка, расшифровка и API есть; бесплатного безлимита нет. Для одной записи можно начать с браузерного Playground.
Что люди хотят от Yandex SpeechKit
Wordstat, РФ, 08.10.2026: хвосты «yandex speechkit озвучка текста», «яндекс speechkit транскрибация», «yandex speechkit онлайн», «api», «скачать» и «бесплатно». Частоты не складываются; ответы сверены с официальными инструкциями.
Кому подходит. Команде с русскоязычным ботом, озвучкой уведомлений или потоком записей встреч. Можно начать с готового голоса и платить за объём, а свой голос считать отдельным проектом.
Кому не подходит. Тому, кто хочет бесплатный безлимит, музыку по описанию или видеоредактор. Расшифровка создаёт текст, но сама не режет запись на монтажной дорожке.
Для разовой озвучки сравните условия в подборке речевых сервисов. В этой карточке разбираем прямой доступ к SpeechKit, без тарифов посредников.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
2. Что делает с текстом и голосом
Распознавание переводит речь в текст, синтез делает обратное. Логика разговора живёт между этими операциями.
Русская озвучка. general поддерживает русские голоса, включая filipp, ermil, jane и marina. У LiveTTS шесть русских голосов с амплуа для разговора, поддержки, продаж и других сценариев.
Поправка произношения. Playground принимает до 5000 символов. В тексте можно расставлять ударения знаком +, паузы и акценты; язык, голос и параметры синтеза выбираются отдельно.
Новая модель со своими границами. У LiveTTS отдельные голоса; в API v3 нельзя задавать скорость, высоту и длительность речи, использовать аудио- и текстовые шаблоны. Разметки времени слов в ответе нет.
Свой сервер. SpeechKit Hybrid выполняет синтез и распознавание внутри вашей инфраструктуры в Docker-контейнерах. Это отдельная серверная поставка, а не бесплатная программа для озвучки.
Запись встречи. Playground принимает MP3, WAV и OGG/OPUS до 60 МБ. Есть пунктуация, нормализация чисел, определение дикторов и дополнительная обработка результата текстовой моделью за отдельную плату.
Какой режим выбрать для записи
Инструкции Playground, модели синтеза и лимиты SpeechKit; проверено 08.10.2026. Архивный звук в хиро показывает BrandVoice 2022 года; нынешний LiveTTS мы не генерировали.
Для бота. Для агента, который понимает запросы и вызывает инструменты, нужен отдельный сценарий голосовых агентов AI Studio. Его тарификация отличается от синтеза готового текста.
Сборку действий вокруг речевого API можно поручить сценарию в n8n.
3. Как получить первый файл
Первый файл можно получить без программирования. Подготовка аккаунта и каталога всё равно нужна.
Подготовьте доступ. Войдите в Yandex Cloud через Yandex ID, создайте платёжный аккаунт и выберите каталог. Для Playground нужны роли ai.playground.user и ai.datasets.editor или выше.
Три поверхности SpeechKit
От каталога до аудиофайла
Русский интерфейс и ввод. Инструкция и официальный экран Playground на русском. Русский текст поддержан для синтеза, русский язык можно выбрать для распознавания; это не означает одинаковой поддержки всех языков каждым голосом.
Следующий шаг для разработчика. API требует IAM-токен или ключ сервисного аккаунта и права на каталог. Секретный ключ храните на сервере, а не в браузере пользователя.
Начало работы, инструкция синтеза и условия SpeechKit; проверено 08.10.2026. Ссылки на первоисточники собраны в конце карточки.
4. Что показывает Индекс
Индекс показывает заметность инструмента на рынке. По нему нельзя решить, чей голос лучше произнесёт название вашей компании.
Что измерено, а что предстоит проверить
Индекс: живой замер от 07.10.2026; балл и место считает штатный helper по полному составу категории. Спрос: Wordstat, РФ, 08.10.2026.
Сравнивайте один материал. Прослушайте одинаковую реплику, затем проверьте запись с шумом и двумя участниками. Популярность названия и обещание естественной речи не заменяют эту пробу.
5. Сколько стоит каждый режим
За готовые голоса платят по использованию, а за свой голос BrandVoice ещё за создание и хостинг. Подписку на студию или посредника нельзя сравнивать с ценой одного запроса.
Бесплатный вход. SpeechKit платный: отдельного постоянного бесплатного тарифа нет. Пробный период Yandex Cloud и гранты зависят от условий аккаунта; не считайте их ежемесячным бесплатным лимитом SpeechKit.
Период и валюта. Оплата за фактическое потребление за календарный месяц; годового плана со скидкой в прайсе SpeechKit нет. Рублёвые цены включают НДС, символы учитывают пробелы и служебную разметку.
Отдельная поставка Hybrid. Цена по запросу; тариф облачного API к ней не переносится. Выбирайте модель лицензирования под свой сервер и требование работы без интернета.
Цена обычной озвучки и распознавания
Цены проверены 08.10.2026; официальные правила тарификации SpeechKit. Все строки в рублях с НДС, период учёта — календарный месяц.
Текст считается блоками. В API v3 по умолчанию до 250 символов и 24 секунд на запрос. Для длинного текста используйте unsafe_mode или потоковый режим; платите за каждый начатый блок из 250 символов. В Realtime с Speech TTS Live оплачивается входящий текст.
Аудио считается с округлением. В синхронном и потоковом режимах каждый фрагмент округляется вверх до 15 секунд. В асинхронном режиме минимум 15 секунд, далее посекундно; каналы считаются парами с округлением вверх.
Свой голос: отдельный счёт
Проба своего голоса. Первые 7 дней хостинг созданного голоса не тарифицируется, запросы на синтез оплачиваются. После пробы голос уходит в архив; для дальнейшего использования его активируют с оплатой хостинга.
Оплата из РФ. Резиденты РФ платят в рублях. Для физических лиц предусмотрены карта банка РФ и СБП; для организаций и ИП также банковский перевод.
Мир, Visa и Mastercard принимаются, если выпущены банком РФ. Собственный платёж не выполняли: это условия вендора, а не отчёт о прошедшей покупке.
Brand Voice Lite и справка оплаты Yandex Cloud; проверено 08.10.2026. Рубли, карты банка РФ и СБП относятся к платёжному аккаунту Yandex Cloud.
6. Что происходит с данными и голосом
Права на озвучку и режим хранения запросов проверяйте отдельно. Создание голоса по чужой записи требует согласия диктора.
Готовое аудио. Условия позволяют использовать сгенерированное аудио и текст, в том числе в коммерческом продукте, при соблюдении закона и условий сервиса. Для BrandVoice права на исходные записи остаются у клиента, а права на модель у Яндекса.
Что происходит с материалом
Условия SpeechKit от 01.04.2026, политика AI Studio, справка заголовков и Brand Voice Lite; проверено 08.10.2026. Общая политика и описание API расходятся по умолчанию логирования.
Перед конфиденциальной записью. Не рассчитывайте на одно обещание «ничего не сохраняется»: уточните режим выбранного API или Playground и настройте логирование. Отключение записи запросов не удаляет уже созданные ресурсы и результаты операций.
Ограничения на загрузку. Условия требуют правовых оснований для передачи персональных данных и исключают охраняемую законом тайну, специальные категории и биометрические персональные данные. Запись чужого голоса сама по себе не даёт права создать его копию.
Граница нашей проверки. Мы прочитали условия и инструкции, просмотрели официальные кадры и нашли архивное демо со звуком. Генерацию, распознавание, клонирование и оплату в собственном аккаунте в этом срезе не выполняли.
7. Что выбрать под свою задачу
Выбирайте по способу работы: API в своём приложении, студия в браузере или модель на своём железе. Общее слово «озвучка» скрывает разные лицензии и расходы.
Соседи в голосе и музыке
SpeechKit, витрина ElevenCreative с помесячной оплатой, справка Suno и официальный репозиторий Silero; проверено 08.10.2026. Таблица сравнивает условия и задачи, а не качество голосов.
Речевое API для проекта в РФ. SpeechKit даёт прямую оплату в рублях и правила расхода по объёму. Начните с готового голоса, если создание собственного не окупается вашим потоком реплик.
Локальная работа. Русские модели распознавания и синтеза можно запускать на своём железе с PyTorch, в том числе на CPU. Общая лицензия моделей CC BY-NC; базовые CIS TTS-модели выпущены под MIT.
8. История
Последние вехи меняют способы использования SpeechKit: свой голос, клиентский SDK и новая модель синтеза. Они не означают, что старое демо показывает нынешний голос.
28.05
Появился Brand Voice Lite: создание своего голоса по записям и текстам.
21.01
Синтез SpeechKit добавлен в SDK Yandex AI Studio.
24.09
В API v3 появился LiveTTS с шестью новыми голосами; синтез доступен и через Realtime API.
История изменений синтеза SpeechKit; даты событий подтверждены 08.10.2026. Новые вехи подтягиваются из новостного фида автоматически.
9. Частые вопросы
Что такое Yandex SpeechKit?+
Преобразует текст в речь и аудиозапись в текст. Доступен через API и SpeechKit Playground в Yandex AI Studio. Голосовой диалог разбираем в главе о возможностях.
Сколько стоит Yandex SpeechKit и есть ли бесплатно?+
SpeechKit платный: отдельного постоянного бесплатного тарифа нет. API v1: 1 342 ₽ за 1 млн символов; general в API v3: 0,1626 ₽ за расчётную единицу, с НДС. Округления и свой голос разобраны в главе о цене.
Работает ли Yandex SpeechKit в РФ?+
Резиденты РФ платят в рублях. Для физических лиц предусмотрены карта банка РФ и СБП; для организаций и ИП также банковский перевод. Собственную оплату не выполняли; путь к первому файлу есть в главе о старте.
Yandex SpeechKit или ElevenLabs: что выбрать?+
Для прямого речевого API в рублях рассматривайте SpeechKit; для работы в студии есть ElevenLabs, развилка в таблице выбора. Облачная озвучка и расшифровка, студия и клонирование голоса. Free даёт 10 000 кредитов в месяц; коммерческая лицензия и Instant Voice Cloning указаны с платного Starter.
Как пользоваться SpeechKit онлайн без кода?+
Войдите в Yandex Cloud через Yandex ID, создайте платёжный аккаунт и выберите каталог. Для Playground нужны роли ai.playground.user и ai.datasets.editor или выше. В AI Speech выберите синтез, вставьте текст и нажмите «Синтезировать и воспроизвести»; инструкция в главе о старте.
Можно ли скачать SpeechKit и работать без облака?+
Отдельный SpeechKit Hybrid с аппаратной лицензией Yubikey может работать без интернета. Cloud Billing требует постоянной связи для метрик запросов, но содержимое текста и аудио остаётся в контуре пользователя. Цена Hybrid по запросу; начало разобрано в главе о старте.
Можно ли расшифровать запись встречи?+
Playground принимает MP3, WAV и OGG/OPUS до 60 МБ. Есть пунктуация, нормализация чисел, определение дикторов и дополнительная обработка результата текстовой моделью за отдельную плату. Для длинных записей доступен асинхронный API; его границы указаны в главе о возможностях.
Как сделать свой голос в Brand Voice Lite?+
Brand Voice Lite требует минимум 30 минут чистой речи, записи и точные расшифровки. Создание: 9 150 ₽ за один голос, разово; хостинг: 101 666 ₽ в месяц за первый голос, с НДС. Проба и архив разобраны в главе о цене.
Можно ли использовать озвучку в коммерческом видео?+
Условия позволяют использовать сгенерированное аудио и текст, в том числе в коммерческом продукте, при соблюдении закона и условий сервиса. Для BrandVoice права на исходные записи остаются у клиента, а права на модель у Яндекса. Согласие диктора и правила передачи данных разобраны в главе о доверии.
Источники
- SpeechKit: начало работы (проверено 08.10.2026) — первоисточник
- SpeechKit: модели синтеза (проверено 08.10.2026) — первоисточник
- SpeechKit: голоса general и LiveTTS (проверено 08.10.2026) — первоисточник
- Синтез речи в Playground (проверено 08.10.2026) — первоисточник
- Распознавание речи в Playground (проверено 08.10.2026) — первоисточник
- Условия SpeechKit, 01.04.2026 (проверено 08.10.2026) — первоисточник
- SpeechKit: правила тарификации (проверено 08.10.2026) — первоисточник
- SpeechKit: квоты и лимиты (проверено 08.10.2026) — первоисточник
- Brand Voice Lite: данные, согласие и статусы (проверено 08.10.2026) — первоисточник
- Yandex Cloud: оплата для резидентов РФ (проверено 08.10.2026) — первоисточник
- Официальный SDK Yandex AI Studio (проверено 08.10.2026) — первоисточник
- AI Studio: политика хранения данных (проверено 08.10.2026) — первоисточник
- AI Studio: отключение логирования (проверено 08.10.2026) — первоисточник
- SpeechKit: диагностические заголовки (проверено 08.10.2026) — первоисточник
- ElevenLabs: ElevenCreative, помесячная витрина (проверено 08.10.2026) — первоисточник
- Silero Models: запуск и лицензии (проверено 08.10.2026) — первоисточник
- Yandex Cloud: демонстрация BrandVoice, 29.09.2022 (проверено 08.10.2026) — официальное демо
- SpeechKit: история изменений синтеза (проверено 08.10.2026) — первоисточник
- Suno: права бесплатного плана (проверено 08.10.2026) — первоисточник
- Suno: тарифы (проверено 08.10.2026) — первоисточник
- Wordstat Search API v2: регион 225, срез 08.10.2026 (проверено 08.10.2026) — замер спроса
- SpeechKit Hybrid: назначение (проверено 08.10.2026) — первоисточник
- SpeechKit Hybrid: лицензирование и цена (проверено 08.10.2026) — первоисточник
- SpeechKit Hybrid: требования и получение контейнеров (проверено 08.10.2026) — первоисточник
- SpeechKit Hybrid: демонстрационный стенд (проверено 08.10.2026) — первоисточник
Что мы писали о Yandex SpeechKit
Полезно почитать перед стартом
- Озвучка текста: выбор по задаче и цене.
- ElevenLabs: студия и клонирование голоса.
- Suno: музыка и вокал вместо дикторской реплики.
