Перейти к содержимому
Инструменты

Лицензия TTS для коммерческого использования — 6 моделей

Коротко

Что это меняет

Половина популярных локальных TTS запрещает коммерческое использование прямо в тексте лицензии, а правка кода этого не отменяет. Если вы уже продали озвучку, сделанную на XTTS-v2 или на некоммерческих весах Silero, вы нарушили условия

Что сделать

Что сделать: Откройте файл LICENSE у каждой модели, которая стоит у вас локально, и сверьте лицензию весов отдельно от лицензии кода. На всё уходит около десяти минут

Лицензия TTS для коммерческого использования — 6 моделей

Лицензия TTS для коммерческого использования решается не в README, а в файле LICENSE. У Silero таких файлов два, они разные, и лежат в одном репозитории.

Дальше — что разрешают шесть моделей, которые чаще всего ставят локально, и почему «я поменял пару строк кода, теперь это моё» не работает ни в одной юрисдикции.

Почему правка кода ничего не меняет

Открытая лицензия — это договор, а не отсутствие правил. Вы получаете права на использование при выполнении условий, и модификация из-под этих условий не выводит: производная работа наследует лицензию исходной. GPL-3.0 требует открывать производные на тех же условиях. Некоммерческие лицензии запрещают зарабатывать на модели и её выводе. Правка кода не отменяет ни того, ни другого — она просто добавляет вам роль автора производной работы.

Отдельно держите в голове, что у модели обычно две разные лицензии: одна на код, другая на веса. Пример из жизни: код F5-TTS открыт, а русский чекпойнт hotstone228/F5-TTS-Russian выложен под CC BY-NC-SA 4.0 — то есть без коммерции и с обязательством распространять производные на тех же условиях.

Лицензия TTS для коммерческого использования у шести моделей

  • Silero. В репозитории два файла. Основной LICENSE — CC BY-NC-SA 4.0, некоммерческое использование. А LICENSE_CIS — это MIT, и он покрывает модели v5_cis_base и v5_cis_base_nostress. При этом модели v5_cis_ext идут под CC-NC-BY. Три разных режима в одном проекте: какой у вас — зависит от того, какую строку вы вписали в silero_tts().
  • XTTS-v2. Coqui Public Model License 1.0.0. Формулировка в первой же строке: лицензия разрешает только некоммерческое использование модели и её вывода. Там же отдельно оговорено, что обучение других моделей для коммерческого применения некоммерческой целью не считается. Компания Coqui закрылась, спросить не у кого — условия остались.
  • IndexTTS-2. Лицензионное соглашение bilibili. Использование бесплатное, но с порогами: если у вас или у аффилированных лиц больше 100 млн активных пользователей в месяц либо годовая выручка выше 1 млрд юаней, нужна отдельная лицензия. Плюс прямой запрет на высокорисковые сценарии — медицинская диагностика, автономное вождение, биометрический надзор, автоматические решения по кредитам и найму. Право КНР, арбитраж в Шанхае.
  • Qwen3-TTS. Apache-2.0. Коммерческое использование разрешено, требуется сохранение уведомлений. Это самая свободная лицензия среди моделей с русским в списке языков.
  • Kokoro-82M. Оригинал под Apache-2.0, но заявленный язык там один — английский. Русские варианты — это сторонние форки, и лицензия у них своя: у zaakirio/kokoro-ru стоит OpenRAIL, а это лицензия с ограничениями по сценариям использования, а не «делайте что хотите».
  • Piper. Код движка — GPL-3.0. Голоса лежат отдельным репозиторием, и условия у каждого свои. В карточке голоса denis medium указана лицензия датасета CC0, но отдельной лицензии на сами веса в карточке нет. Для внутреннего использования это неважно, для продажи озвучки — важно, и уточнять надо у мейнтейнеров.

Признаки, что модель нельзя пускать в коммерцию

  • В теге лицензии на Hugging Face есть буквы nc: cc-by-nc-4.0, cc-by-nc-sa-4.0. NC — это non-commercial, обсуждать нечего.
  • Лицензия называется именем компании, а не стандартной аббревиатурой. Значит, это самописный текст с собственными условиями, и его надо читать целиком.
  • В тексте встречаются пороги по выручке или числу пользователей. Сегодня вы под них не подпадаете, но условие остаётся в силе.
  • Лицензия кода и лицензия весов в проекте разные. Считайте по весам — именно они генерируют ваш продукт.
  • Вы взяли форк, а лицензию смотрели у оригинала. Форк может ужесточить условия, и часто ужесточает.
  • Модель под GPL, а вы встраиваете её в закрытый сервис. Это отдельный разговор с юристом, а не «ну там же опенсорс».

Голос человека: что сейчас происходит в праве

Сразу оговорюсь: я не юрист, и ниже — только факты по документам, а не консультация.

Отдельной нормы про голос в Гражданском кодексе пока нет. В Госдуму внесён законопроект № 718834-8 о внесении изменений в часть первую ГК — он предлагает новую статью 152.3 и охрану голоса как объекта личных неимущественных прав. Смысл: обнародование и дальнейшее использование голоса гражданина допускается только с его согласия, по аналогии с действующей статьёй 152.1 об охране изображения.

Правительство законопроект не поддержало — об этом сообщал «Интерфакс» 20 января 2025 года. Текущий статус рассмотрения я на момент публикации не проверил: карточка законопроекта на сайте системы обеспечения законодательной деятельности мне не открылась. Если вы строите бизнес на клонировании чужих голосов, это первое, что стоит перепроверить самому и с юристом.

Практический вывод простой. Лицензия модели и права на голос — две независимые проблемы. Apache-2.0 у движка не даёт вам ни одного права на тембр конкретного человека, будь это актёр дубляжа, политик или ваш собственный сотрудник, который увольняется через месяц.

Что сделать сейчас

  1. Выпишите модели, которые уже стоят у вас на машине или на сервере. Для каждой откройте файл LICENSE в репозитории и на Hugging Face — это два разных места, и они иногда расходятся.
  2. Отдельно проверьте лицензию весов и лицензию кода. Если расходятся, ориентируйтесь на более строгую.
  3. Сохраните копию текста лицензии с датой скачивания. Условия меняются между версиями, а доказывать придётся вам.
  4. На клонирование любого чужого голоса возьмите письменное согласие с прямым указанием синтеза речи. Устная договорённость с диктором тут не работает.
  5. Если нужен коммерчески чистый вариант прямо сегодня — смотрите в сторону Apache-2.0 и MIT: это Qwen3-TTS и модели Silero из набора v5_cis_base. Как поднять их локально, я показывал в разборе про локальный синтез речи на русском без видеокарты и в материале про клонирование голоса локально без обучения.

Источники