Содержание статьи +
- TL;DR
- Зачем это нужно
- Что на самом деле продаёт ElevenLabs
- Лестница цен 2026 года, тариф за тарифом
- Мгновенное и профессиональное клонирование голоса
- Как ElevenLabs борется со злоупотреблением
- NO FAKES Act – федеральное право на собственный голос
- EU AI Act, Статья 50 – раскрытие уже с датой
- Частая ошибка – считать галочку согласия юридической защитой
- Где здесь Фора Софт
- Как решить – пять вопросов
- Ключевые выводы
- Что почитать дальше
TL;DR
ElevenLabs – самый популярный коммерческий сервис синтеза речи и клонирования голоса. Цены 2026 года варьируются от бесплатного тарифа без права коммерческого использования до бизнес-плана за $990 в месяц, при этом для клонирования голоса практической точкой входа является тариф Creator. Клонирование бывает двух типов, которые нельзя путать: мгновенный клон, создаваемый по записи всего около 30 секунд, и профессиональный клон, требующий дообучения модели на примерно тридцати минутах аудио и включающий голосовую CAPTCHA – доказательство подлинности голоса. Два новых закона определяют, что можно строить на основе этой технологии: предложенный в США NO FAKES Act, который ввёл бы федеральное право на голос и систему уведомлений и удалений, и статья 50 EU AI Act, вступающая в силу с 2 августа 2026 года и обязывающая маркировать и раскрывать аудио, сгенерированное с помощью ИИ. В статье рассматриваются цены, механизм клонирования, а также инженерные подходы к получению согласия и обеспечению прозрачности, необходимые для того, чтобы голосовая функция была легальной, а не превратилась в юридический риск.
Зачем это нужно
Если ваш продукт читает текст вслух, дублирует видео или даёт пользователю услышать собственный синтезированный голос, вы почти наверняка будете оценивать ElevenLabs и должны ответить на три вопроса до первой строки кода. Сколько это будет стоить на вашем реальном объёме? Что вам легально клонировать и как доказать наличие разрешения? И что вы обязаны раскрыть слушателю и регулятору? Эта статья для продакт-менеджера, основателя или техлида, принимающего решение build-or-buy по синтетическому голосу. К концу вы поймёте полную лестницу цен 2026 года и где она кусается, разницу между мгновенным и профессиональным клоном и согласие, которого требует каждый из них, и два регуляторных режима – один американский и предложенный, другой европейский и уже с датой, – которые превращают «мы клонировали голос» либо в фичу, либо в иск.
Что на самом деле продаёт ElevenLabs
Начнём с продукта, потому что цены имеют смысл только тогда, когда понятно, за что вы платите. ElevenLabs – это компания, которая с помощью моделей машинного обучения превращает текст в озвучку; такая задача называется синтезом речи, или text-to-speech (TTS) по-английски. Кроме того, компания занимается более сложной задачей – клонированием голоса: она создаёт синтетическую копию голоса конкретного человека, чтобы любые новые фразы звучали именно этим голосом. Представьте простой синтез речи как найм обычного диктора, а клонирование голоса – как найм имитатора, способного произнести что угодно, но голосом определённого человека.
Сам голос генерирует модель, и ElevenLabs предлагает несколько вариантов. На начало 2026 года флагманской является модель v3, выпущенная в том же году и заметно лучше передающая эмоции по сравнению с предыдущими версиями. Рядом с ней – более быстрые и дешёвые модели Flash и Turbo, предназначенные для работы в реальном времени, где задержка в полсекунды портит впечатление (ElevenLabs, 2026). Запоминать названия моделей не обязательно. Главное – понимать, что качество, скорость и цена взаимосвязаны: чем выразительнее модель, тем дороже она обходится в расчёте на символ; быстрая модель стоит дешевле и отвечает быстрее.
Всё, что вы генерируете, измеряется в кредитах. Кредит – это единица потребления в ElevenLabs, и для стандартных мультиязычных моделей правило простое: один символ текста – буква, пробел или знак препинания – равен одному кредиту (ElevenLabs Help Center, 2026). Быстрые модели Flash и Turbo стоят дешевле – пол-кредита за символ (ElevenLabs Help Center, 2026). Каждый тариф выдаёт кредиты, а не доллары, поэтому вопрос цены сводится к одному: «Сколько кредитов я получаю и сколько мой продукт расходует». Переведите кредиты в символы, а затем в минуты аудио – и только после этого сравнивайте тарифы. Почти любая ошибка в смете начинается с того, что большое число кредитов воспринимают как количество слов.
Лестница цен 2026 года, тариф за тарифом
ElevenLabs предлагает в 2026 году семь тарифных планов – от бесплатного до индивидуального корпоративного контракта. Цены приведены по данным официальной страницы тарифов компании за май 2026 года – это первоисточник; сторонние блоги зачастую используют устаревшие цифры (ElevenLabs, 2026). Таблица – это карта. Читайте её как последовательность кредитов и возможностей, а не только цен: здесь важнее не скачок цены, а расширение прав.
| Тариф | Цена/мес | Кредитов/мес | ~Минут TTS | Клонирование / доп. | Коммерч. использование |
|---|---|---|---|---|---|
| Free | $0 | 10 000 | ~10 мин | Нет | Нет |
| Starter | $6 | 30 000 | ~30 мин | Мгновенный клон | Да |
| Creator | $22* | 121 000 | ~121 мин | + Профессиональный клон | Да |
| Pro | $99 | 600 000 | ~600 мин | Профессиональный клон | Да |
| Scale | $299 | 1 800 000 | ~1 800 мин | + 3 места, 3 PVC | Да |
| Business | $990 | 6 000 000 | ~6 000 мин | + 10 мест, 10 PVC | Да |
| Enterprise | индивид. | индивид. | индивид. | + HIPAA BAA, SSO | Да |
Источник: страница цен ElevenLabs, считана 2026-05-31. *Creator: первый месяц – $11, далее – $22. ~1 000 кредитов ≈ 1 минута (Multilingual); модели Flash и Turbo стоят ~полкредита за символ; годовая оплата экономит ~2 месяца. Где сторонние блоги приводили иные цифры (Starter $5, Creator 100k, Scale $330 / 2M, Business $1,320 / 11M), приоритет у страницы вендора, а эти вторичные значения отброшены.
Две строки этой таблицы заслуживают пристального внимания, потому что именно они определяют команды.
Первая ловушка – бесплатный тариф. Он даёт 10 000 кредитов в месяц – примерно десять минут речи – и действительно полезен для прототипа, но не предоставляет ни коммерческих прав, ни возможности клонировать голос, а любой публичный контент должен содержать упоминание ElevenLabs (ElevenLabs, 2026). На нём нельзя легально монетизировать сгенерированный контент. Самый дешёвый тариф, разрешающий коммерческое использование аудио, – Starter за 6 долларов в месяц, и именно на этом уровне продукт переходит в разряд реально пригодных для бизнеса.
Вторая ловушка – план Creator. Это первый тариф, который открывает доступ к профессиональному клонированию и версии высокого качества, и именно его, по данным ключевых запросов, чаще всего ищут после самого названия бренда (ElevenLabs, 2026). План Starter, находящийся на ступеньку ниже, предоставляет лишь менее точный мгновенный клон. Таким образом, практическая точка входа для серьёзной голосовой функции – план Creator, а не Starter; эту разницу стоит учесть в бюджете, чтобы избежать удивления.
Разбор примера – во что реально обходятся 200 минут в месяц
Числа делают это конкретным. Допустим, ваш продукт озвучивает статьи и генерирует 200 минут речи в месяц на стандартной мультиязычной модели. Проще всего посчитать стоимость по тарифу pay-as-you-go в API: $0.10 за 1 000 символов. При примерно 150 словах в минуту и шести символах на слово:
200 минут × 150 слов/минуту = 30 000 слов в месяц
30 000 слов × 6 символов/слово = 180 000 символов в месяц
180 000 символов ÷ 1 000 = 180 единиц по тысяче символов
180 единиц × $0.10 = около $18 в месяц, по APIТеперь сравните это с подпиской. План Creator включает 121 000 кредитов – примерно 121 минуту – за 22 доллара в месяц после первого месяца, так что 200 минут его превысят и подтолкнут к плану Pro за 99 долларов за 600 000 кредитов, большую часть которых вы не используете:
План Pro: $99 за ~600 минут → 200 использовано, ~400 в запасе (много отходов)Для такого объёма pay-as-you-go API (~$18) выгоднее, чем перерасход по тарифу Creator, и дешевле, чем переход на Pro ($99). Вывод простой: подписка подходит для стабильного и предсказуемого потребления, а API – для разового или неравномерного использования. Чтобы принять решение, смоделируйте реальные месячные минуты, переведите их в символы и сравните стоимость API с самой дешёвой подпиской, которая покрывает ваш объём – оптимальный выбор зависит от нагрузки. Переход на более быструю модель Flash снижает стоимость символа вдвое ($0.05 за 1 000) и снова меняет точку безубыточности.
Мгновенное и профессиональное клонирование голоса
Клонирование голоса в ElevenLabs – это не одна функция, а две, и путаница между ними – самая частая ошибка при планировании, которую мы наблюдаем. Они различаются по объёму необходимого аудио, времени обработки, качеству результата и – что особенно важно с точки зрения закона – по степени защиты от клонирования без разрешения.
Мгновенный клон голоса, или Instant Voice Clone (IVC) – это быстрый и простой способ. Он создаёт пригодную копию голоса всего по ~30 секундам чистого аудио, а сам процесс занимает несколько секунд (ElevenLabs voice cloning, 2026). Почему он называется «мгновенным» – стоит объяснить: технология использует few-shot-адаптацию, передавая вашу запись модели как живой образец прямо в момент синтеза – «звучи как вот это» – без необходимости переобучения. Представьте талантливого пародиста, который, услышав короткий отрывок, тут же начинает точно его воспроизводить. Такой функционал доступен уже с тарифа Starter за $6.
Однако есть и ограничения, вытекающие из самого механизма: качество ограничено одним образцом, поэтому фоновый шум может просачиваться; клон хуже справляется с передачей эмоций, сильно отличающихся от тех, что были в исходной записи; и проверка согласия здесь минимальна – вы просто подтверждаете, что имеете право клонировать этот голос, и этого достаточно (ElevenLabs voice cloning, 2026).
Профессиональный клон голоса, или на английском Professional Voice Clone (PVC), – это вариант высокой точности, работающий по иному принципу. Вместо того чтобы использовать ваше аудио как подсказку в момент речи, PVC дообучает модель – фактически подстраивает её внутренние параметры, чтобы максимально точно передать целевой голос, как актёр, изучающий материал часы напролёт, пока не сможет сыграть человека в любом настроении (ElevenLabs voice cloning, 2026). Для этого требуется около тридцати минут качественного аудио: важнее не продолжительность, а качество записи, поскольку любые дефекты «впечатываются» в настройки модели. Процесс сборки занимает минуты, а не секунды. Для работы с PVC нужен тариф Creator за $22 или выше – он отражает объём вычислительных ресурсов, которые потребляет система.
Прежде чем продолжить, ElevenLabs заставляет пользователя пройти голосовую CAPTCHA: приложение выводит текст, и вы должны прочитать его вслух в отведённое время. Затем система сравнивает эту живую запись с загруженными образцами и подтверждает, что голос действительно принадлежит вам (ElevenLabs voice cloning, 2026). Эта запись чтения вслух – это инженерное решение, встроенное в продукт: оно сильно усложняет клонирование чужого голоса по украденному аудио, поскольку злоумышленнику пришлось бы воспроизвести голос вживую по требованию.
Практическая маршрутизация ясна. Используйте мгновенный клон для низкорисковых, высокообъёмных и быстрых задач – пользователь слушает превью собственного голоса, быстрый черновик озвучки. Используйте профессиональный клон для голоса, на который опирается продукт – фирменный диктор, именованный ведущий, повторяющийся персонаж, – где и точность, и более сильная проверка окупаются. И в любом случае галочка согласия и CAPTCHA – это ElevenLabs, защищающая себя; они не снимают с вас юридическую обязанность иметь разрешение, о чём следующие разделы.
Как ElevenLabs борется со злоупотреблением
До принятия закона у платформы есть собственная политика, и она строже, чем ожидают большинство команд. ElevenLabs применяет несколько уровней защиты от злоупотребления голосом, и понимание этих мер помогает понять, что можно создавать, а что – нет (ElevenLabs safety, 2026; ElevenLabs use policy, 2026).
Первый слой – уже описанная голосовая CAPTCHA, которая блокирует профессиональное клонирование, требуя живое чтение вслух. Второй – автоматическая блокировка высокорисковых голосов: платформа обнаруживает и отклоняет попытки клонирования знаменитостей, политиков и других публичных лиц, проявляя повышенную бдительность в отношении политических фигур во время выборов, чтобы предотвратить создание фальшивого предвыборного аудио (ElevenLabs safety, 2026). Третий – постоянная модерация контента: комбинация ИИ-классификаторов, модераторов-людей и внутренних расследований, следящих за нарушениями Политики запрещённого использования (ElevenLabs safety, 2026). Поверх этого может применяться живая модерация, ограничивая использование голоса определёнными категориями контента.
Сама Политика запрещённого использования блокирует очевидный вред: выдачу себя за человека с целью мошенничества, подавление избирателей, имитацию политических кандидатов или чиновников – независимо от наличия авторизации – а также иные обманные или вредоносные применения (ElevenLabs use policy, 2026). Для команды продукта вывод таков: ElevenLabs не станет добровольным соучастником клонирования публичных фигур или политической имитации, и любая функция, основанная на этом, столкнётся с отказом на этапе модерации, а не только в суде.
Есть и конструктивная сторона. ElevenLabs поддерживает Voice Library – библиотеку, где владельцы голосов могут размещать свои голоса и получать выплаты за их использование другими. Это маркетплейс, превращающий согласие в источник дохода, а не в формальную галочку (ElevenLabs payouts, 2026). Если вашему продукту нужен уникальный голос, а клонировать нечего, лицензирование из этой библиотеки – прямой путь: согласие и вознаграждение берёт на себя платформа.
NO FAKES Act – федеральное право на собственный голос
Теперь о законе. Наиболее значимый американский законопроект, касающийся всех, кто создаёт голосовые функции, – это NO FAKES Act (Nurture Originals, Foster Art, and Keep Entertainment Safe Act). Он был внесён в Сенат как S.1367 и в Палату представителей как H.R.2794 в 119-м Конгрессе, а затем повторно представлен в апреле 2025 года после того, как версия 2024 года застряла на рассмотрении (Congress.gov S.1367, 2025; Coons, 2025). По состоянию на май 2026 года это всё ещё законопроект, а не закон, но он даёт самый чёткий сигнал о направлении развития регулирования в США. Его поддерживают несколько крупных технологических и развлекательных компаний – SAG-AFTRA, RIAA, OpenAI, Google, Disney, Adobe (Coons, 2025).
Законопроект установил бы первое в истории федеральное право на голос и визуальный облик человека – то, что автор называет цифровой копией (digital replica) (Manatt, 2025). Под цифровой копией в формулировке законопроекта понимается новое, сгенерированное компьютером, крайне реалистичное изображение, легко узнаваемое как голос или внешний облик конкретного человека (Congress.gov S.1367, 2025). Сегодня возможность оспорить использование несанкционированного клона голоса зависит от разрозненной системы законов штатов о праве на публичность; NO FAKES Act задал бы единый национальный стандарт.
Механизм, наиболее важный для команды продукта, – система уведомления и удаления (notice-and-takedown), построенная по образцу режима удаления по авторскому праву, с которым платформы уже знакомы благодаря DMCA (Manatt, 2025). Законопроект не обязывает онлайн-сервисы проактивно сканировать контент на предмет несанкционированных копий. Вместо этого хостинг-платформа, размещающая пользовательский контент, получает безопасную гавань – защиту от ответственности – при условии, что оперативно удаляет нарушающий материал после получения корректного уведомления, зарегистрировала уполномоченного агента в Бюро авторских прав США и внедрила политику блокировки повторных нарушителей (Manatt, 2025). Это та же модель, что и в случае с безопасной гаванью по авторскому праву, так что если ваша платформа уже работает с DMCA, нужные шаблоны у вас уже есть.
Штрафы – вот почему это не сноска. Законопроект предусматривает штраф в размере 5000 долларов за каждое нарушение, причём каждая созданная, переданная или показанная копия считается отдельным нарушением – так что один вирусный ролик быстро накапливает штрафы (Wikipedia NO FAKES, 2026; GovTrack S.1367, 2025). Чтобы сбалансировать эту меру, отправка ложного уведомления об удалении также влечёт штраф – в размере более 25 000 долларов или реального ущерба, в зависимости от того, что больше, – что должно предотвратить злоупотребления системой удаления (GovTrack S.1367, 2025). Законопроект также устанавливает посмертные права: право на голос сохраняется после смерти и управляется через систему регистрации в Бюро авторских прав, – при этом он не отменяет законы штатов, действовавшие на 1 января 2025 года, так что такие законы, как ELVIS Act в Теннесси, продолжают действовать параллельно (GovTrack S.1367, 2025).
У него есть и критики. Цифровые правозащитные организации, включая EFF и FIRE, предупреждают, что новое широкое право на контроль над образом может подавить законную свободу слова – пародию, критику, журналистику – и законопроект частично пересмотрели в ответ (EFF, 2024). Для ваших целей разумная стратегия – проектировать системы так, будто обязательства по уведомлению и удалению, а также жёсткое требование согласия уже вступили в силу, поскольку направление изменений очевидно, даже если окончательный текст закона ещё не принят.
EU AI Act, Статья 50 – раскрытие уже с датой
Если NO FAKES Act – это будущее, к которому стоит готовиться, то Статья 50 EU AI Act – это дедлайн, который нельзя игнорировать: её требования к прозрачности вступают в силу 2 августа 2026 года (EU AI Act Article 50, 2026). В отличие от норм, касающихся высокорисковых систем, изложенных в других частях Акта, Статья 50 распространяется на любую генеративную ИИ-систему, включая инструменты синтеза аудио (EU AI Act Article 50, 2026).
Статья 50 распределяет ответственность между двумя ролями. Если вы провайдер – то есть разработчик системы генерации, как, например, ElevenLabs, – вы обязаны обеспечить, чтобы синтетическое аудио на выходе было размечено в машиночитаемом формате и однозначно идентифицировалось как искусственное, например, с помощью встроенного сигнала происхождения или цифрового водяного знака (EU AI Act Article 50, 2026). Если вы деплойер – то есть тот, кто использует такую систему для создания дипфейков и распространения их среди аудитории, что зачастую и есть ваша роль, – вы должны раскрыть людям, что контент был искусственно сгенерирован или изменён (EU AI Act Article 50, 2026).
Есть ограниченные исключения. Если контент явно художественный, сатирический или вымышленный, обязанность раскрытия смягчается – достаточно ненавязчивого уведомления, которое не портит произведение, а правоохранительные органы при этом не могут требовать дополнительных доказательств (EU AI Act Article 50, 2026). Кодекс практики, описывающий, как именно маркировать и помечать контент, к началу 2026 года находился во второй редакции, а финальная версия ожидалась около июня 2026 года – как раз перед августовским дедлайном (EU AI Act Article 50, 2026; Jones Day, 2026). Для продукта, ориентированного на пользователей в ЕС, инженерные последствия следующие: внедрите поверхность раскрытия – видимую метку, устное или письменное уведомление «сгенерировано ИИ» – в любую функцию, выдающую клонированный или синтетический голос, и полагайтесь на машиночитаемую разметку провайдера для половины контента с известным происхождением.
Частая ошибка – считать галочку согласия юридической защитой
Самая вредная ошибка, которую мы видим, – команда считает, что, поставив галочку «я имею право клонировать этот голос» на платформе ElevenLabs, выполнила свою юридическую обязанность. Это не так. Эта галочка защищает ElevenLabs в соответствии с её собственными условиями; она не даёт вам разрешения, которое закон требует от самого человека, чей голос вы клонировали. Если вы клонируете голос сотрудника для внутреннего обучающего видео, а он позже выразит возражение, или если вы используете голос фриланс-диктора без пункта о синтетическом переиспользовании, галочка на платформе – не защита.
Решение – сделать согласие записью, а не кликом. Для каждого голоса, который вы клонируете, фиксируйте и храните явное, письменное, ограниченное по объёму разрешение от человека: какой именно голос, для каких целей, на какой срок и с правом отзыва. Относитесь к этому как к подписанному релизу модели в фотографии. Если есть контракт – с диктором, ведущим, сотрудником – добавьте в него чёткий пункт о синтетической генерации голоса, допустимых применениях и вознаграждении, потому что общий релиз на использование образа, составленный до появления технологий клонирования голоса, почти никогда не покрывает такие случаи. Такая запись согласия – это и то, что позволяет вам спокойно реагировать на уведомления об удалении в стиле NO FAKES: вы показываете разрешение, а не оправдываетесь.
Где здесь Фора Софт
Мы интегрируем голосовые функции в видеопродукты наших клиентов, и выбор голосового движка, а также проектирование механизма согласия вокруг него – почти всегда возникают в процессе. Мы внедряли синтетические и клонированные голоса в e-learning-курсы, где требуется единый диктор на сотни уроков, в телемедицинские инструменты, озвучивающие инструкции, в OTT-платформы, автоматически дублирующие контент, и в видеоконференц-системы, озвучивающие субтитры в реальном времени. Основной вывод: модель – это лёгкая часть. Сложнее – инженерная инфраструктура вокруг: расчёт стоимости на основе реального месячного трафика, а не заявленной цены, выбор между мгновенным и профессиональным клонированием в зависимости от сценария, фиксация и хранение ограниченного согласия, чтобы оперативно реагировать на запросы об удалении, и построение прозрачного раскрытия «сгенерировано ИИ», которое теперь требует Статья 50 для аудитории в ЕС. Мы проектируем слой согласия и раскрытия в первую очередь, а движок подбираем позже, потому что голосовая функция, не способная подтвердить разрешение, – это риск, какой бы качественной ни была её реализация.
Как решить – пять вопросов
Решение сводится к пяти вопросам, которые нужно рассмотреть по порядку.
Первый: вам нужен голос конкретного человека или просто хороший голос? Если подойдёт любой естественно звучащий диктор – пропустите клонирование и используйте стоковый голос или голос из библиотеки. Он будет дешевле, быстрее и не потребует согласия.
Второй: каков ваш реальный месячный объём в минутах? Оцените его, переведите в символы и сравните стоимость API-тарифов с самой дешёвой подпиской, которая полностью покрывает ваш объём. Оптимальный выбор зависит от объёма – модель Flash может сместить точку безубыточности.
Третий: мгновенный или профессиональный клон? Мгновенный – для низкорисковых, быстрых и высоконагруженных превью; профессиональный – для голоса, на котором держится продукт, где важны и точность, и проверка голосовой CAPTCHA.
Четвёртый: можете ли вы доказать согласие? Для каждого клонированного голоса сохраняйте явное письменное ограниченное разрешение от человека, а также включайте пункт о синтетическом голосе в любой контракт. Галочка на платформе – недостаточно.
Пятый: обслуживаете ли вы пользователей ЕС или ждёте ужесточения правил США? Если да, постройте поверхность раскрытия для Статьи 50 уже сейчас и спроектируйте хостинг под уведомление-и-удаление в стиле NO FAKES, чтобы соответствие было фичей, которая у вас уже есть, а не пожарной тревогой позже.
Ключевые выводы
- У бесплатного тарифа ElevenLabs отсутствуют коммерческие права; реальная отправная точка – тариф Starter ($6), а полноценное клонирование голоса доступно только на уровне Creator.
- Расчёт ведётся в кредитах, а не в долларах: переведите кредиты в символы и минуты, после чего сравните стоимость API с самой выгодной подходящей подпиской.
- Для создания мгновенного клона требуется около 30 секунд и простое подтверждение; профессиональный голос дообучается примерно 30 минут и включает записанную голосовую CAPTCHA.
- Платформа блокирует использование голосов знаменитостей и политиков, а также проводит модерацию контента – проектирование решений под такие сценарии невозможно.
- Закон NO FAKES Act установил бы федеральное право на голос с штрафом в $5 000 за незаконное копирование и механизмом уведомления и удаления, аналогичным DMCA.
- Статья 50 EU AI Act, вступающая в силу с 2 августа 2026 года, обязывает маркировать и раскрывать аудиоконтент, созданный с помощью ИИ.