Содержание статьи +
- TL;DR
- Зачем это нужно
- Что на самом деле значит «потоковый» для речи
- Время до первого аудио – вот та самая цифра
- Два способа получить голос: хостить или арендовать
- Знакомство с четырьмя движками
- Сравнение 2026 года, бок о бок
- Разбор на примере – во что обходится голосовой агент в месяц
- Как устроен поток – чанки, предложения и сокеты
- Частая ошибка – оптимизировать модель, игнорируя конвейер
- Где здесь Фора Софт
- Как выбирать – пять вопросов
- Ключевые выводы
- Что почитать дальше
TL;DR
Потоковый синтез речи превращает текст в звук, который начинает воспроизводиться ещё до завершения полной обработки предложения – только так машинный голос может вести живой диалог без длительных пауз. Ключевой показатель, определяющий, звучит ли речь естественно, – это time-to-first-audio: задержка между отправкой текста и появлением первого звука. Примерно 300 миллисекунд разделяют «разговорный» стиль от «роботизированного». Четыре сервиса, рассмотренные в статье, делятся на две группы: бесплатная модель с открытыми весами, которую вы развертываете самостоятельно (Kokoro), и три платных API, которые вы используете по подписке (ElevenLabs Turbo и Flash, Cartesia Sonic и OpenAI TTS). Каждый из них по-своему балансирует скорость, качество, поддержку языков и стоимость. В статье объясняется, как работает потоковый TTS, какие реальные значения задержки и цены актуальны в 2026 году, и как выбрать между развёртыванием open-модели и использованием быстрого API.
Зачем это нужно
Если ваш продукт отвечает голосом – будь то ассистент встреч, читающий резюме, языковой репетитор, голосовой агент поддержки, дубляж видео или озвучка для незрячих – выбор движка синтеза речи становится ключевым. Он сразу определяет задержку, стоимость и уровень приватности. Эта статья для продакт-менеджера, основателя или техлида, который стоит перед выбором: использовать open-source голосовую модель на собственной инфраструктуре или воспользоваться платным хостинговым API. К концу вы поймёте, почему метрика «первый звук менее чем за 300 миллисекунд» так важна, как четыре ведущих решения 2026 года сравниваются по скорости и цене, в чём ловушка измерения неправильной задержки, и получите чёткое правило: когда бесплатное, но самохостингованное решение оказывается выгоднее платного, но управляемого. Цель – помочь вам прийти к вендору с правильными вопросами, а не поддаваться на один блестящий показатель.
Что на самом деле значит «потоковый» для речи
Начнём с проблемы, которую решает потоковая обработка. Движок синтеза речи – программа, превращающая текст в звуковую запись, сокращённо TTS (text-to-speech) – может работать двумя способами. Простой: взять всё предложение, сгенерировать полный аудиоклип и выдать его, когда он готов. Потоковый: начать передавать звук, как только готовы первые несколько слов, пока остальное ещё синтезируется.
Разница – как чайник и кран. Непотоковый движок – это чайник: вы ждёте, пока всё вскипит, и только потом наливаете. Потоковый – это кран: вода течёт сразу, как только вы его открыли, и не останавливается. Для записанной заранее аудиокниги чайник подойдёт – никто не ждёт в реальном времени. А в диалоге задержка от «чайника» ощущается так, будто связь оборвалась, и тут нужен именно «кран».
Почему это так важно? Потому что у разговора есть ритм. Когда один человек замолкает, другой обычно начинает говорить примерно через две десятых секунды (Gradium, 2026). Этот интервал – около 200 миллисекунд, где миллисекунда – это одна тысячная секунды, – настолько стабилен в разных языках, что любое более длительное ожидание воспринимается ухом как пауза. Если голосовому агенту требуется целая секунда, чтобы начать отвечать, диалог перестаёт быть диалогом и превращается в телефонное меню.
Потоковость возвращает это время. Вместо ожидания полной генерации ответа слушатель слышит первые слова, пока движок ещё обрабатывает конец предложения. Звук воспроизводится в естественном темпе – около 150 слов в минуту – и пока движок генерирует быстрее, чем ухо воспринимает, слушатель не замечает пауз.
Время до первого аудио – вот та самая цифра
Есть одна метрика, которая определяет, насколько потоковый голос воспринимается как отзывчивый, и её легко спутать с другими. Правильная метрика – time-to-first-audio, сокращённо TTFA: время между отправкой текста и появлением первого фрагмента звука (Gradium, 2026). Именно эта часть задержки ощущается слушателем, потому что как только приходит первый фрагмент, начинается воспроизведение, а движок продолжает работать, чтобы оставаться впереди восприятия.
Метрика, которую часто используют вместо неё, – time-to-first-byte, сокращённо TTFB: время до получения первых данных. Проблема в том, что эти первые байты зачастую вовсе не содержат звука. Аудиофайлы начинаются с заголовка – небольшого блока служебных данных, в котором указано: «это WAV-файл, вот его частота дискретизации» – и этот заголовок не несёт речевой информации. Сервис может отправить заголовок за пару миллисекунд и выглядеть молниеносным на графике TTFB, тогда как первый реально слышимый сэмпл придёт намного позже (Gradium, 2026). TTFB поощряет не то. Всегда требуйте time-to-first-audio, измеренное после отбрасывания заголовка.
Насколько быстро – достаточно быстро? Независимые бенчмарки 2026 года сходятся к простому правилу: задержка менее 300 миллисекунд по TTFA воспринимается как естественная; менее 200 – отлично; выше 400 уже ощущается как ожидание (Gradium, 2026). И помните: TTS находится в конце цепочки – в голосовом агенте система сначала слушает (speech-to-text), потом обрабатывает запрос (языковая модель), и только потом отвечает (TTS). Каждая миллисекунда задержки TTS накладывается на всё предыдущее, поэтому жёсткий лимит на TTS оставляет пространство для остальных компонентов.
Почему стабильность важна не меньше, чем скорость
Средняя скорость прячет вторую проблему: насколько она стабильна. Типичный подход – измерять медиану, обозначаемую P50: значение, которое превышает половина запросов. Но инженеры также следят за разбросом, который часто оценивают через межквартильный размах (IQR) – разницу между быстрым и медленным квартилями. Низкая медиана при широком разбросе означает, что большинство вызовов выглядят быстрыми, но значительная часть – медленными. А на масштабе тысяч одновременных запросов «значительная часть» – это уже много недовольных пользователей.
Данные 2026 года это подтверждают. ElevenLabs Turbo v2.5 показывает медианное время отклика 264 миллисекунды при узком разбросе – всего 28 миллисекунд, – поэтому почти каждый запрос ощущается одинаково (Gradium / Coval, 2026). Cartesia Sonic-3 быстрее по медиане – 188 миллисекунд, – но её разброс составляет 100 миллисекунд, что втрое шире, и из-за этого значительная доля запросов попадает за черту в 300 миллисекунд, попадая в «медленную» зону (Gradium / Coval, 2026). Скорость и стабильность – это разные вещи. Оценивайте обе.
Два способа получить голос: хостить или арендовать
Любое решение для потокового TTS сводится к одному выбору: можно развернуть open-weights модель – скачать файл модели, запустить на своём железе и платить только за него, – или использовать хостинговый API, где вендор всё делает сам и берёт плату за каждый символ текста. Четыре рассмотренных варианта статьи идеально ложатся на эту дилемму: Kokoro – это «разверни сам», ElevenLabs, Cartesia и OpenAI – это «используй API».
«Open-weights» означает, что обученные веса модели опубликованы и любой может их скачать и запустить. Kokoro идёт дальше: её веса распространяются под лицензией Apache 2.0 – разрешительной open-source лицензией, позволяющей коммерческое использование без платы за применение и без требования раскрывать собственный код (hexgrad, 2026). В этом и заключается её суть. Как только модель работает на вашем сервере, генерация миллиона символов речи обходится лишь в стоимость электроэнергии и арендованного GPU-времени, а не в плату вендору по счётчику.
Аренда меняет правила игры. Вам не нужно создавать инфраструктуру – вы автоматически получаете самую свежую модель от вендора и запускаетесь за полдня. В обмен вы платите за каждый символ, текст ваших пользователей покидает вашу сеть и отправляется к вендору, а вы живёте с задержкой, которую накладывают серверы поставщика и ваше географическое расстояние до них. Для многих команд такой компромисс оправдан – пока объём не вырастет настолько, что стоимость символов превысит затраты на GPU.
Знакомство с четырьмя движками
Kokoro – бесплатная модель, которую вы размещаете на своём сервере
Kokoro – это open-weights TTS-модель с 82 миллионами внутренних параметров, то есть настраиваемых чисел, которые модель усваивает в процессе обучения (hexgrad, 2026). Восемьдесят два миллиона – цифра внушительная, но в масштабах современных моделей это почти ничто: многие конкуренты в десять–сто раз крупнее. Именно эта компактность – ключевое преимущество. Маленькая модель быстро работает на недорогом оборудовании, и Kokoro достигает примерно 210-кратной скорости относительно реального времени на одной потребительской видеокарте RTX 4090 – то есть одна секунда вычислений даёт около 210 секунд речи (hexgrad, 2026).
Под капотом Kokoro используют две опубликованные научные разработки: StyleTTS 2 для формирования голоса и ISTFTNet для преобразования внутреннего представления модели в звуковую волну (Li et al., 2023; Kaneko et al., 2022). Важно: на этапе синтеза речи модель работает за один прямой проход, без медленного итеративного шага «диффузии» – именно это обеспечивает её высокую скорость (hexgrad, 2026). Версия 1.0, вышедшая в январе 2025 года, включает 54 голоса на 8 языках и генерирует аудио с частотой 24 кГц – почти вещательное качество от модели, которая помещается на обычном ноутбуке (hexgrad, 2026).
Экономика – главный аргумент. При использовании облачного API Kokoro стоимость обработки составляет менее одного доллара за миллион символов текста или менее шести центов за час синтезированного аудио (hexgrad, 2026). При самостоятельной хостинге на собственных серверах предельная стоимость снижается ещё больше. Однако здесь есть подвох: всё, что обычно берёт на себя управляемый провайдер, теперь ложится на вас – вы сами обслуживаете серверы, масштабируете инфраструктуру и понимаете, что модель с 82 миллионами параметров, несмотря на высокое качество, не достигнет наивысшего уровня выразительности в передаче эмоциональных нюансов.
ElevenLabs Turbo и Flash – быстрая, универсальная и платная пара
ElevenLabs – самый популярный коммерческий поставщик голосовых решений, и для потоковой обработки он предлагает две быстрые модели. Flash v2.5 – это специализация на скорости: время инференса модели составляет около 75 миллисекунд, поддержка 32 языков, стоимость – пять центов за тысячу символов (ElevenLabs, 2026). Turbo v2.5 немного уступает в скорости, но выигрывает в качестве – она оптимизирована для интерактивного использования. Обратите внимание на разницу между заявленной и реальной производительностью: эти 75 миллисекунд – только время работы модели, её «собственное мышление», тогда как реальное сквозное время до первого аудио (TTFA), включая сетевой путь и ожидание в очереди на сервере, в независимых тестах составляет около 250–290 миллисекунд (ElevenLabs, 2026; Gradium / Coval, 2026).
Покупая у ElevenLabs, вы получаете широту и стабильность. Обе быстрые модели поддерживают 32 языка, интервал межквартильного разброса задержки составляет всего 28 миллисекунд, а API – зрелый: доступны обычный эндпоинт, потоковый эндпоинт на основе стандартного механизма server-sent events и двунаправленный WebSocket-эндпоинт, предназначенный для подачи текста по мере его генерации языковой моделью (ElevenLabs, 2026). Одной из побочных тем статьи стал voice isolator от ElevenLabs – родственный инструмент на той же платформе, который удаляет фоновый шум из записи, оставляя чистую речь. Он тарифицируется по 1000 символов за минуту аудио и доступен с тарифного плана Starter и выше (ElevenLabs, 2026). Это не TTS-движок, но командам, разрабатывающим голосовые функции, часто требуется и то, и другое.
Cartesia Sonic – рекордсмен по задержке
Линейка Sonic от Cartesia создана с одной целью – достичь минимальной задержки при воспроизведении первого звука. Она основана на архитектуре state-space model – более современной альтернативе трансформерным схемам, которые лежат в основе большинства моделей ИИ, и оптимизирована для плавной потоковой передачи непрерывного аудиосигнала (Cartesia, 2026). На независимом бенчмарке Coval Sonic-3 занимает второе место по скорости: медианная задержка составляет 188 миллисекунд (Gradium / Coval, 2026). Цены начинаются с бесплатного тарифа, включающего 20 000 кредитов в месяц, далее следуют тарифы Pro за $4, Startup за $39 и Scale за $239. Мгновенное клонирование голоса доступно с тарифом Pro, а профессиональное – с тарифом Startup (Cartesia, 2026).
Честная оговорка, видимая только в независимых данных – это стабильность. Разброс задержки у Sonic-3 составляет 100 миллисекунд, что шире, чем у ElevenLabs. Поэтому, хотя типичный запрос выполняется очень быстро, значительная часть всё же приближается к порогу разговорности (Gradium / Coval, 2026). В продукте, где худший случай важен не меньше среднего, такой разброс – именно та цифра, которую стоит учитывать.
OpenAI TTS – удобно, если вы уже работаете с платформой
Синтез речи OpenAI – естественный выбор по умолчанию для команд, уже работающих с OpenAI. Удешевлённая модель gpt-4o-mini-tts стоит примерно 1,5 цента за минуту аудио; более старая tts-1 – 15 долларов за миллион символов, а tts-1-hd – 30 долларов (OpenAI, 2026). Она поддерживает потоковую передачу и широкий набор форматов вывода, включая низколатентный кодек Opus (OpenAI, 2026).
Но независимые бенчмарки однозначны в оценке: качественная модель tts-1-hd показывает медианный TTFA выше двух секунд, что делает её непригодной для живого диалога и позиционирует как пакетный инструмент – отличный выбор для предрендера озвучки или дубляжа, где задержки не критичны, но не подходящий для агентов реального времени (Gradium / Coval, 2026). У OpenAI также отсутствует WebSocket-эндпоинт для TTS – используется только HTTP-доставка, что вносит небольшую задержку в многоходовых диалогах (Gradium, 2026). Нужна разговорная скорость – смотрите на три другие модели; нужна удобная пакетная озвучка в рамках существующего стека OpenAI – эта подойдёт.
Сравнение 2026 года, бок о бок
Таблица ниже собирает ключевые цифры, определяющие большинство выборов. Значения задержки – независимые медианы time-to-first-audio из майского бенчмарка Coval 2026 года, а не маркетинговые заявления; цены и количество поддерживаемых языков взяты со страниц вендоров по состоянию на май 2026 года. «Победитель» в каждой колонке – не один конкретный продукт, а зависит от того, какой параметр важнее для вашего решения.
| Движок | Хостинг или self-host | Медиана TTFA (P50) | Разброс (IQR) | Цена | Языки | Лучше всего для |
|---|---|---|---|---|---|---|
| Kokoro-82M | Self-host (Apache 2.0) | <300 мс* | н/д (ваше железо) | ~$1 / М симв. | 8 | Объём, приватность, пол цены |
| ElevenLabs Turbo v2.5 | Хостинг API | 264 мс | 28 мс | $0.10 / 1k симв. (v2/v3) | 32 | Широта языков + стабильность |
| ElevenLabs Flash v2.5 | Хостинг API | 288 мс | 28 мс | $0.05 / 1k симв. | 32 | Дёшево + низкая задержка, 32 языка |
| Cartesia Sonic-3 | Хостинг API | 188 мс | 100 мс | от $0 (20k кредитов) | 40+ | Быстрейшая медиана, задержка-прежде |
| OpenAI gpt-4o-mini-tts | Хостинг API | – (поток) | – | ~$0.015 / мин | мульти | Пакетная озвучка в стеке OpenAI |
| OpenAI tts-1-hd | Хостинг API | 2 295 мс | 1 062 мс | $30 / М симв. | мульти | Только пакетно – не реальное время |
Задержка первого звука у Kokoro полностью зависит от вашего железа; на одной RTX 4090 она генерирует речь примерно в 210 раз быстрее реального времени, уверенно укладываясь в разговорный бюджет для коротких ответов (hexgrad, 2026).
Читайте таблицу как набор сравнений, а не как турнирную таблицу. Cartesia выигрывает по чистой медиане скорости, но имеет больший разброс результатов. ElevenLabs выигрывает по стабильности и охвату языков. Kokoro выигрывает по долгосрочной стоимости и приватности, но требует оплаты за использование. Быстрая модель OpenAI – это выбор в пользу удобства, а её HD-версия – инструмент для пакетной обработки, выдаваемый под видом работы в реальном времени.
Разбор на примере – во что обходится голосовой агент в месяц
Цифры в таблице цен кажутся абстрактными, пока не проверишь их на практике, поэтому оценим конкретный продукт: голосового агента поддержки, который воспроизводит 200 часов сгенерированного аудио в месяц.
Сначала переведём часы речи в символы текста, потому что именно их тарифицируют хостинговые API. Речь идёт со скоростью около 150 слов в минуту, а английское слово в среднем около 6 символов с учётом завершающего пробела. Значит, одна минута аудио – это примерно:
150 слов × 6 символов = 900 символов в минутуДвести часов – это 12 000 минут, поэтому месячный объём текста:
12 000 минут × 900 символов = 10 800 000 символов ≈ 10,8 млн символовТеперь оценим эти 10,8 млн символов по каждому из вариантов:
ElevenLabs Flash v2.5 : 10,8М × $0.05 / 1 000 = $540 / месяц
ElevenLabs Turbo v2.5 : 10,8М × $0.10 / 1 000 = $1 080 / месяц
Cartesia Sonic : 10,8М × ~$0.04 / 1 000 = ~$432 / месяц
Kokoro (self-hosted) : ~$1 за миллион = ~$11 / месяц вычислений + ваше время на эксплуатациюРазброс – и есть урок. На 200 часах в месяц хостинговые тарифы варьируются от примерно $430 до $1 080, тогда как самохостинг Kokoro обходится примерно в десять долларов за GPU-время плюс зарплата инженера, поддерживающего систему. Ниже нескольких десятков часов в месяц стоимость хостинга становится незначительной, а затраты на самохостинг не оправданы операционными издержками. По мере роста нагрузки линии пересекаются, и почти нулевая предельная стоимость open-модели побеждает с большим отрывом. Точка безубыточности – не фиксированное число, она зависит от стоимости инженеров и требований к времени работы системы, – но каждая команда масштабного уровня должна примерно понимать, где проходит её граница.
Как устроен поток – чанки, предложения и сокеты
Чтобы получить низкую задержку, которую обещают бенчмарки, текст нужно подавать движку правильно, а аудио – возвращать по подходящему типу соединения. Оба решения зависят от вас, и ошибка в любом из них может свести на нет преимущество быстрой модели.
На входе движок не может начать работу, пока не накопит достаточно текста, чтобы сгенерировать естественную речь. Подайте одно слово – и движок не знает, как его интонировать; подождите целый абзац – и вы получаете задержку, как у чайника. Решение – чанкинг: подача текста небольшими порциями, достаточными для начала синтеза, но не вызывающими задержек. ElevenLabs реализует это через настройку chunk-length schedule – список значений длины текста в символах, после которых происходит генерация, например: 120, затем 160, затем 250 (ElevenLabs, 2026). Также доступен auto mode, который автоматически определяет эти границы, анализируя входящий текст, и команда flush – для немедленной обработки всего накопленного буфера в конце (ElevenLabs, 2026). Когда текст поступает от языковой модели по одному слову, баланс особенно важен: чанкуйте слишком рано – пострадает просодия; слишком поздно – вырастёт задержка.
На стороне транспорта существует три способа передачи аудио – каждый подходит для своей ситуации. Обычный запрос возвращает весь клип целиком – самый простой, но и самый медленный способ, с наибольшим временем до первого звука. Поток server-sent events, определённый в стандарте HTML, передаёт аудиоданные порциями по одностороннему HTTP-каналу по мере их готовности, что сокращает время до первого звука и идеально подходит, когда весь текст уже известен (WHATWG, 2026; ElevenLabs, 2026). WebSocket – двустороннее постоянное соединение, стандартизированное в RFC 6455, – позволяет продолжать подавать текст, пока аудио уже возвращается, что идеально соответствует поведению живого агента, читающего вывод языковой модели по мере его генерации (IETF, 2011; ElevenLabs, 2026). Хотя WebSocket требует небольшой разовой затраты на установление соединения, повторное использование одного открытого соединения на несколько ходов экономит 50–100 миллисекунд на каждом ходу по сравнению с повторным открытием HTTP-запроса (Gradium, 2026). Для чат-агента рекомендуется держать один сокет открытым.
Ещё один полезный рычаг – география. ElevenLabs раздаёт быстрые модели из региональных дата-центров, и тот же запрос, который возвращает первый звук за 100–150 миллисекунд из Северной Америки или Европы, занимает 150–200 миллисекунд в некоторых частях Азии – просто потому, что байтам дальше ехать (ElevenLabs, 2026). Если ваши пользователи сосредоточены в одном регионе, выбирайте поставщика с сервером поблизости или размещайте сервис ближе к аудитории.
Частая ошибка – оптимизировать модель, игнорируя конвейер
Самая частая ошибка команд – выбирать модель с самой низкой рекламной задержкой инференса и потом удивляться, почему живой продукт всё равно тормозит. Рекламные «75 миллисекунд» – это время «думания» модели в идеальных условиях. А то, что чувствует пользователь, – это сумма четырёх компонентов: сетевой путь до сервера, ожидание в очереди при высокой нагрузке, время генерации модели и обратный сетевой путь (ElevenLabs, 2026). Модель, которая «думает» 75 миллисекунд, но работает через медленное соединение, за длинной очередью и с новым HTTP-рукопожатием на каждый запрос, легко может ощущаться как задержка в полсекунды.
Лекарство – мерить весь конвейер, от начала до конца, из локаций ваших реальных пользователей, по time-to-first-audio, а не по time-to-first-byte. Откройте один постоянный WebSocket и переиспользуйте его. Выберите серверный регион рядом с пользователями. Настройте chunk schedule на реальном выводе языковой модели, а не на статичном тестовом предложении. Модель из середины списка, подключённая правильно, бьёт чемпиона бенчмарка, подключённого небрежно, – каждый раз.
Где здесь Фора Софт
Мы создаём продукты, использующие потоковый TTS: видеоконференции с озвучиванием итогов встреч, телемедицинские платформы с голосовым приёмом, e-learning с озвученными уроками и OTT-сервисы с автодубляжом. В таких задачах выбор движка редко сводится к поиску самой быстрой модели – он зависит от соответствия движка реальным ограничениям продукта. В чувствительных к приватности сценариях, например в телемедицине, чаще выбирают самохостинг open-моделей, чтобы аудио никогда не покидало среду клиента. А вот многоязычная поддержка для конференций обычно требует хостингового API – ради широкого охвата языков и отсутствия операционной нагрузки. Мы придерживаемся следующего подхода: сначала определяем допустимый бюджет задержки, затем – требования к приватности и языковому покрытию, и только после этого сравниваем стоимость. Ведь движок, который дешевле, но не укладывается в лимит задержки, на деле оказывается не выгоднее – он просто непригоден.
Как выбирать – пять вопросов
Пройдите их по порядку – каждый сужает поле.
- Это реальное время или пакетная обработка? Если никто не ждёт в реальном времени (например, предрендеринг озвучки или ночной дубляж), задержка не критична – выбирайте по качеству и цене. В этом случае подойдут HD-модель от OpenAI или ElevenLabs Multilingual v2. Если же нужна разговорная скорость – задержка становится главным фактором.
- Каков месячный объём в часах? Переведите его в символы (примерно 900 на минуту). При объёме до нескольких десятков часов выгоднее арендовать. При нескольких сотнях часов и выше – тщательно просчитайте безубыточность самохостинга.
- Сколько языков и каких именно? Нужна широкая поддержка? Тогда рассмотрите ElevenLabs (32 языка) или Cartesia (40+). Если основной язык – английский и важна цена, то 8 языков Kokoro могут оказаться достаточными.
- Может ли аудио покидать вашу сеть? Если из-за требований к приватности или регуляторных норм это недопустимо – размещайте Kokoro у себя. Если нет ограничений – хостинговые API доступны для использования.
- Важен ли худший случай не меньше, чем средний? Если медленные хвостовые запросы портят пользовательский опыт при масштабировании, оценивайте не только медианную задержку, но и её разброс. В этом случае предпочтительнее более стабильный, но чуть медленнее сервис с узким разбросом (например, ElevenLabs), чем быстрый, но с высокой вариативностью (например, Cartesia).
Ключевые выводы
- Потоковый TTS воспроизводит звук до конца предложения – именно это придаёт голосу естественность.
- Время до первого фрагмента аудио (time-to-first-audio) менее 300 мс – это разговорный уровень; показатель time-to-first-byte вводит в заблуждение – его можно игнорировать.
- Стабильность задержки (разброс значений) важна не меньше, чем медиана, особенно в условиях реального диалога.
- Kokoro – бесплатная и self-hosted; ElevenLabs, Cartesia и OpenAI – платные облачные API.
- На больших объёмах почти нулевая предельная стоимость open-модели превосходит любую оплату за символ.
- Модель из середины рейтинга, правильно интегрированная, может превзойти лидера бенчмарка, подключённого небрежно.