Содержание статьи +
- Кратко
- Почему это важно
- Почему мы всё ещё спрашиваем людей
- MOS – оценка 1–5, которую все цитируют
- MUSHRA – метод для кодеков и «хорошего, но не идеального» звука
- A/B – простой тест предпочтения
- ABX – строгий тест «а слышно ли вообще?»
- Сколько слушателей действительно нужно?
- Разбор примера: как читать результат MUSHRA
- Субъективное и объективное тестирование работают вместе
- Инструменты, которыми реально можно пользоваться
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
- CTA
Кратко
Субъективное тестирование аудио – это когда клипы дают послушать реальным людям и просят оценить или сравнить услышанное, потому что человеческое ухо остаётся единственным истинным судьёй качества звука: любая автоматическая метрика лишь предсказывает, что сказали бы эти слушатели. Вам встретятся четыре метода: MOS (оценка по шкале 1–5, заданная Международным союзом электросвязи для телефонной речи), MUSHRA (оценка 0–100 для кодеков и «хорошего, но не идеального» звука), A/B (простой выбор предпочтения между двумя клипами) и ABX (строгий тест «да/нет» на то, слышна ли разница вообще). Каждый метод отвечает на свой вопрос, использует свою шкалу и требует своего числа слушателей и своего статистического теста, чтобы что-то значить, – неправильно выбранный метод даёт уверенную чепуху. В статье разобрано, что измеряет каждый метод, сколько слушателей действительно нужно, какие отбор и статистика отличают реальный результат от шума и как небольшая команда может провести защитимый слуховой тест без лаборатории.
Почему это важно
Если ваш продукт несёт звук – приложение для видеоконференций, стриминговый сервис, телемедицинская платформа, инструмент для онлайн-обучения, – рано или поздно встанет вопрос, который не решит ни одно автоматическое число: стало ли на самом деле лучше для человека? Новый кодек, более громкий микс диалога, агрессивное шумоподавление, функция пространственного звука – каждое из них обещает улучшение, которое может подтвердить или опровергнуть только человек. Объективные метрики дёшево ловят регрессии, но когда изменение новое или когда вы выбираете между двумя вариантами, которые клиент будет оценивать на слух, приходится спрашивать людей. Беда в том, что слуховой тест легко провести плохо: неправильный метод, слишком мало слушателей или отсутствие статистики – и вы примете решение на основе подброшенной монетки, принятой за доказательство. Эта статья – для продакт-менеджера или основателя, которому нужно заказать или интерпретировать слуховой тест и понять цену результата, и для инженера, которому его проводить. К концу вы будете знать, какой из четырёх методов отвечает на ваш вопрос, сколько слушателей он требует и какие три ошибки превращают ясный на вид график в иллюзию.
Почему мы всё ещё спрашиваем людей
Любая объективная метрика качества аудио из нашей парной статьи – PESQ, POLQA и ViSQOL – существует ради одного: предсказать, что сказала бы панель живых слушателей. Метрика – дублёр; слуховой тест – главный актёр. Поэтому, когда предсказание метрики под вопросом – новый нейросетевой кодек, на котором её не обучали, шумоподавитель, делающий что-то невиданное моделью, – вы возвращаетесь к источнику и спрашиваете людей напрямую.
Спросить людей звучит просто. Это не так. Результат слухового теста – это число, и, как любое измерение, оно несёт шум: один и тот же слушатель оценивает один и тот же клип по-разному в понедельник и пятницу; один строг, другой щедр; клип, отлично звучащий в студийных наушниках, в ноутбуке звучит мутно. Метод субъективного теста – это набор правил (что играть, о чём спрашивать, кто слушает, как считать), созданный, чтобы усреднить этот шум, пока сквозь него не проступит реальная разница. Сделаете правила правильно – и слуховой тест станет самым надёжным доказательством, которое можно купить. Сделаете неправильно – это театр.
Четыре метода ниже – стандартизированные наборы правил. Они делятся по двум осям. Первая ось – оценка против сравнения: вы просите слушателей поставить число каждому клипу по отдельности (MOS, MUSHRA) или выбрать/сопоставить между клипами (A/B, ABX)? Вторая – насколько хорош звук: телефонного качества речь, почти прозрачные музыкальные кодеки или что-то посередине. Подберите метод по обеим осям – и остальной дизайн теста вытекает сам.
MOS – оценка 1–5, которую все цитируют
MOS расшифровывается как Mean Opinion Score (средняя экспертная оценка) – старейшее и самое цитируемое число в аудио. Метод тот же, что десятилетиями использует телефонная компания: дать слушателю короткий речевой клип, попросить оценить по пятибалльной шкале (5 – отлично, 4 – хорошо, 3 – удовлетворительно, 2 – плохо, 1 – очень плохо), собрать оценки от многих слушателей по многим клипам и усреднить. Это среднее и есть Mean Opinion Score. Процедуру задаёт Международный союз электросвязи – орган ООН, стандартизирующий телекоммуникации, – в рекомендации ITU-T P.800, а конкретная задача выше называется Absolute Category Rating, или ACR, потому что каждый слушатель оценивает каждый клип по абсолютной пятибалльной шкале сам по себе, а не в сравнении с другим клипом.
P.800 на самом деле задаёт три родственные задачи, и разница важна, потому что неправильный выбор тратит панель впустую. ACR – простая задача «оцени этот клип 1–5»; её результат – привычный MOS. DCR – Degradation Category Rating – сначала играет чистый эталон, потом искажённый клип и спрашивает, насколько раздражает искажение по пятибалльной шкале; результат – DMOS (Degradation MOS), он чувствительнее при малых искажениях. CCR – Comparison Category Rating – играет два клипа и спрашивает, второй лучше или хуже первого по семибалльной шкале от −3 до +3; результат – CMOS (Comparison MOS), верный инструмент, когда сравниваете две уже хорошие системы. Главное правило: ACR, когда нужна абсолютная оценка качества; DCR или CCR, когда различия тонкие и нужна дополнительная чувствительность парного сравнения.
У MOS есть знаменитая слабость, которую надо уважать: это не абсолютная переносимая линейка. MOS 4.0 из одной лаборатории – не то же самое, что 4.0 из другой, потому что число дрейфует от состава слушателей, их языка, оборудования воспроизведения и даже диапазона клипов в тесте – слушатели бессознательно растягивают оценки под выданную им шкалу. Поэтому MOS осмысленен только внутри одного теста, сравнивая между собой системы, которые в нём были. Цитировать «наш кодек набирает 4.2 MOS» без контекста теста – строго говоря, бессмысленно. Число живёт и умирает условиями, которые его породили.
Более новая рекомендация ITU-T P.808 расширяет тестирование MOS на краудсорсинг – оплату множеству удалённых работников малых сумм за оценку клипов на своих устройствах через браузер – и покрывает те же задачи ACR, DCR и CCR. Краудсорсинг меняет контролируемую комнату на масштаб и скорость: вы теряете калиброванные наушники и тихую кабину, но получаете сотни слушателей за день, и собственная валидация ITU-T показала, что тест по P.808, проведённый по его правилам, сильно коррелирует с лабораторным. В 2026-м именно так работает большинство панелей по качеству речи, а Microsoft выпускает open-source P.808 Toolkit, который связывает всё это с Amazon Mechanical Turk.
MUSHRA – метод для кодеков и «хорошего, но не идеального» звука
MUSHRA – акроним, разворачивающийся в весь метод: MUltiple Stimuli with Hidden Reference and Anchor (множественные стимулы со скрытым эталоном и якорем). Его задаёт ITU-R BS.1534 – заметьте ITU-R, сектор радиосвязи, тот же, что владеет стандартами вещательного аудио, а не сектор электросвязи ITU-T, владеющий MOS, – и текущая редакция BS.1534-3 утверждена в октябре 2015 года. MUSHRA создан для промежуточного качества: звука, явно не идеального, но и явно не сломанного, – а это ровно там, где живут аудиокодеки на разумных битрейтах. Если вы сравниваете четыре настройки Opus или AAC, которые все звучат прилично, MUSHRA – ваш метод.
Гениальность MUSHRA в его названии. Слушатель видит множество систем сразу – обычно до девяти обработанных версий одного источника – на одном экране, у каждой кнопка воспроизведения и ползунок 0–100, и оценивает их вместе. Два из этих ползунков – ловушки. Один – скрытый эталон: нетронутый оригинал, подсунутый без подписи среди тестовых систем. Внимательный слушатель должен поставить ему около 100; тот, кто оценил скрытый эталон на 70, на самом деле не слушал – и такого можно выявить и исключить. Вторая ловушка – якорь: намеренно ухудшенная версия источника (стандартный якорь – оригинал, пропущенный через ФНЧ 3.5 кГц, звучит глухо, как телефонный звонок), помещённая ближе к низу шкалы, чтобы у каждого слушателя была общая фиксированная точка «заметно плохо». Скрытый эталон закрепляет верх шкалы; якорь – низ; всё реальное лежит между ними.
Поскольку каждую систему слышат на фоне остальных и этих двух фиксированных точек, результаты MUSHRA гораздо стабильнее и сопоставимее, чем «голый» MOS: слушатели могут мгновенно переключаться между версиями и слышать разницу напрямую – это куда чувствительнее, чем оценивать каждую по памяти в отрыве от других. MUSHRA встраивает и отсев слушателей: правило пост-скрининга BS.1534-3 исключает любого, кто оценил скрытый эталон ниже 90 более чем в 15% заданий, по логике, что такой слушатель либо не слышит различий, либо не старается. Рекомендация требует экспертных слушателей, держит отдельные сессии короткими – менее примерно десяти минут – во избежание усталости и советует около 15 и более валидных слушателей после отсева для надёжного результата.
Пара слов о «брате» MUSHRA – ITU-R BS.1116-3 (февраль 2015), потому что он встречается, когда различия крошечные. Если MUSHRA оценивает промежуточное качество, BS.1116 – метод для малых искажений: почти прозрачных кодеков, где вопрос звучит «а вообще кто-нибудь отличит это от мастера?». Его метод – двойной слепой трёхстимульный с скрытым эталоном, иногда пишут ABC/HR: слушатель слышит три стимула за пробу – известный эталон плюс два неизвестных, один из которых скрытая копия эталона, другой – система под тестом, – и оценивает искажение по непрерывной шкале от 5.0 (незаметно) до 1.0 (очень раздражает). Результат – Subjective Difference Grade (субъективная оценка различия). Правило между ними: BS.1116 для почти прозрачных, аудиофильских различий; MUSHRA для более широкого промежуточного диапазона, где искажения слышны, но приемлемы.
A/B – простой тест предпочтения
Иногда вам вообще не нужна балльная оценка. Есть два варианта – старый микс диалога и более громкий, кодек A и кодек B – и единственный вопрос: что люди предпочитают? Это A/B-тест: играем клип A, играем клип B, просим слушателя выбрать тот, что нравится больше. Результат – не число качества, а доля предпочтений: «68% слушателей предпочли более громкий микс» – и часто это ровно тот бизнес-ответ, который нужен.
A/B дёшев, быстр и интуитивен, и в этом его сила и его ловушка. Сила в том, что его может провести кто угодно, а результат легко объяснить стейкхолдеру. Ловушка в том, что «предпочтение» – это не «качество», и тест предпочтения широко открыт для смещений, если не быть внимательным. Доминируют два смещения. Первое – смещение порядка: слушатели склонны предпочитать клип, услышанный вторым (иногда первым), поэтому порядок нужно рандомизировать и балансировать между слушателями. Второе – эффект «громче значит лучше», настолько сильный, что заслуживает отдельного предупреждения: из двух в остальном одинаковых клипов более громкий выигрывает тест предпочтения почти всегда, независимо от качества. Поэтому любой честный A/B-тест кодеков или миксов обязан сначала выровнять громкость клипов – нормализовать их к одной интегральной громкости, чтобы сравнение было о качестве, а не о громкости. Измерение, которое это делает возможным, мы разбираем в статье о громкости, peak, RMS и LUFS.
A/B отвечает «что предпочтительнее». Он не говорит, слышна ли разница вообще, – а это другой, более строгий вопрос со своим методом.
«Подводный камень – забыть выровнять громкость. Самый частый способ испортить слуховой тест – сравнивать клипы на разной громкости. Разницы в 1 дБ достаточно, чтобы сместить тест предпочтения, и люди надёжно принимают «громче» за «лучше». Перед любым A/B-, ABX- или MUSHRA-тестом нормализуйте каждый клип к одной интегральной громкости (LUFS). Пропустите это – и вы мерите громкость, а не качество, и ваш «победитель» – просто самый громкий файл. Эта одна ошибка обесценивает больше любительских слуховых тестов, чем любая другая.»
ABX – строгий тест «а слышно ли вообще?»
ABX – самый строгий из четырёх и единственный, способный доказать, что разница реальна, а не воображаема. Настройка: слушателю дают три клипа за пробу – A (один известный образец), B (другой известный) и X (тайно либо A, либо B, выбран случайно). Слушатель может переслушивать все три сколько угодно и должен ответить на один вопрос: X совпадает с A или с B? Он заставляет себя определить неизвестное на одно лишь ухо.
Почему это мощно – упирается в случайность. Если слушатель действительно не слышит никакой разницы между A и B, то X неопределим, и он сведён к угадыванию – а угадывание верно в 50% случаев. Значит, если слушатель (или панель) определяет X правильно значительно чаще половины раз на многих пробах, разница должна быть слышимой; если результат держится около 50% – не слышима. ABX превращает расплывчатый вопрос – «реальна ли эта разница?» – в задачу о подбрасывании монеты, решаемую статистикой. Это стандартный способ развенчать аудиофильские заявления («ты правда слышишь разницу между этим MP3 320 кбит/с и lossless-мастером?») и верный инструмент всякий раз, когда нужно подтвердить, что изменение вообще воспринимаемо, прежде чем тратить силы на оценку, насколько лучше.
Вот арифметика, придающая результату ABX смысл. Пусть один слушатель проводит 16 проб ABX и даёт 12 верных. Это доказательство, что он слышит разницу, или чистый угадывающий мог так же повезти? Проверяем против нулевой гипотезы «он угадывал», где каждая проба – монетка 50/50. Вероятность получить не менее 12 из 16 верных чисто случайно – сумма биномиальных вероятностей для 12, 13, 14, 15 и 16 попаданий:
P(≥12 из 16, p = 0.5) = 0.038
Это ниже общепринятого порога 0.05, поэтому «он угадывал» отвергается – 12 из 16 статистически значимое доказательство слышимости разницы. Теперь контраст: 10 из 16 верных даёт P(≥10) = 0.227, заметно выше 0.05, что не доказывает ничего – угадывающий берёт эту планку чаще одного раза из пяти. Урок точен: большинство – не доказательство. Нужно столько проб и такая доля попаданий, чтобы чистое везение стало неправдоподобным, а где проходит эта черта, говорит только биномиальный тест.
Сколько слушателей действительно нужно?
Самый частый вопрос – и чаще всего отвечаемый наугад – сколько людей набрать. Единого числа нет, потому что оно зависит от метода, размера эффекта, который вы ловите, и шума в панели. Но есть защитимые значения по умолчанию, и логику за ними стоит понимать, чтобы отстоять свой выбор.
Ведущая идея – стандартная ошибка среднего: шум на вашем среднем балле убывает как квадратный корень из числа слушателей. Поэтому среднее из оценок 25 слушателей вдвое точнее, чем из 6, а не вчетверо – удвоение точности стоит вам вчетверо больше людей. Вот почему слуховые панели упираются в убывающую отдачу: прыжок с 5 до 15 слушателей даёт много; прыжок с 30 до 90 – куда меньше. Четыре метода ложатся в разные места:
| Метод | На какой вопрос отвечает | Валидных слушателей (типично) | Стат. тест | Результат |
|---|---|---|---|---|
| MOS (P.800 ACR) | Абсолютное качество, 1–5 | 24+ (лаб.) / сотни (P.808 крауд) | среднее + ДИ; ANOVA по системам | Mean Opinion Score |
| MUSHRA (BS.1534-3) | Промежуточное качество кодеков, 0–100 | ~15+ после отсева | среднее + ДИ; RM-ANOVA | балл 0–100 со скрытым эт. / якорем |
| A/B предпочтение | Что предпочитают | 20–40+ | двусторонний биномиальный / знаковый | доля предпочтений (%) |
| ABX различение | Слышна ли разница вообще | 1 обуч. слушатель при многих пробах; пул для популяционных выводов | биномиальный vs 50% | p-значение: слышно или нет |
Читайте таблицу как набор эмпирических правил, а не законов. Для MOS контролируемый лабораторный тест обычно хочет 24 и более слушателей; краудсорсинговый тест по P.808 спокойно использует сотни – отчасти поэтому краудсорсинг и победил. Для MUSHRA BS.1534-3 указывает примерно на 15 и более валидных слушателей после отсева по скрытому эталону, отбросившего невнимательных, – так что набирайте больше 15, чтобы остаться выше 15. Для A/B нужно столько людей, чтобы доля предпочтений превысила биномиальный шум: 20–40 – разумный минимум, больше, если доля близка к 50/50. Для ABX структура иная – один обученный слушатель на многих пробах может установить, что он слышит разницу, но чтобы сделать вывод о населении в целом, вы объединяете слушателей и пробы. Объединяющая дисциплина: решайте метод и число слушателей до сбора данных, а не после подглядывания в них.
Разбор примера: как читать результат MUSHRA
Числа на шкале качества обретают смысл, только когда вы хоть раз прогоните их через статистику. Пусть вы тестируете четыре настройки кодека для стримингового продукта на одном наборе музыкальных клипов в тесте MUSHRA, набираете 20 слушателей, и после отсева по скрытому эталону остаётся 17 валидных. Усредняете оценки 0–100 каждой системы по 17 слушателям и клипам и получаете:
- Скрытый эталон: 98 (проверка вменяемости – около 100, как и должно быть)
- Система A – высокий битрейт: среднее 82, стандартное отклонение 9 по слушателям
- Система B – средний битрейт: среднее 74, стандартное отклонение 11
- Якорь (ФНЧ 3.5 кГц): 22 (проверка – около низа, как и должно быть)
Действительно ли A и B различаются, или разрыв в 8 баллов внутри шума? Считаем стандартную ошибку каждого среднего – стандартное отклонение, делённое на квадратный корень из числа слушателей:
стандартная ошибка (A) = 9 ÷ √17 = 9 ÷ 4.12 = 2.18 стандартная ошибка (B) = 11 ÷ √17 = 11 ÷ 4.12 = 2.67
95-процентный доверительный интервал – примерно две стандартные ошибки по обе стороны среднего, так что Система A – это 82 ± 4.4 (около 77.6–86.4), а Система B – 74 ± 5.3 (около 68.7–79.3). Эти интервалы едва пересекаются, что сигналит о вероятно реальной разнице – но «едва пересекаются» – ровно тот случай, когда вы прекращаете оценивать на глаз и запускаете правильный тест (repeated-measures ANOVA, учитывающий, что одни и те же слушатели оценивали каждую систему). Скрытый эталон на 98 и якорь на 22 подтверждают, что панель была внимательна и использовала всю шкалу, – данным можно доверять. Средние дают картину; доверительные интервалы и ANOVA говорят, реальна ли она. Результат без них – «A набрала 82, B набрала 74, A выигрывает» – это догадка в одежде числа.
Субъективное и объективное тестирование работают вместе
Субъективное тестирование – эталон истины, но оно медленное и стоит реальных денег и времени слушателей, поэтому его нельзя гонять на каждое изменение кода. Объективные метрики – полностью разобранные в статье о PESQ, POLQA и ViSQOL – закрывают разрыв, автоматически предсказывая MOS достаточно быстро для сборочного конвейера. Эти двое не соперники, а эстафета. Субъективный тест вы запускаете несколько раз в год, чтобы установить истину и откалибровать объективную метрику – подтвердить, что она всё ещё отслеживает мнение людей для вашего контента. Затем объективная метрика следит за каждой сборкой в промежутке, и её зелёной галочке вы доверяете именно потому, что панель людей подтвердила её согласие с людьми.
У этих отношений есть режим отказа, который стоит назвать. Объективные метрики уходят от мнения людей ровно тогда, когда конвейер делает что-то, на чём метрику не обучали, – новый нейросетевой кодек, агрессивный шумоподавитель, функцию генеративного аудио. Этот дрейф невидим, пока не запустишь человеческий тест, который его ловит. Поэтому правило простое: когда метрика и люди расходятся, правы люди, а метрику надо перекалибровать. Современные метрики без эталона вроде DNSMOS P.835 и NISQA сами обучены на больших краудсорсинговых тестах по P.808 – тот же принцип, записанный в софт: любое автоматическое число качества в конце концов восходит к комнате (или толпе) людей, которые слушали.
Инструменты, которыми реально можно пользоваться
Чтобы провести защитимый слуховой тест в 2026-м, лаборатория вещания не нужна. Несколько открытых фреймворков реализуют эти методы корректно «из коробки». webMUSHRA от Fraunhofer IIS и International Audio Laboratories Erlangen – браузерный фреймворк, реализующий MUSHRA-тесты по BS.1534 (плюс парное сравнение и другие методы) и де-факто стандарт для академической оценки кодеков. BeaqleJS – открытый фреймворк на HTML5/JavaScript, проводящий и ABX-, и MUSHRA-тесты в любом современном браузере. Для речевого MOS на краудсорсинговом масштабе P.808 Toolkit от Microsoft реализует полный набор ACR/DCR/CCR на Amazon Mechanical Turk. Дисциплина всё равно важнее инструмента: выровняйте громкость клипов, рандомизируйте порядок, отсеивайте слушателей, зафиксируйте метод и размер выборки до старта и запустите правильный статистический тест в конце. Инструмент даёт экран; строгость – на вас.
Где здесь Фора Софт
Мы строим видеоконференции, телемедицину, онлайн-обучение, OTT-стриминг и системы видеонаблюдения, и в каждом из них вопрос «стало ли действительно лучше звучать?» рано или поздно ложится на человеческое ухо. Мы используем субъективное тестирование так, как описано в статье: A/B- и ABX-тесты, когда надо узнать, воспринимаемо ли изменение вообще; MUSHRA, когда выбираем между настройками кодека для стримингового продукта; и краудсорсинговый MOS, чтобы держать автоматические гейты качества честными. Клиницисту нужно ясно слышать пациента, а студенту – каждое слово лекции, поэтому для таких продуктов слуховой тест – не академическое упражнение, а последняя проверка перед тем, как решение о качестве уйдёт в релиз. Эти тесты стоят рядом с остальным аудиоинструментарием; см. конвейер аудио WebRTC целиком и runbook диагностики звука в проде. Метод надёжен ровно настолько, насколько надёжны отбор и статистика за ним.
Ключевые выводы
- Субъективное тестирование просит реальных слушателей оценивать или сравнивать звук; это эталон, который предсказывают все метрики.
- MOS оценивает речь 1–5 (P.800/P.808); MUSHRA оценивает кодеки 0–100 со скрытым эталоном и якорем.
- A/B находит предпочитаемый клип; ABX доказывает слышимость разницы через биномиальный тест.
- Всегда сначала выравнивайте громкость – люди принимают громче за лучше, и это портит больше тестов, чем что-либо.
- Решайте метод и число слушателей до сбора данных; точность растёт лишь как корень из числа слушателей.
- Результат без доверительных интервалов или теста значимости – догадка; решает статистика, а не большинство.
Что почитать дальше
- Объективные метрики качества аудио: PESQ, POLQA, ViSQOL, AAC-Q
- Громкость, peak, RMS, LUFS – как измеряют реальную громкость
- Opus: открытый кодек, захвативший WebRTC
CTA
- Поговорить со стриминг-инженером – о дизайне слухового теста, который действительно решит ваш вопрос о качестве звука.
- Посмотреть наши кейсы – реал-тайм- и стриминговые продукты, выпущенные с 2005 года.
- Скачать памятку по субъективному тестированию – одностраничный выбор метода MOS / MUSHRA / A/B / ABX и гид по статистике.