Субъективное тестирование звука: MUSHRA, MOS, AB и ABX

Автор: Николай СапуновОбновлено: август 202628 мин чтения
Содержание статьи +

Кратко

Субъективное тестирование аудио – это когда реальные люди слушают аудиоклипы и оценивают или сравнивают их, ведь человеческое ухо остаётся единственным истинным судьёй качества звука: любая автоматическая метрика лишь предсказывает, что сказали бы эти слушатели. Вам встретятся четыре метода: MOS (оценка по шкале от 1 до 5, установленная Международным союзом электросвязи для телефонной речи), MUSHRA (оценка от 0 до 100, применяемая для кодеков и «хорошего, но не идеального» звука), A/B (простой выбор предпочтения между двумя клипами) и ABX (строгий тест «да/нет» на то, различима ли разница вообще). Каждый метод отвечает на свой вопрос, использует свою шкалу и требует определённого числа слушателей и соответствующего статистического теста – иначе результат будет уверенным, но бессмысленным. В статье объясняется, что измеряет каждый метод, сколько слушателей на самом деле нужно, какие критерии отбора и статистические подходы позволяют отличить реальный эффект от шума, а также как небольшой команде провести достоверный слуховой тест без лаборатории.

Почему это важно

Если ваш продукт работает со звуком – приложение для видеоконференций, стриминговый сервис, телемедицинская платформа, инструмент для онлайн-обучения – рано или поздно возникает вопрос, на который не ответит ни одна автоматическая метрика: стало ли действительно лучше для пользователя? Новый кодек, более чёткий диалог, агрессивное шумоподавление, пространственный звук – каждая из этих функций обещает улучшение, которое может подтвердить или опровергнуть только человек. Объективные показатели легко выявляют регрессии, но когда изменение принципиально новое или когда нужно выбрать между двумя вариантами, которые пользователь оценивает на слух, остаётся только один путь – спросить людей. Проблема в том, что слуховой тест легко провести неправильно: неверный метод, слишком мало участников или отсутствие статистической обработки – и вы принимаете решение, будто подбросили монету, приняв случайность за закономерность. Эта статья предназначена для продакт-менеджера или основателя, которому нужно заказать или интерпретировать слуховой тест и понять, насколько надёжен результат, а также для инженера, которому предстоит его проводить. К концу вы узнаете, какой из четырёх методов подходит под вашу задачу, сколько слушателей он требует и какие три ошибки превращают на первый взгляд убедительный график в иллюзию.

Почему мы всё ещё спрашиваем людей

Любая объективная метрика качества аудио из нашей парной статьи – PESQ, POLQA и ViSQOL – существует лишь для одной цели: предсказать, что скажут живые слушатели. Метрика – дублёр, а слуховой тест – главный актёр. Поэтому, когда точность предсказания метрики вызывает сомнения – например, при работе с новым нейросетевым кодеком, на котором её не обучали, или с шумоподавителем, применяющим методы, не знакомые модели, – приходится возвращаться к источнику и спрашивать людей напрямую.

Спросить людей – дело кажущееся простым. На деле это не так. Результат слухового теста – число, и, как любое измерение, оно несёт шум: один и тот же слушатель по-разному оценивает один и тот же клип в понедельник и в пятницу; один строже, другой щедрее; клип, отлично звучащий в студийных наушниках, на ноутбуке может звучать мутно. Метод субъективного теста – это набор правил (что играть, о чём спрашивать, кто слушает, как считать), призванный усреднить этот шум, чтобы сквозь него проявилась реальная разница. Правила составлены грамотно – и слуховой тест становится самым надёжным доказательством, которое можно получить. Составлены плохо – и это уже театр.

Четыре метода ниже – это стандартизированные наборы правил, разделённые по двум осям. Первая ось – оценка против сравнения: вы просите слушателей поставить оценку каждому клипу по отдельности (MOS, MUSHRA) или выбрать/сопоставить их между собой (A/B, ABX)? Вторая – насколько хорош звук: речь телефонного качества, почти прозрачные музыкальные кодеки или что-то посередине. Подберите метод по обеим осям – и остальной дизайн теста вытекает сам.

Рис. 1. Четыре метода отвечают на четыре разных вопроса. Выбирайте метод по тому, что нужно узнать, а не по тому, что проще провести.

MOS – оценка от 1 до 5, которую все цитируют

MOS расшифровывается как Mean Opinion Score (средняя экспертная оценка) – старейший и наиболее цитируемый показатель в аудио. Метод остаётся неизменным десятилетиями и используется телефонными компаниями: слушателю предлагают короткий речевой фрагмент, просят оценить его по пятибалльной шкале (5 – отлично, 4 – хорошо, 3 – удовлетворительно, 2 – плохо, 1 – очень плохо), собирают оценки от множества слушателей по многим фрагментам и вычисляют среднее значение. Этот результат и называется Mean Opinion Score. Процедура регламентируется Международным союзом электросвязи – организацией ООН, отвечающей за стандартизацию телекоммуникаций, – в рекомендации ITU-T P.800. Конкретный метод, описанный выше, называется Absolute Category Rating, или ACR, поскольку каждый слушатель оценивает каждый фрагмент по абсолютной пятибалльной шкале независимо, без сравнения с другими.

P.800 на самом деле задаёт три родственные задачи, и разница между ними важна, потому что неправильный выбор может привести к потере эффективности тестирования. ACR – это простая задача «оцените этот клип по шкале от 1 до 5»; её результат – привычный MOS. DCRDegradation Category Rating – сначала воспроизводит чистый эталон, затем искажённый клип и спрашивает, насколько раздражает искажение по пятибалльной шкале; результатом становится DMOS (Degradation MOS), который чувствительнее при малых искажениях. CCRComparison Category Rating – воспроизводит два клипа и просит оценить, лучше или хуже второй по сравнению с первым, по семибалльной шкале от −3 до +3; результатом является CMOS (Comparison MOS) – надёжный инструмент, когда нужно сравнивать две уже качественные системы. Главное правило: используйте ACR, если нужна абсолютная оценка качества; DCR или CCR – когда различия малы и требуется повышенная чувствительность парного сравнения.

У MOS есть знаменитая слабость, которую нужно уважать: это не абсолютная переносимая линейка. MOS 4.0 из одной лаборатории – не то же самое, что 4.0 из другой, потому что значение дрейфует в зависимости от состава слушателей, их языка, оборудования воспроизведения и даже диапазона клипов в тесте – слушатели бессознательно растягивают оценки под предложенную им шкалу. Поэтому MOS имеет смысл только внутри одного теста, позволяя сравнивать между собой системы, участвовавшие в нём. Цитировать «наш кодек набирает 4.2 MOS» без указания контекста теста – строго говоря, бессмысленно. Число живёт и умирает вместе с условиями, в которых оно появилось.

Более новая рекомендация ITU-T P.808 расширяет тестирование MOS за счёт краудсорсинга – оплаты множеству удалённых исполнителей небольших сумм за оценку аудиоклипов на их устройствах через браузер – и охватывает те же задачи ACR, DCR и CCR. Краудсорсинг заменяет контролируемую лабораторную среду масштабом и скоростью: вы теряете калиброванные наушники и тихую кабинку, но получаете сотни слушателей за день. Собственная валидация ITU-T показала, что тест по P.808, проведённый в соответствии с его правилами, хорошо коррелирует с лабораторными результатами. К 2026 году именно так работает большинство панелей по оценке качества речи, а Microsoft выпускает open-source P.808 Toolkit, который интегрирует всё это с Amazon Mechanical Turk.

MUSHRA – метод для оценки кодеков и «хорошего, но не идеального» звука

MUSHRA – акроним, расшифровывающий название метода: MUltiple Stimuli with Hidden Reference and Anchor (множественные стимулы со скрытым эталоном и якорем). Метод определён в стандарте ITU-R BS.1534 – обратите внимание на ITU-R, сектор радиосвязи, отвечающий за стандарты вещательного аудио, а не на сектор электросвязи ITU-T, разрабатывающий MOS. Текущая редакция BS.1534-3 была утверждена в октябре 2015 года. MUSHRA предназначен для оценки промежуточного качества: звука, который явно не идеален, но и не повреждён – именно в этом диапазоне работают аудиокодеки при разумных битрейтах. Если вы сравниваете четыре настройки Opus или AAC, которые звучат одинаково хорошо, MUSHRA – ваш выбор.

Гениальность MUSHRA – в его названии. Слушатель видит множество систем сразу – обычно до девяти обработанных версий одного и того же источника – на одном экране. У каждой – кнопка воспроизведения и ползунок от 0 до 100, по которому она оценивается. Два из этих ползунков – ловушки. Один – скрытый эталон: нетронутый оригинал, подсунутый без подписи среди тестовых версий. Внимательный слушатель должен поставить ему около 100; если кто-то оценил скрытый эталон на 70, значит, он на самом деле не слушал – и такого участника можно выявить и исключить. Вторая ловушка – якорь: намеренно ухудшенная версия источника (стандартный якорь – оригинал, пропущенный через ФНЧ 3,5 кГц, звучит глухо, как телефонный звонок), помещённая ближе к низу шкалы, чтобы у каждого слушателя была общая фиксированная точка «заметно плохо». Скрытый эталон закрепляет верхнюю границу шкалы; якорь – нижнюю; всё реальное лежит между ними.

Поскольку каждую систему оценивают на фоне остальных и двух фиксированных точек, результаты MUSHRA оказываются гораздо более стабильными и сопоставимыми, чем «голый» MOS: слушатели могут мгновенно переключаться между версиями и слышать разницу напрямую – это гораздо чувствительнее, чем оценивать каждую по памяти в отрыве от других. MUSHRA включает и отсев слушателей: правило пост-скрининга BS.1534-3 исключает любого, кто оценил скрытый эталон ниже 90 более чем в 15% заданий, исходя из предположения, что такой слушатель либо не различает звуковые нюансы, либо не проявляет должной внимательности. Рекомендация предусматривает использование экспертных слушателей, ограничивает продолжительность отдельных сессий примерно десятью минутами, чтобы избежать усталости, и рекомендует иметь не менее 15 валидных слушателей после отсева для получения надёжных результатов.

Рис. 2. Экран MUSHRA оценивает несколько систем одновременно по шкале от 0 до 100, со скрытым эталоном и якорем-ФНЧ, которые отсеивают невнимательных слушателей и фиксируют оба конца шкалы.

Пара слов о «брате» MUSHRA – ITU-R BS.1116-3 (февраль 2015), потому что он применяется, когда различия крошечные. Если MUSHRA оценивает промежуточное качество, то BS.1116 – метод для малых искажений: почти прозрачных кодеков, где вопрос звучит: «а вообще кто-нибудь отличит это от оригинала?» Его метод – двойной слепой трёхстимульный с скрытым эталоном, иногда обозначаемый как ABC/HR: слушатель за одну пробу слышит три стимула – известный эталон и два неизвестных, один из которых – скрытая копия эталона, другой – сигнал, прошедший через тестируемую систему, – и оценивает степень искажения по непрерывной шкале от 5.0 (незаметно) до 1.0 (очень раздражает). Результат – Subjective Difference Grade (субъективная оценка различия). Граница между ними такова: BS.1116 – для почти прозрачных, аудиофильских различий; MUSHRA – для более широкого промежуточного диапазона, где искажения слышны, но приемлемы.

A/B – простой тест предпочтений

Иногда вам вовсе не нужна балльная оценка. Есть два варианта – старый микс диалога и более громкий, кодек A и кодек B – и единственный вопрос: что люди предпочитают? Это A/B-тест: проигрываем клип A, проигрываем клип B, просим слушателя выбрать тот, что нравится больше. Результат – не число качества, а доля предпочтений: «68% слушателей выбрали более громкий микс» – и часто это именно тот бизнес-ответ, который нужен.

A/B-тест дёшев, быстр и интуитивен – и в этом его сила и ловушка. Сила в том, что его может провести кто угодно, а результаты легко объяснить стейкхолдерам. Ловушка в том, что «предпочтение» – это не «качество», и тест предпочтения сильно подвержен искажениям, если не соблюдать осторожность. Два смещения доминируют. Первое – смещение порядка: слушатели склонны предпочитать клип, услышанный вторым (иногда – первым), поэтому порядок воспроизведения нужно рандомизировать и сбалансировать между участниками. Второе – эффект «громче значит лучше», настолько сильный, что заслуживает отдельного предупреждения: из двух в остальном одинаковых клипов более громкий почти всегда выигрывает в тесте предпочтения, независимо от качества. Поэтому любой честный A/B-тест кодеков или миксов обязательно должен сначала выровнять громкость клипов – нормализовать их до одинаковой интегральной громкости, чтобы сравнение шло по качеству, а не по громкости. Измерение, которое позволяет это сделать, мы разбираем в статье о громкости, peak, RMS и LUFS.

A/B-тест отвечает на вопрос «что предпочтительнее». Он не определяет, слышна ли разница вообще – это другой, более строгий вопрос, требующий отдельного метода.

«Подводный камень – забыть выровнять громкость. Самый частый способ испортить слуховой тест – сравнивать клипы на разной громкости. Разницы в 1 дБ достаточно, чтобы повлиять на результат теста предпочтения, и люди надёжно воспринимают «громче» как «лучше». Перед любым A/B-, ABX- или MUSHRA-тестом нормализуйте каждый клип по одной и той же интегральной громкости (LUFS). Пропустите этот шаг – и вы будете измерять не качество, а громкость, а ваш «победитель» окажется просто самым громким файлом. Эта одна ошибка обесценивает больше любительских слуховых тестов, чем любая другая.»

ABX – строгий тест «а слышно ли вообще?»

ABX – самый строгий из четырёх и единственный, способный доказать, что разница реальна, а не воображаема. Настройка: слушателю за один проход предлагают три клипа – A (известный эталон), B (другой известный эталон) и X (тайно выбранный случайно либо A, либо B). Слушатель может сколько угодно раз переслушивать все три и должен ответить на один вопрос: X совпадает с A или с B? Он вынужден определить неизвестное только на слух.

Почему это мощно – дело в случайности. Если слушатель действительно не слышит никакой разницы между A и B, то X неуловим, и выбор сводится к угадыванию – а угадывание бывает верным в 50% случаев. Значит, если слушатель (или панель) правильно определяет X значительно чаще, чем в половине попыток, разница должна быть слышимой; если результат держится около 50% – значит, она не воспринимается. ABX превращает расплывчатый вопрос – «реальна ли эта разница?» – в задачу, сравнимую с подбрасыванием монеты, решаемую статистикой. Это стандартный способ опровергнуть аудиофильские заявления («ты правда слышишь разницу между этим MP3 320 кбит/с и lossless-мастером?») и надёжный инструмент всякий раз, когда нужно убедиться, что изменение вообще воспринимается, прежде чем тратить силы на оценку, насколько оно лучше.

Вот арифметика, придающая результату ABX смысл. Пусть один слушатель проводит 16 проб ABX и даёт 12 верных ответов. Это доказательство того, что он слышит разницу, или просто повезло угадывающему? Проверим против нулевой гипотезы: «он угадывал», где каждая проба – как подбрасывание монеты 50/50. Вероятность получить не менее 12 правильных ответов случайно – это сумма биномиальных вероятностей для 12, 13, 14, 15 и 16 попаданий:

P(≥12 из 16, p = 0.5) = 0.038

Это ниже общепринятого порога 0,05, поэтому гипотеза «он угадывал» отвергается – 12 из 16 верных ответов дают статистически значимое доказательство различимости. Теперь контраст: 10 из 16 верных даёт P(≥10) = 0,227, что заметно выше 0,05 и не доказывает ничего – угадывающий будет достигать этой планки чаще одного раза из пяти. Урок ясен: большинство – не доказательство. Нужно столько попыток и такая доля попаданий, чтобы чистое везение стало маловероятным, а где проходит эта граница, определяет только биномиальный тест.

Рис. 3. ABX превращает «слышишь ли ты это?» в задачу о подбрасывании монеты. Двенадцать из шестнадцати – значимо, десять из шестнадцати – нет. Решает биномиальный тест, а не большинство.

Сколько слушателей действительно нужно?

Самый частый вопрос – и чаще всего отвечаемый наугад – это сколько людей нужно набрать. Единого числа нет, потому что оно зависит от метода, размера эффекта, который вы хотите выявить, и уровня шума в данных. Однако существуют обоснованные значения по умолчанию, и понимать логику их выбора важно, чтобы аргументированно отстаивать свой подход.

Ведущая идея – стандартная ошибка среднего: шум в среднем балле уменьшается пропорционально квадратному корню из числа слушателей. Поэтому среднее по оценкам 25 слушателей вдвое точнее, чем по 6, а не вчетверо – удвоение точности требует вчетверо больше людей. Вот почему в слуховых панелях наступает убывающая отдача: переход с 5 до 15 слушателей даёт заметный прирост, а с 30 до 90 – уже почти ничего. Четыре метода лежат в разных местах:

МетодНа какой вопрос отвечаетВалидных слушателей (типично)Стат. тестРезультат
MOS (P.800 ACR)Абсолютное качество, 1–524+ (лаб.) / сотни (P.808 крауд)среднее + ДИ; ANOVA по системамMean Opinion Score
MUSHRA (BS.1534-3)Промежуточное качество кодеков, 0–100~15+ после отсевасреднее + ДИ; RM-ANOVAбалл 0–100 со скрытым эт. / якорем
A/B предпочтениеЧто предпочитают20–40+двусторонний биномиальный / знаковыйдоля предпочтений (%)
ABX различениеСлышна ли разница вообще1 обуч. слушатель при многих пробах; пул для популяционных выводовбиномиальный vs 50%p-значение: слышно или нет

Читайте таблицу как набор эмпирических правил, а не законов. Для MOS в контролируемом лабораторном тесте обычно требуется 24 и более слушателей; краудсорсинговый тест по P.808 спокойно работает с сотнями – отчасти именно поэтому краудсорсинг и стал популярным. Для MUSHRA стандарт BS.1534-3 рекомендует не менее 15 валидных слушателей после фильтрации по скрытому эталону, отсекающему невнимательных участников, – поэтому изначально набирайте больше 15, чтобы после отбора остаться выше этого порога. Для A/B тестирования нужно столько людей, чтобы доля предпочтений превышала уровень биномиального шума: 20–40 – разумный минимум, а при результатах, близких к 50/50, потребуется больше. Для ABX ситуация иная: один обученный слушатель, прошедший множество проб, может установить, что он слышит разницу, но чтобы сделать вывод о населении в целом, необходимо объединять данные по слушателям и пробам. Объединяющее правило: метод и количество слушателей следует выбирать до начала сбора данных, а не после предварительного ознакомления с ними.

Разбор примера: как читать результат MUSHRA

Числа на шкале качества приобретают смысл только тогда, когда вы хотя бы раз обработаете их статистически. Допустим, вы тестируете четыре настройки кодека для стримингового продукта на одном наборе музыкальных клипов с помощью теста MUSHRA, привлекаете 20 слушателей, а после отсева по скрытому эталону остаётся 17 валидных ответов. Усредняя оценки от 0 до 100 по 17 слушателям и клипам, вы получаете:

  • Скрытый эталон: 98 (проверка адекватности – около 100, как и должно быть)
  • Система A – высокий битрейт: среднее 82, стандартное отклонение 9 по слушателям
  • Система B – средний битрейт: среднее 74, стандартное отклонение 11
  • Якорь (ФНЧ 3.5 кГц): 22 (проверка – около минимума, как и должно быть)

Действительно ли A и B различаются, или разрыв в 8 баллов находится в пределах погрешности? Вычислим стандартную ошибку каждого среднего – стандартное отклонение, делённое на квадратный корень из числа слушателей:

стандартная ошибка (A) = 9 ÷ √17 = 9 ÷ 4,12 = 2,18 стандартная ошибка (B) = 11 ÷ √17 = 11 ÷ 4,12 = 2,67

95-процентный доверительный интервал – примерно две стандартные ошибки по обе стороны от среднего значения, так что для Системы A это 82 ± 4,4 (примерно от 77,6 до 86,4), а для Системы B – 74 ± 5,3 (примерно от 68,7 до 79,3). Эти интервалы едва пересекаются, что указывает на реальную разницу между системами – но именно в таких случаях, когда пересечение «едва-едва», оценка на глаз становится ненадёжной, и нужно проводить формальный статистический тест (например, повторный дисперсионный анализ – repeated-measures ANOVA, учитывающий, что одни и те же слушатели оценивали обе системы). Скрытый эталон на уровне 98 и якорь на 22 подтверждают, что участники панели были внимательны и использовали всю шкалу оценок – значит, данные можно считать достоверными. Средние значения дают общую картину, а доверительные интервалы и ANOVA показывают, насколько эта картина реальна. Без них результат сводится к голой догадке, замаскированной под точные цифры: «A набрала 82, B – 74, значит, A лучше».

Субъективное и объективное тестирование дополняют друг друга

Субъективное тестирование – эталон истины, но оно медленное и требует реальных затрат времени и денег слушателей, поэтому его нельзя проводить при каждом изменении кода. Объективные метрики – подробно рассмотренные в статье о PESQ, POLQA и ViSQOL – заполняют этот пробел, автоматически предсказывая MOS достаточно быстро для использования в сборочном конвейере. Эти два подхода не соперничают, а работают как эстафета. Субъективный тест вы запускаете несколько раз в год, чтобы установить истину и откалибровать объективную метрику – убедиться, что она по-прежнему отражает мнение людей на вашем контенте. Далее объективная метрика отслеживает каждую сборку между такими проверками, и вы доверяете её «зелёной галочке» именно потому, что панель экспертов уже подтвердила её соответствие человеческому восприятию.

У этих отношений есть режим отказа, который стоит назвать. Объективные метрики перестают совпадать с мнением людей в тот момент, когда конвейер обрабатывает что-то, на чём метрика не обучалась – например, новый нейросетевой кодек, агрессивный шумоподавитель или функцию генеративного аудио. Этот дрейф остаётся незамеченным, пока не запустишь человеческий тест, который его выявляет. Поэтому правило простое: когда метрика и люди расходятся, правы люди, а метрику нужно перекалибровать. Современные метрики без эталона вроде DNSMOS P.835 и NISQA сами обучены на больших краудсорсинговых тестах по P.808 – тот же принцип, записанный в софт: любое автоматическое число качества в конечном счёте восходит к комнате (или толпе) людей, которые слушали.

Инструменты, которыми реально можно пользоваться

Чтобы провести надёжный слуховой тест в 2026 году, лаборатория вещания уже не нужна. Несколько открытых фреймворков корректно реализуют эти методы «из коробки». webMUSHRA от Fraunhofer IIS и International Audio Laboratories Erlangen – браузерный фреймворк, позволяющий проводить MUSHRA-тесты по стандарту BS.1534 (а также парные сравнения и другие методы), ставший де-факто стандартом для академической оценки аудиокодеков. BeaqleJS – открытый фреймворк на HTML5/JavaScript, способный выполнять как ABX-, так и MUSHRA-тесты в любом современном браузере. Для оценки речевого MOS на уровне краудсорсинга P.808 Toolkit от Microsoft обеспечивает полный набор методов ACR/DCR/CCR на платформе Amazon Mechanical Turk.

Однако дисциплина важнее инструмента: выровняйте громкость аудиофрагментов, рандомизируйте порядок их воспроизведения, отсекайте неподходящих слушателей, заранее зафиксируйте метод и размер выборки – и только после этого запускайте корректный статистический тест. Инструмент обеспечивает интерфейс; строгость – на вас.

Где здесь Фора Софт

Мы разрабатываем видеоконференции, телемедицину, онлайн-обучение, OTT-стриминг и системы видеонаблюдения, и в каждом из этих направлений вопрос «стало ли действительно лучше звучать?» рано или поздно решается человеческим ухом. Мы применяем субъективное тестирование так, как описано в статье: A/B- и ABX-тесты, когда нужно понять, заметно ли изменение вообще; MUSHRA – при выборе настроек кодека для стримингового продукта; и краудсорсинговый MOS, чтобы поддерживать автоматические гейты качества объективными. Клиницисту важно чётко слышать пациента, а студенту – каждое слово лекции, поэтому для таких продуктов слуховой тест – не академическое упражнение, а финальная проверка перед выпуском решения в релиз. Эти тесты находятся на одном уровне с другими инструментами аудиоанализа; см. конвейер аудио WebRTC целиком и runbook диагностики звука в проде. Надёжность метода зависит от надёжности отбора участников и статистической обработки данных.

Ключевые выводы

  • Субъективное тестирование предполагает оценку или сравнение звука реальными слушателями – это эталон, который должны предсказывать все метрики.
  • MOS оценивает качество речи по шкале от 1 до 5 (P.800/P.808); MUSHRA оценивает кодеки по шкале от 0 до 100 с использованием скрытого эталона и якорных образцов.
  • Метод A/B позволяет определить предпочитаемый фрагмент; ABX проверяет слышимость различий с помощью биномиального теста.
  • Всегда начинайте с выравнивания громкости – люди склонны воспринимать более громкий звук как лучший, и это чаще всего искажает результаты тестов.
  • Метод и количество слушателей следует определить до начала сбора данных; точность результатов растёт пропорционально квадратному корню из числа участников.
  • Результаты без доверительных интервалов или проверки статистической значимости – это не более чем предположение; окончательное решение принимает статистика, а не мнение большинства.

Что почитать дальше

CTA

  • Поговорить со стриминг-инженером – обсудить дизайн слухового теста, который действительно поможет решить ваш вопрос с качеством звука.
  • Посмотреть наши кейсы – примеры реал-тайм и стриминговых продуктов, выпущенных с 2005 года.
  • Скачать памятку по субъективному тестированиюодностраничный выбор метода MOS / MUSHRA / A/ B / ABX и гид по статистике.

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.