Термин
Pensieve
Нейросетевой ABR-алгоритм, опубликованный исследователями MIT в 2017 году, изучает политику выбора рендера с помощью reinforcement learning вместо ручных эвристик.
Pensieve (Mao, Netravali, Alizadeh – ACM SIGCOMM 2017) – первая широко цитируемая демонстрация ABR на основе reinforcement learning. Модель принимает на вход недавнюю пропускную способность, текущий уровень буфера, последний выбранный вариант качества и оставшуюся продолжительность контента, а на выходе выдаёт распределение вероятностей по следующим вариантам качества. Обучение проводилось с использованием алгоритма A3C (Asynchronous Advantage Actor-Critic) на симулированных сетевых трассах, полученных на основе реальных измерений в сотовых сетях и широкополосного доступа. Обученная модель превзошла BOLA и MPC на тестовых трассах.
Pensieve имел большое значение как proof-of-concept: он показал, что ABR-алгоритм можно обучить end-to-end без явных допущений о модели и обойти аккуратные ручные эвристики. Несколько последующих работ распространили этот подход на модели, адаптированные под конкретный контент, решения ABR на стороне edge и обучение с использованием federated learning. В продакшене он встречается редко – большинство операторов предпочитают интерпретируемость и предсказуемость эвристических ABR-алгоритмов.
Наследие Pensieve выходит за рамки его прямого применения. Подход, основанный на обучении с подкреплением (RL), повлиял на подходы к ABR в каждой крупной стриминговой команде. Bitmovin, THEO и несколько меньших поставщиков плееров предлагают «ML-оптимизированные» ABR-опции, основанные на обучении в стиле Pensieve. Персонализированная ABR-стратегия Netflix, подстраивающаяся под каждый контент, имеет в лице Pensieve своего интеллектуального предшественника.
Считаете параметры для своего продукта?
Поможем собрать энкодер-леддер и посчитать стоимость доставки – до старта разработки.