YOLO в рабочей системе – v8, v9, v10, v11, v12

Автор: Николай СапуновОбновлено: август 202629 мин чтения
Содержание статьи +

Кратко

Между январём 2023 и февралём 2025 семейство YOLO – рабочая лошадка детекции объектов, которая в видео-продуктах поставлена чаще, чем все остальные детекторы вместе – прошло пять мажорных версий: YOLOv8, YOLOv9, YOLOv10, YOLOv11, YOLOv12. Каждая версия меняла что-то конкретное в продуктовом решении: v8 сделала YOLO anchor-free и мульти-задачной, v9 добавила градиентный пайплайн, который позволил маленьким моделям не отставать от больших, v10 удалила пост-обработку, съедавшую пять миллисекунд латентности, v11 переписала backbone и сократила параметры на 22% при росте точности, а v12 впервые принесла внимание (attention) в реальное-временной детектор. Правильная версия для вашего продукта почти никогда не «самая новая» – это та, чьи архитектура, лицензия и история деплоя совпадают с количеством камер, бюджетом точности и аппетитом юриста к AGPL-3.0. Статья пройдёт пять версий решение-за-решением, чтобы вы выбрали правильно с первого раза.

Зачем Это Важно

Если вы готовите запуск детекции объектов в видео-продукте – система видеонаблюдения, ритейл-аналитика, фитнес-приложение, пайплайн модерации OTT, инструмент сортировки в телемедицине – YOLO почти наверняка та модель, которую инженерная команда выберет в первую очередь. Вопрос – какая YOLO. Ошиблись – потратите три месяца на переобучение, когда выйдет следующая версия; обнаружите, что AGPL-3.0 обязывает вас открыть исходники всего приложения; или поставите модель, латентность которой ваше количество камер никогда не покроет в рамках бюджета. Статья предполагает, что вы уже читали урок 2.1 про предобработку для CV-проектов – пайплайн предобработки решает половину точности YOLO в продакшене – и урок 1.4 про реальную стоимость ИИ в видео-продуктах, потому что стоимость одного inference YOLO на поток – это то, что превращает фича-решение в юнит-экономику. К концу статьи вы сможете прочитать релизную заметку YOLO, сопоставить её с пятью версиями ниже и сказать своей инженерной команде ровно, какую брать и почему.

Что «YOLO» Означает В Продакшене В 2026

Аббревиатура «You Only Look Once» – YOLO – с 2016 года в разговоре о computer vision перегружена, и слово теперь относится как минимум к трём разным вещам, которые путаются на любом kickoff-митинге. Сначала разведём.

Оригинальная YOLO, YOLOv1, – это одна архитектура 2015–2016 годов авторства Джозефа Редмона, которая предложила тогда новое: предсказывать боксы и классы объектов для всего изображения за один прямой проход свёрточной сети, вместо того чтобы запускать стадию region proposal и потом отдельно стадию классификации. Эта статья – причина, по которой «YOLO» стало брендом. Редмон с соавторами написал YOLOv1, v2 и v3 между 2016 и 2018 годами и потом отошёл от проекта.

Второе, что называют YOLO, – линейка версий, которая пошла за оригиналом: YOLOv4, YOLOv5, YOLOv6, YOLOv7, YOLOv8, YOLOv9, YOLOv10, YOLOv11, YOLOv12 и, с конца 2025-го, YOLO26. Каждую писала другая команда в другой организации, каждая шла под другой лицензией, каждая показывала другую архитектуру, и каждая претендует быть законным наследником оригинала. На самом деле это не одна линейка. Это бренд, расколотый между командами, которые согласились, что имя YOLO несёт достаточно инженерной репутации, чтобы стоить борьбы.

Третье – продуктовая линейка Ultralytics: YOLOv5, YOLOv8, YOLOv11 и YOLO26 написаны и поддерживаются Ultralytics, британской компанией, основанной Гленном Джокером (автором YOLOv5). Ultralytics выпускает Python-пакет ultralytics, владеет лицензией AGPL-3.0 на open-source выпуск и продаёт коммерческую enterprise-лицензию командам, которые не могут жить с обязательствами AGPL. Когда продакт говорит «мы возьмём YOLO», обычно имеется в виду «мы возьмём пакет Ultralytics», потому что у этого пакета документация, облачный сервис обучения, интеграция с Roboflow и SDK для инференса. Версии в статье – v8, v9, v10, v11, v12 – охватывают и релизы Ultralytics, и независимые академические релизы, работающие рядом с пакетом Ultralytics.

Вывод для продуктового решения прямой. Выбрать «YOLO» недостаточно; команда должна выбрать конкретную версию, конкретную лицензию и конкретную deployment-цель. Пять версий ниже – те, между которыми продакшен-команда в 2026 году реально выбирает. Более старые (v5, v7) всё ещё крутятся в продакшене, но архитектурного преимущества, которое оправдало бы миграцию, у них нет – если только юридические ограничения не зафиксировали вас на них.

Рисунок 1. Пять версий YOLO, выпущенных между январём 2023 и февралём 2025. Каждая версия поменяла одну конкретную вещь в продуктовом решении; правильная версия – та, чья перемена совпадает с узким местом вашего проекта.

YOLOv8 – Январь 2023 – Anchor-Free, Мульти-задачная База

YOLOv8 – версия, которая превратила бренд YOLO из односерийного детектора в универсальную vision-платформу. Ultralytics выпустила её 10 января 2023 года, и за полгода она стала дефолтной отправной точкой для почти любого нового CV-проекта, у которого не было веской причины брать что-то другое. Причина была не в чистой точности – предыдущие YOLO были близки. Причина в том, что YOLOv8 приняла три инженерных решения, которые сжали стоимость запуска CV-продукта.

Первое решение – anchor-free детекционная голова. Предыдущие YOLO использовали «якоря» (anchors) – набор заранее заданных форм бокса (высокий, широкий, квадратный, маленький, большой), который модель училась подгонять под реальные объекты. Якоря приходилось настраивать под каждый датасет, потому что у датасета кофейных кружек другие соотношения сторон, чем у датасета припаркованных машин, и ошибка тут стоила точности. YOLOv8 удалила якоря и попросила модель предсказывать координаты бокса напрямую. Эффект: модель обучалась быстрее на кастомных датасетах, лучше обобщалась, когда данные клиента не совпадали с распределением претренировки, и выдавала меньше избыточных боксов, которые приходилось чистить шагу Non-Maximum Suppression (NMS).

Второе решение – модуль C2f (Cross-Stage Partial Bottleneck with two convolutions). C2f заменил более старый модуль C3 в backbone – той части модели, которая превращает сырые пиксели в полезные признаки. Смысл C2f был не в крупном приросте точности; смысл был в улучшении прохождения градиента при обучении, чтобы модель сходилась за меньшее количество эпох при той же финальной точности. На практике это значило: кастомно обученная YOLOv8 доходила до продакшен-качества за 50 эпох там, где YOLOv5 требовала 100, что напрямую давало 50% экономии стоимости облачного обучения на эксперимент.

Третье решение – поддержка мульти-задач из коробки. YOLOv8 поставляется пятью вариантами модели – детекция, instance segmentation, классификация, pose/keypoints, oriented bounding box – которые делят один backbone и один pipeline обучения. Ритейл-команда, которой сейчас нужна детекция, а через полгода сегментация, может прогнать обе задачи через один пакет ultralytics, один формат датасета и один тренировочный скрипт. Никакой другой детектор в 2023 году не паковал пять задач так чисто. В проекте видеонаблюдения, где нужно детектировать людей, сегментировать их силуэты для блюра приватности и оценивать позу для детекции падений, история мульти-задач сама по себе оправдывает выбор YOLOv8.

Бенчмарки COCO для YOLOv8 – стандартный референс точности на held-out датасете из 80 классов – такие: 37.3% mAP для YOLOv8n (nano-вариант, 3.2M параметров), 44.9% для YOLOv8s (11.2M параметров), 50.2% для YOLOv8m (25.9M параметров), 52.9% для YOLOv8l (43.7M параметров), 53.9% для YOLOv8x (68.2M параметров). Цифры взяты с официальной карточки модели Ultralytics. «mAP» – mean Average Precision, усреднённая по детекционным порогам – это головная метрика точности детектора; модель с 50.2% детектирует и корректно классифицирует примерно половину объектов в датасете в строгом диапазоне IoU 0.50–0.95.

Главная слабость YOLOv8 в 2026 – что дизайн «C2f + anchor-free» побит на любой оси любой последующей версией. Для нового проекта стартовать с v8 нет сильных причин – разве что у команды уже стоит YOLOv8 в продакшене и стоимость миграции квартал не вытянет.

YOLOv9 – Февраль 2024 – Градиентный Пайплайн, Который Спас Маленькие Модели

YOLOv9 вышла 21 февраля 2024 года, авторы – академическая группа во главе с Chien-Yao Wang (ранее писал YOLOv4 и YOLOv7). Это не релиз Ultralytics, но Ultralytics быстро добавил поддержку YOLOv9 в пакет ultralytics. Релиз вышел как paper «YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information», позже принят на ECCV 2024.

YOLOv9 сделала одно архитектурное изменение, которое было важнее всего остального: закрыла разрыв точности на маленьких моделях. В любой версии YOLO до v9 самые маленькие варианты («n» и «s», которые помещаются на edge-железо) теряли измеримую точность, которую большие («m», «l», «x») не теряли. Причина была в динамике обучения: с углублением сети полезный сигнал градиента терялся в слоях, и маленькая модель – у которой и так слоёв меньше – голодала по градиенту в первую очередь. Решение в v9 – двухчастное.

Первая часть – Programmable Gradient Information (PGI). Тренировочный пайплайн несёт параллельную вспомогательную сеть, которая кормит основную надёжным сигналом градиента для каждого слоя и потом выбрасывается на этапе инференса. Вспомогательная сеть ничего не стоит на деплое, потому что удаляется перед экспортом. На обучении она не даёт маленьким вариантам голодать по градиенту.

Вторая часть – новый backbone GELAN (Generalized Efficient Layer Aggregation Network). GELAN построен вокруг того, что авторы назвали «gradient path planning» – структурным решением, которое явно проектирует маршруты, по которым градиенты идут обратно сквозь сеть, чтобы правильный сигнал доходил до правильного слоя. Архитектурная деталь менее важна, чем практический результат: YOLOv9-tiny достигла 38.3% mAP на COCO, обогнав YOLOv8n с 37.3% при 21% меньше параметров и 24% меньше FLOPs. По всей линейке YOLOv9 даёт 49% меньше параметров и 43% меньше вычислений по сравнению с YOLOv8 при той же точности. Для edge-деплоя, где модель должна поместиться на Raspberry Pi или Jetson Orin Nano, это разница между «запустить» и «не запустить».

Главная слабость YOLOv9 – она вышла в плотный месяц: Ultralytics через три месяца выпустила YOLOv10 (тоже через paper, не через пакет ultralytics, но с интеграцией Ultralytics), и история NMS-free от v10 перехватила deployment-внимание у градиентной истории v9. В 2026 v9 – правильный выбор для одного конкретного сценария: edge-проект, которому нужна абсолютно самая маленькая модель с приемлемой точностью и который может жить со стандартным NMS пост-процессингом.

YOLOv10 – Май 2024 – Архитектура Без NMS

YOLOv10 вышла в мае 2024 года, авторы – академическая группа Tsinghua University во главе с Ao Wang, Hui Chen и Lihao Liu, опубликована как paper «YOLOv10: Real-Time End-to-End Object Detection» (arXiv 2405.14458). Статья принята на NeurIPS 2024. Ultralytics быстро добавил поддержку YOLOv10 в пакет.

YOLOv10 сделала одно продакшен-важное изменение, которое значило больше любого прироста точности на странице: удалила шаг Non-Maximum Suppression из пайплайна инференса. Чтобы понять, почему это важно, надо понимать, что делает NMS и зачем он был нужен любой предыдущей YOLO.

Любая предыдущая YOLO выдавала несколько перекрывающихся боксов для одного объекта на инференсе. «Человек» в кадре обычно генерировал три, пять или двенадцать кандидатных боксов с разной уверенностью, и шаг NMS обходил их, выбирал самый уверенный, выбрасывал перекрывающиеся и повторял, пока не оставался один бокс на объект. NMS корректен, но дорог. На YOLOv8s, запущенной на NVIDIA T4, NMS добавлял примерно 4–6 миллисекунд латентности на каждый inference – около четверти всего времени инференса. NMS также плохо экспортировался в встраиваемые inference-рантаймы; команды, целящиеся в CoreML, TFLite и OpenVINO, часто переписывали NMS вручную в deployment-рантайме, и это категория багов, которая съедала недели инженерного времени на проект.

YOLOv10 решила проблему NMS через consistent dual label assignments. На обучении модель использовала две параллельные головы назначения меток: one-to-many (которая порождала поведение «много перекрывающихся боксов», которое потом чистил NMS) и one-to-one (которая выдавала ровно один бокс на объект). На инференсе модель отбрасывала one-to-many голову и пользовалась только one-to-one, которая выдавала чистые предсказания без какого-либо NMS пост-процессинга. Две головы обучались соглашаться, и точность не падала.

Бенчмарки для YOLOv10-S: 46.7% mAP при ~2.49 мс инференса на T4 – выигрыш у YOLOv8-S на 2.0 mAP при 19% меньше латентности и у YOLOv9-S на 0.7 mAP при 30% меньше латентности. NMS-free обучение сократило end-to-end латентность YOLOv10-S на 4.63 мс по сравнению с базой v8 – ровно тот бюджет, который надо вернуть на кадр, если вы пропихиваете 200-камерную систему видеонаблюдения через один GPU.

Главная слабость YOLOv10 – лицензионная: академический релиз под AGPL-3.0 (унаследована через интеграцию Ultralytics), и GitHub-репозиторий THU-MIG тоже под AGPL-3.0. Та же юридическая логика, что гейтит YOLOv8 в продакшене, гейтит и YOLOv10. В 2026 v10 – правильный выбор для любой команды, которой нужна самая низкая латентность на кадр в реальном-временном пайплайне (live-алертинг видеонаблюдения, video-эффекты в звонке, pose-трекинг в WebRTC), и которая либо может позволить себе enterprise-лицензию Ultralytics, либо готова открыть исходники приложения.

YOLOv11 – Сентябрь 2024 – Backbone-Редизайн Под Edge

YOLOv11 выпущена Ultralytics 10 сентября 2024 года. Это продуктовый релиз Ultralytics (как v5 и v8), идёт через тот же Python-пакет ultralytics и под той же двухтрековой лицензией AGPL-3.0 / enterprise. Версия не предложила одной драматической новой идеи как PGI у v9 или NMS-free у v10; она консолидировала линейку YOLO в более чистую архитектуру, которая обгоняет v8 на любой метрике и быстрее работает на edge-железе.

Архитектурное изменение, которое значимо, – блок C3k2, заменивший C2f в backbone. C3k2 – это вариант паттерна Cross-Stage Partial с разными размерами ядра (смесь 3×3 и 5×5 свёрток) и стратегией разделения каналов, которая сократила избыточное извлечение признаков. Практический результат: YOLO11m достигла ~1.3% более высокого mAP, чем YOLOv8m на COCO, при 22% меньше параметров, что превратилось в ~22% уменьшения размера ONNX-экспорта и измеримое ускорение на CPU-инференсе.

YOLOv11 также добавила два attention-подобных модуля – SPPF (Spatial Pyramid Pooling, Fast), перешедший из v8, и новый C2PSA (Cross-Stage Partial Spatial Attention), блок пространственного внимания в neck. C2PSA – это более лёгкий родственник полного self-attention; он не платит квадратичную вычислительную цену трансформера, но помогает модели сфокусироваться на релевантных регионах изображения, что улучшило точность на маленьких и заслонённых объектах. Каноничный сценарий – ритейл-камера, где наполовину спрятанного человека в глубине прохода надо детектировать.

Главные COCO-числа для YOLOv11: 39.5% mAP для YOLOv11n (2.6M параметров), 47.0% для YOLOv11s, 51.5% для YOLOv11m, 53.4% для YOLOv11l, 54.7% для YOLOv11x. Соотношение mAP-на-параметр – лучшее в линейке на эту точку. На T4 с TensorRT YOLOv11n даёт латентность около 1.5 мс; на NVIDIA Jetson Orin Nano та же модель – 8–10 мс, чего достаточно для real-time 30 fps на нескольких потоках камер.

YOLOv11 также сохраняет полный мульти-задачный набор – детекция, instance segmentation, классификация, pose, oriented bounding box – который ввёл v8. Для большинства продуктовых команд в 2026, собирающих новую vision-фичу на CPU или умеренном GPU, YOLOv11 – дефолтный выбор. Это версия с самой чистой документацией, самым большим каталогом open-source чекпойнтов и самым зрелым export-пайплайном для рантаймов, на которые команда чаще всего целится (ONNX, TensorRT, OpenVINO, CoreML, TFLite).

Главная слабость YOLOv11 та же, что у YOLOv8: AGPL-3.0 делает коммерческое использование неудобным, если команда не купит enterprise-лицензию Ultralytics, и этот разговор юрист поведёт с инженерией ещё до экспорта первой модели.

YOLOv12 – Февраль 2025 – Attention-Центричный Детектор

YOLOv12 выпущена 18 февраля 2025 года, авторы – академическая группа во главе с Yunjie Tian, Qixiang Ye и David Doermann, paper «YOLOv12: Attention-Centric Real-Time Object Detectors» (arXiv 2502.12524), принят постер-доклад на NeurIPS 2025. Релиз внёс архитектурное изменение, которого любой наблюдатель YOLO ждал с 2020 года: real-time детектор, построенный вокруг attention вместо свёрток, с числами скорости, которые это подкрепляют.

Для нетехнического читателя: «attention» (внимание) – это механизм, который питает любую современную большую языковую модель – GPT-5, Claude Opus 4, Gemini 2.5 – а также современные vision-трансформеры (ViT, SAM 2, CLIP). Attention работает так: каждая часть входа смотрит на каждую другую часть и учится, какие другие части важны для текущего предсказания. Исторический трейд-офф – компьют: наивный attention масштабируется квадратично по размеру входа, и поэтому свёрточные сети (где каждый фильтр смотрит только на маленький локальный патч) доминировали real-time детекцию объектов целое десятилетие. Любая предыдущая попытка принести attention в real-time детектор – DETR, RT-DETR, Deformable DETR – платила латентностью то, что выигрывала точностью.

YOLOv12 сделала attention достаточно дешёвым, чтобы поставить в продакшен, через сочетание трёх идей. Первая – Area Attention (A2), который делит карту признаков на пространственные сегменты и считает attention только внутри каждого сегмента. Receptive field – часть входа, которую модель видит за раз – остаётся большим, потому что сегменты перекрываются, но квадратичная стоимость уходит, потому что attention локальный. Вторая – R-ELAN (Residual Efficient Layer Aggregation Network), переписанный блок агрегации признаков с residual-связью и механизмом масштабирования. R-ELAN решил оптимизационные проблемы, на которые попадались более ранние attention-детекторы, где attention-головы расходились рано на обучении и модель не выживала. Третья – FlashAttention на инференсе. FlashAttention – численно эквивалентная реализация attention, переупорядочивающая обращения к памяти под быструю on-chip SRAM на GPU, что может дать 2–4× ускорения attention без изменения выхода.

Бенчмарки YOLOv12: 40.6% mAP для YOLOv12-N при 1.64 мс на T4, 48.0% для YOLOv12-S при 2.61 мс, до 55.2% для YOLOv12-X. YOLOv12-N обгоняет YOLOv10-N на 2.1 mAP и YOLOv11-N на 1.2 mAP при сопоставимой скорости. Для нетехнического читателя: attention-детекция раньше отставала на 5–15 мс от свёрточной при той же точности; YOLOv12 этот разрыв закрыла.

Оговорки на деплой важны. FlashAttention требует NVIDIA GPU с определённой архитектурной поддержкой – Turing (T4, Quadro RTX), Ampere (A30, A40, A100, RTX 30-серия), Ada Lovelace (RTX 40-серия), Hopper (H100, H200). На более старых GPU, на Apple Silicon, на AMD GPU и на большинстве edge-железа (Jetson Nano, Raspberry Pi, Intel CPU) FlashAttention либо вообще не запускается, либо медленнее стандартной реализации attention. Обёртка Ultralytics YOLO12 не требует FlashAttention – она откатывается на нативный PyTorch – но преимущество скорости, ради которого имеет смысл брать YOLOv12 вместо YOLOv11, в этом откате исчезает. Лицензия тоже важна: академический релиз при интеграции через ultralytics наследует двухтрековую лицензию AGPL-3.0 / enterprise.

В 2026 YOLOv12 – правильный выбор для проектов, у которых в deployment-цели есть NVIDIA-GPU-ускорение – облачные серверы, современные рабочие станции, NVIDIA Jetson AGX Orin – и которым нужна максимальная точность real-time детектора. Для edge-устройств без FlashAttention правильный выбор – YOLOv11. Для чисто CPU-bound деплоев YOLO26 (выпущена в сентябре 2025) уже обогнала обе: до 43% быстрее CPU-инференса, чем YOLO11-N, при сопоставимой точности.

Сравнение Пяти Версий В Продакшене

Таблица ниже сворачивает пять версий в одну decision-вьюшку. Читайте по строкам: строка под узкое место вашего проекта говорит, какую брать версию.

Ось решенияYOLOv8YOLOv9YOLOv10YOLOv11YOLOv12
Дата релизаЯнв 2023Фев 2024Май 2024Сен 2024Фев 2025
АвторUltralyticsWang и соавт. (акад.)THU (акад.)UltralyticsTian и соавт. (акад.)
Лицензия (open)AGPL-3.0GPL-3.0 / AGPL через UltralyticsAGPL-3.0AGPL-3.0AGPL-3.0 через Ultralytics
Коммерческий путьUltralytics ent.Акад. / Ultralytics ent.Акад. / Ultralytics ent.Ultralytics ent.Ultralytics ent.
Ключевое архитектурное изменениеAnchor-free + C2fPGI + GELANNMS-free dual labelC3k2 + C2PSAArea Attention + R-ELAN
Nano mAP (COCO)37.3%38.3%38.5%39.5%40.6%
Nano латентность T4 (мс)~1.8~2.0~1.9~1.5~1.64
Поддержка мульти-задач5 задачТолько детекцияТолько детекция5 задачДетекция (остальные позже)
NMS на инференсеДаДаНетДаДа
Зависимость от FlashAttentionНетНетНетНетОпционально (для скорости)
Дефолт 2026 дляМиграция legacyEdge с самой мелкой модельюСамая низкая латентностьДефолт нового проектаМакс. точность на NVIDIA GPU

Рисунок 2. Сравнение пяти версий для продакшена. Числа – из официальных карточек моделей Ultralytics и соответствующих papers; латентность зависит от размера батча, разрешения и версии TensorRT, так что относительный порядок важнее абсолютных значений.

Рабочий Пример Стоимости – 200 Камер, Три Версии

Сделаем сравнение конкретным. Представьте ритейл-проект против воровства: 200 камер в 10 магазинах, 1080p H.264 при 30 fps, детекция человека и сумки при 6 fps на камеру (самая медленная каденция, которая ловит 4-секундное событие воровства, по уроку 2.1). Нагрузка: 200 × 6 = 1 200 inferences/сек по всей сети.

На NVIDIA L4 ($1.10/час на AWS в 2026) YOLOv8s с TensorRT INT8 квантизацией обрабатывает ~350 inferences/сек на GPU при 1080p. Парку нужно ⌈1 200 / 350⌉ = 4 GPU, стоимость 4 × $1.10 × 24 × 30 = $3 168 в месяц. Reserved-тарифы дают ~$2 000 в месяц.

Тот же парк на YOLOv11s – тот же воркфлоу, тот же TensorRT INT8 – обрабатывает ~480 inferences/сек на GPU благодаря C3k2-бэкбону с меньшими FLOPs при большей точности. Парку нужно ⌈1 200 / 480⌉ = 3 GPU, стоимость 3 × $1.10 × 24 × 30 = $2 376 в месяц. Reserved: ~$1 500.

Тот же парк на YOLOv12s с включённым FlashAttention на L4 – ~530 inferences/сек на GPU; парку нужно ⌈1 200 / 530⌉ = 3 GPU при той же месячной стоимости. Покупка – точность: YOLOv12s даёт 48.0% mAP против 47.0% у YOLOv11s и 44.9% у YOLOv8s, что превращается в ~3 пп меньше ложноотрицательных (пропущенных воров) при той же ложноположительной ставке.

Вывод для продуктового решения прямой. 200-камерный ритейл экономит ~$800 в месяц при переходе с v8 на v11 и ноль долларов в месяц при переходе с v11 на v12 – но получает измеримый прирост точности, что на loss-prevention KPI и есть то, за что клиент платит. Правильный выбор тут – YOLOv12s; правильный выбор для меньшего деплоя без L4 (и потому без FlashAttention) – YOLOv11s.

Типичные Промахи

Прогресс пяти версий прячет четыре промаха, которые ловят продуктовые команды каждый квартал, и цена попадания измеряется неделями инженерной переработки.

Первый промах – брать самую новую версию по умолчанию. YOLOv12 – самый свежий детектор в линейке v8–v12, а YOLO26 – самый свежий вообще, но ни один автоматически не правильный ответ. YOLOv12 требует FlashAttention-совместимых NVIDIA GPU для своей скорости; на deployment-цели без такого GPU – Apple Silicon, AMD GPU, Intel CPU, старые Jetson – YOLOv11 быстрее. CPU-преимущество YOLO26 реально, но продукт ещё зреет (выпущена в сентябре 2025), так что команды, которым нужен крупнейший каталог чекпойнтов и самый зрелый export-пайплайн, всё равно берут YOLOv11. «Самая новая по умолчанию» – самая частая единственная ошибка.

Второй промах – игнорировать AGPL-3.0 до дня экспорта. Любой Ultralytics-релиз YOLO (v5, v8, v11, v12 через ultralytics, YOLO26) идёт под двойной лицензией AGPL-3.0 / enterprise. AGPL-3.0 – copyleft, и в трактовке Ultralytics обязывает любую организацию, разворачивающую YOLO в сетево-доступном сервисе, выложить исходники этого сервиса под AGPL-3.0. Для закрытого коммерческого продукта – это не вариант. Лекарство – enterprise-лицензия Ultralytics, цена которой – нижний пятизначный диапазон долларов в год для стартапа, и масштабируется выше. Поговорите с юристом в первой неделе проекта, а не в двенадцатой.

Третий промах – путать «мы используем YOLO» и «мы используем COCO-классы». Претренированные чекпойнты Ultralytics – yolov8n.pt, yolo11s.pt, yolov12m.pt – обучены на датасете COCO, в котором 80 классов объектов (person, car, bottle, dog, traffic-light и т. д.). Для ритейл-, surveillance- или fitness-деплоя почти никаких классов клиента в COCO нет. Претренированная модель – стартовая точка, а не продукт. Команде придётся разметить кастомный датасет (обычно 500–5 000 изображений на класс), дообучить модель за 50–250 эпох, провалидировать на отложенном тесте и переэкспортировать. Пропуск шага дообучения – вторая по частоте причина «в демо работает, в продакшене не работает».

Четвёртый промах – поставлять FP32 в продакшен-рантайм. Пакет Ultralytics экспортирует модели в FP32 по умолчанию, что корректно для оценки, но пессимистично для деплоя. INT8 квантизация через TensorRT (NVIDIA), OpenVINO (Intel) или CoreML (Apple) обычно даёт 2–4× ускорение инференса при потере менее 1% mAP – ровно та разница между двумя и четырьмя GPU в примере стоимости выше. Квантуйте на валидационном сете, замерьте просадку mAP и поставляйте квантованную модель, если просадка приемлема. Export-пайплайн Ultralytics поддерживает INT8 в каждом мажорном таргете.

История Деплоя – Цели Экспорта В 2026

Репутация YOLO в продакшене стоит не меньше на export-пайплайне, чем на самой модели. Пакет Ultralytics поддерживает глубокий список export-таргетов, у каждого свой use case, и матрица решений – часть любого проекта.

Таргет-рантаймЖелезоТипичное ускорение vs PyTorchUse case
ONNX (CPU)Любой CPU1.5–3×Кросс-платформенный фолбэк, лёгкий серверный инференс
TensorRTNVIDIA GPU3–5×Облачный GPU, Jetson edge, DeepStream-пайплайны
OpenVINOIntel CPU / iGPU2–4× на CPUIntel-edge, заводские камеры, on-prem серверы
CoreMLApple Silicon (M, A)2–4×iOS-приложения, macOS, Vision Pro
TFLite (INT8)Android, edge-SoC2–5×Мобайл, IoT, микроконтроллеры
TensorFlow.jsБраузер (WebGL / WebGPU)1–2×Client-side инференс в веб-приложениях

Рисунок 3. Матрица export-таргетов для Ultralytics YOLO. Пакет Ultralytics упаковывает каждый таргет в один вызов model.export(), но тонкая настройка под таргет (калибровочный сет для INT8, размер батча, точность) – это инженерная работа, которая определяет, попадёт ли деплой в бюджет.

Дефолт 2026 для облачного GPU-деплоя – TensorRT с INT8; для iOS – CoreML с FP16; для Android – TFLite с INT8; для Intel-edge – OpenVINO с INT8; для фолбэка – ONNX на хост-CPU. Для кросс-платформенного продукта, поставляющегося во все пять рантаймов – типично для B2B vision-продуктов – пакет Ultralytics автоматизирует большую часть тюнинга, но шаг валидации (замер per-runtime точности на отложенном тесте) необсуждаем. Рантайм, который «выглядит корректно в CI», всё ещё может поставить модель, дрейфующую на 3–5 mAP от PyTorch-базы из-за ошибки калибровки квантизации или несоответствия pixel-формата.

Где Здесь Фора Софт

Мы поставляем YOLO-пайплайны детекции в видеонаблюдении, OTT-модерации, телемедицине и фитнес-продуктах с YOLOv4 и провели миграции клиентских кодбейзов через каждую версию из статьи. Паттерн, который держится через проекты: решение о версии – редко узкое место. Пайплайн предобработки (урок 2.1), дисциплина разметки датасета (редкость в CV-курсах, решающая в продакшене), per-runtime калибровка квантизации и разговор о AGPL-3.0 забирают девять из десяти инженерных часов, которые поставляют YOLO. Если ваша команда выбирает между v11 и v12 на первой неделе и ещё не разметила первые 500 изображений, мы вежливо порекомендуем переставить план работ.

Главное

  • YOLOv8 сделала YOLO anchor-free и мульти-задачной; v9 закрыла разрыв точности на маленьких моделях; v10 удалила NMS; v11 переписала backbone под edge; v12 принесла attention в real-time детектор.
  • Дефолт 2026 для нового проекта – YOLOv11: лучшая документация, шире поддержка железа, зрелый export-пайплайн.
  • YOLOv12 – правильный выбор на NVIDIA GPU с FlashAttention (T4, A100, L4, Jetson AGX Orin); на остальном железе преимущество скорости исчезает.
  • YOLOv10 всё ещё правильный для лоу-латентных real-time деплоев, где удаление NMS экономит 4–6 мс на кадр.
  • Любой Ultralytics-релиз YOLO под двойной лицензией AGPL-3.0 / enterprise – поговорите с юристом в первой неделе.
  • INT8 квантизация через рантайм (TensorRT, OpenVINO, CoreML, TFLite) необсуждаема для продакшена; разница в стоимости реальна.

Что Читать Дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.