Claude Code, Manus AI, Operator, Perplexity Comet и Apple Intelligence – computer-use агенты

Автор: Николай СапуновОбновлено: август 202638 мин чтения
Содержание статьи +

TL;DR

Computer-use агент – это ИИ, который работает с программами так же, как человек: смотрит на экран, решает, куда кликнуть или что набрать, делает это, снова смотрит – и повторяет, пока задача не выполнена. Пять продуктов задают тон разговору в 2026 году: Claude Code пишет и коммитит код по словам на обычном языке; Operator от OpenAI (теперь встроен в режим агента ChatGPT) управляет браузером, доводя задачи до конца; Manus ИИ выполняет длинные многошаговые задания сам; Comet от Perplexity – это браузер, который делает за вас рутину; а Apple Intelligence кладёт уменьшенную версию той же идеи вам в телефон. Этот урок объясняет, что такое каждый из них, как на самом деле устроен цикл «посмотреть-решить-сделать», где агенты действительно полезны, а где пока ошибаются, и – то, что большинство статей пропускает, – как команде видео-продукта думать о том, чтобы использовать их для более быстрой разработки и для встраивания внутрь своего продукта. К концу вы сможете объяснить коллеге, кто из них что делает, и решить, где какому агенту место в вашем roadmap, не переплатив за демо, которое не выживает при контакте с реальными пользователями.

Почему это важно

«Computer-use агент» за 2026 год прошёл путь от исследовательского курьёза до строки в планёрке, и эти слова теперь приклеены к пяти разным продуктам, которые делают похожие, но разные вещи. Если вы ведёте видео-продукт – инструмент для конференций, OTT-платформу, дашборд видеонаблюдения, телемед-приложение, – вам задают два разных вопроса, которые звучат как один. Первый: «должны ли наши разработчики использовать Claude Code или Cursor, чтобы быстрее писать код?» Второй: «должен ли в нашем продукте быть агент, который управляет интерфейсом за пользователя?» Это разные решения с разной стоимостью и риском, и их смешение – самый быстрый способ потерять квартал. Этот урок написан для продакт-менеджера, основателя или техлида, которому надо ответить на оба без бэкграунда в машинном обучении. Он опирается на урок про закрытые frontier-модели и урок про агентный и генеративный ИИ; если фраза «vision-language модель» для вас новая, сначала прочитайте урок про video-VLM.

Что такое «computer-use агент» на самом деле

Начнём с простого определения, потому что маркетинг его замутил. Computer-use агент – это программа на ИИ, которая пользуется другими программами так же, как человек – смотрит на экран, двигает курсор, кликает и печатает, – а не подключается к каждой программе через специальную заранее сделанную связь. Главная черта: он управляет визуальным интерфейсом, теми же кнопками и меню, которые видит человек, а не через специальный «чёрный ход», построенный для него заранее.

Бытовая аналогия – новый стажёр в первый рабочий день. Вы не переделываете свою бухгалтерскую систему под него; вы сажаете его за компьютер, показываете экран, и он сам разбирается, куда кликать. Он смотрит, действует, снова смотрит, что получилось, и продолжает, пока задача не сделана. Computer-use агент работает на ровно тех же основаниях. Именно это отличает его от старой автоматизации, которой нужен был программист, чтобы заранее соединить каждую систему с каждой.

Это важно, потому что у большинства программ в мире нет удобного «чёрного хода». Ваш сайт бронирования, внутренний дашборд, старая система медкарт – они построены под человеческие глаза и руки. Агент, который умеет видеть экран и управлять им, в принципе может пользоваться любой из них, и никому не надо сначала строить специальную интеграцию. Эта универсальность и есть всё обещание. Подвох, к которому мы вернёмся с цифрами, в том, что «в принципе» и «надёжно» в 2026 году всё ещё далеки друг от друга.

Ещё одно понятие, которое определим до того, как использовать. По всему уроку «мозг» внутри этих агентов – это vision-language модель, ИИ, обученный и на картинках, и на тексте, поэтому он может посмотреть на скриншот и рассуждать о нём словами. Семейство мы подробно разобрали в уроке про video-VLM; здесь нужна версия в одну строку: vision-language модель – это то, что может посмотреть на картинку экрана и сказать, что она видит и что делать дальше.

Цикл, который питает их всех

Любой computer-use агент, какой бы марки он ни был, выполняет один и тот же цикл из четырёх шагов. Понять этот цикл – самое полезное, что есть в этом уроке: увидев его, вы сможете рассуждать о том, почему агенты медленные, почему они стоят столько, сколько стоят, и почему иногда застревают.

Первый шаг – наблюдение. Агент делает скриншот текущего экрана – картинку, ровно то, что увидел бы человек. Второй шаг – рассуждение. Этот скриншот вместе с целью, которую вы поставили («забронируй самый дешёвый рейс в Берлин на следующий вторник»), идёт в vision-language модель, и та решает, что делать дальше: «вижу поле поиска; надо кликнуть и набрать пункт назначения». Третий шаг – действие. Агент выдаёт одно конкретное действие – сдвинуть курсор к этим координатам, кликнуть, набрать эти буквы, нажать Enter. Четвёртый шаг – снова наблюдение: он делает свежий скриншот, чтобы увидеть, что изменилось, и цикл повторяется. Посмотреть, подумать, сделать, снова посмотреть – раз за разом, по одному маленькому действию, пока цель не достигнута или агент не сдастся.

Рисунок 1. Цикл «наблюдение-рассуждение-действие-наблюдение». Каждый продукт в этом уроке его выполняет; различия – в том, каким экраном он управляет, какая модель рассуждает и сколько автономии вы ему даёте.

Поле делят два подхода к устройству. Одни агенты выполняют весь цикл внутри одной модели – скриншот входит, следующее действие выходит, без отдельных частей. Исследователи называют их end-to-end агентами. Другие разбивают цикл на стадии, за которые отвечают разные компоненты, – одна часть находит на экране кнопки и поля ввода, другая решает, что с ними делать. Это composed агенты. Вам не нужно держать в голове, кто из продуктов какой; нужно знать, что трудная нерешённая часть у обоих одна и та же. И у неё есть имя.

Почему «кликнуть в нужный пиксель» – это незаметное узкое место

Шаг, на котором агент переводит «кликни кнопку Submit» в точные экранные координаты для клика, называется GUI grounding – привязка абстрактного намерения к конкретным пикселям интерфейса. Звучит тривиально, но это не так. Человек бросает взгляд на экран, и кнопка Submit просто вот она; модель же должна по плоской картинке предсказать точную координату x и y, на экранах, которые она никогда не видела, с кнопками любого размера, темы и языка. Промахнись чуть-чуть – и агент кликнет в пустоту или по неправильному элементу, и вся задача сходит с рельсов. Бóльшая часть видимого прогресса computer-use агентов между 2024 и 2026 годами была именно прогрессом в grounding – в том, чтобы клик попадал куда надо. Когда агент в демо уверенно делает не то, причина обычно – промах grounding.

Два семейства – и почему вы на самом деле задаёте два вопроса

Пять продуктов из заголовка этого урока не соперники в одной гонке. Они чётко делятся на два семейства, и это деление ложится на два вопроса из начала урока. Мы называем их Track A и Track B – те же два трека, что проходят через весь курс.

Агенты Track B помогают строить продукт. Они управляют инструментами разработчика – редактором кода, терминалом, браузером, – чтобы быстрее писать софт. Claude Code – главный пример: вы описываете фичу, он пишет код по многим файлам, прогоняет тесты и коммитит результат. Для видео-команды Track B-агент сокращает путь от «мы хотим переключение adaptive bitrate» до рабочего кода. Он никогда не касается вашего конечного пользователя; он касается клавиатур ваших инженеров.

Агенты Track A работают внутри продукта, от имени пользователя. Operator, Manus, Comet и Siri в составе Apple Intelligence делают задачи за конечного пользователя – бронируют, ищут, заполняют формы, управляют приложениями. Если вы встраиваете такой агент или строите похожий, пользователь делегирует рутину, и агент её выполняет. Профиль риска совсем другой: ошибка Track B – это плохой коммит, который инженер ловит на ревью; ошибка Track A – это агент, который забронировал не тот рейс на реальную карту реального пользователя.

Рисунок 2. Пять продуктов – это не одна гонка. Инструменты Track B ускоряют то, как вы строите; агенты Track A действуют за вашего пользователя внутри продукта. Решения независимы.

С циклом и двумя семействами в руках вот каждый продукт простыми словами.

Claude Code – агент, который пишет ваш софт

Claude Code от Anthropic – это агентная система для кода: вы описываете обычными словами, что хотите построить, протестировать или починить, и он делает работу по всему вашему кодовому проекту. Слово агентный стоит определить, потому что именно эта разница важна. Обычный инструмент автодополнения подсказывает следующую строку, пока разработчик печатает, – это автокомплит. Claude Code работает на уровне всего проекта: он читает весь код, чтобы понять, как файлы связаны, планирует подход, пишет и правит код сразу по многим файлам, прогоняет тесты, читает ошибки, когда они падают, чинит их и коммитит результат. Разработчик ставит цель и проверяет то, что уходит в прод; выполнение между этим идёт само.

Причина, по которой этот продукт держит весь урок, – его охват. Anthropic заявляет, что бóльшая часть кода внутри самого Anthropic теперь пишется Claude Code, а инженеры смещаются к архитектуре и к оркестрации нескольких агентов параллельно, а не к набору каждой строки. Опубликованные корпоративные результаты конкретны настолько, что годятся как опоры для планирования, а не как маркетинг. Stripe выкатил Claude Code на 1370 инженеров; одна команда закончила миграцию 10 000 строк с языка Scala на Java за четыре дня – работу, которую оценивали в десять инженеро-недель. Wiz перенёс библиотеку в 50 000 строк с Python на Go примерно за двадцать часов активной работы против оценки в два-три месяца вручную. Rakuten сократил среднее время доставки новой фичи с двадцати четырёх рабочих дней до пяти. Ramp срезал время расследования инцидентов на восемьдесят процентов и дал не-инженерам запрашивать хранилище данных простым языком вместо написания запросов к базе.

Заметьте, что у этих цифр общего: самые большие выигрыши – на крупной, механической, хорошо описанной работе – миграции, рефакторинги, повторяющиеся правки, – где цель ясна, а тесты говорят, когда вы закончили. Это форма задачи, которую Track B-агент щёлкает как орешки. И это же объясняет, почему «бóльшая часть нашего кода написана ИИ» не означает «мы уволили инженеров»: в каждом из этих примеров человек решает архитектуру и одобряет коммит.

Для видео-команды самый показательный сигнал 2026 года – что вендоры инструментов идут агентам навстречу. NVIDIA DeepStream 9 – набор, на котором многие команды строят пайплайны видеоаналитики, – выпустил интеграцию, позволяющую разработчику описать многокамерный пайплайн обычными словами («принимай эти RTSP-потоки с камер, гоняй каждый кадр через vision-language модель, отправляй сводки в нашу шину сообщений») и получить от Claude Code или его главного конкурента Cursor production-grade код пайплайна с мониторингом и обвязкой для деплоя. Это Track B, применённый прямо к видео-инженерии, а не общий демо-код.

Пара слов о конкуренте, потому что вы услышите его в той же фразе. Cursor – это редактор кода с теми же агентными способностями, и к началу 2026 года – с самым широким распространением среди профессиональных разработчиков: по сообщениям, он достиг двух миллиардов долларов годовой выручки. Многие команды используют оба: Cursor как ежедневный редактор, Claude Code – для крупных задач «отдай-целиком» и для ревью pull request'ов. Ключевой запрос, который привёл вас сюда, – claude code – с большим отрывом самый частый среди пяти продуктов этого урока, и это говорит, насколько центральным стал этот единственный инструмент для того, как теперь делается софт, в том числе видео-софт.

OpenAI Operator – агент, управляющий браузером, ставший «agent mode»

Operator был первым потребительским computer-use агентом OpenAI, запущенным в начале 2025 года. Под ним работала модель, которую OpenAI назвал Computer-Using Agent, или CUA, – тот самый цикл «наблюдение-рассуждение-действие» из Рисунка 1, направленный на веб-браузер. Вы давали цель, он делал скриншоты браузера, решал, куда кликнуть и что набрать, и проходил веб-задачи: заказ продуктов, заполнение форм, бронирование.

Важный факт 2026 года – отдельного продукта как такового больше нет. 17 июля 2025 года OpenAI встроил Operator в сам ChatGPT как «agent mode» – теперь вы получаете ту же возможность, переключая ChatGPT в режим агента, а не заходя на отдельный сайт Operator, и старый отдельный сайт закрыли. Если кто-то в команде скажет «давайте оценим Operator», то в 2026 году откроет он на деле режим агента ChatGPT. Базовую модель CUA тоже обновили – она стала упорнее и точнее в управлении браузером.

Опубликованные бенчмарки Operator – это та честная проверка реальностью, которая нужна всему полю, поэтому используем их как опору для раздела «насколько они на самом деле хороши» ниже. Исходный CUA набрал 87% на тесте веб-навигации WebVoyager и 58,1% на более трудном WebArena – но лишь 38,1% на OSWorld, тесте полноценных десктоп-задач по файлам, офисным приложениям и операционной системе. Держите в голове эти 38,1%: веб-задачи для этих агентов гораздо легче, чем общий контроль десктопа, и этот разрыв – самое важное, что владельцу продукта стоит усвоить до того, как обещать пользователям агента, который «может всё на вашем компьютере».

Manus ИИ – агент, построенный, чтобы работать сам

Manus ИИ – самый ориентированный на автономию из пяти. Там, где Operator ведёт браузер ход за ходом, а Claude Code отдаёт работу на ревью, Manus спроектирован брать одну инструкцию и доводить длинную многошаговую задачу до конца в основном без присмотра – сам планируя шаги, ходя в веб, написав и запустив свой код, проанализировав данные и вернув готовый результат. Попросите его исследовать рынок и подготовить отчёт – обещание в том, что вы вернётесь позже к готовому отчёту, а не к диалогу.

Manus – ещё и полезный пример того, как быстро движется этот рынок и сколько за ним денег. Он начинался как продукт компании, стоящей за браузерным ассистентом Monica, привлёк раунд в семьдесят пять миллионов долларов во главе с американским венчурным фондом Benchmark в 2025 году, перенёс штаб-квартиру в Сингапур, а в декабре 2025 года был куплен Meta в сделке, оценённой более чем в два миллиарда долларов, причём некоторые источники называют до трёх миллиардов. Для владельца продукта урок в этой истории не в сплетне – а в том, что слой автономных агентов в этом стеке консолидируют крупнейшие техкомпании, и любой вендор, на котором вы строите сегодня, в следующем квартале может принадлежать кому-то другому.

С Manus есть острая практическая оговорка, которую должен услышать каждый, кто отвечает за бюджет. Он тарифицируется по кредитам, и одна сложная задача может съесть непредсказуемое их число, потому что заранее не узнать, сколько циклов «наблюдение-рассуждение-действие» уйдёт. Опубликованные планы 2026 года идут от бесплатного тарифа с небольшим дневным лимитом до платных около двадцати и сорока долларов в месяц с месячными пулами кредитов. Опасность не в цене на витрине; она в том, что длинная автономная задача без потолка по стоимости может прожечь кредиты так, что прогнозировать трудно. Это автономно-агентная версия проблемы, которую мы оцифровали в уроке про стоимость ИИ: чем больше автономии вы даёте, тем труднее предсказать счёт.

Perplexity Comet – браузер, который делает вашу рутину

Comet от компании ИИ-поиска Perplexity – это веб-браузер со встроенным агентом. Он построен на Chromium – той же открытой основе, что и Google Chrome, поэтому выглядит и ощущается как обычный браузер, – но внутри живёт ИИ-ассистент Perplexity. Вы можете задать любой странице вопрос, попросить пересказать то, что читаете, и – это агентная часть – поручить рутину: «разбери эти вкладки», «сравни эти три товара и скажи, какой дешевле», «заполни эту форму», «забронируй за меня». Он выполняет цикл «наблюдение-рассуждение-действие» по тем веб-страницам, на которые вы и так смотрите.

История Comet в 2026 году – про охват. Он стартовал в 2025 году как бета по приглашениям и открылся глобально в 2026-м на iPhone, Android, Mac и Windows. Perplexity позиционировал версию для Android как первый агентный ИИ-браузер, сделанный для телефонов, а агентный браузинг Comet был встроен и во встроенный браузер на телефонах Samsung. Продукт важен для этого урока не потому, что вы стали бы встраивать сам Comet, а потому, что он показывает направление движения: браузер – самую используемую программу на Земле – перестраивают вокруг агента, который действует, а не просто страницы, которая показывает. Если ваш видео-продукт живёт во вкладке браузера, ваши пользователи всё чаще будут приходить с агентом, сидящим рядом.

Apple Intelligence – ограниченный агент в миллиарде карманов

Apple Intelligence – белая ворона, и поучительно. Это системный ИИ-слой Apple, встроенный в iPhone, iPad и Mac, и его проектные решения – почти зеркало Manus. Там, где Manus максимизирует автономию, Apple максимизирует приватность и контроль над охватом. Многое работает на устройстве – ИИ-работа идёт на самом телефоне, так что личным данным не нужно его покидать, – а более тяжёлые запросы уходят в то, что Apple называет Private Cloud Compute, серверы на собственных чипах Apple, спроектированные так, что даже Apple не видит данные. Когда запрос превышает то, что справляются собственные модели Apple, он может с разрешения пользователя передаться в ChatGPT от OpenAI.

Агентная часть живёт в Siri и фреймворке для разработчиков App Intents. App Intents – это механизм, которым приложение сообщает телефону, что оно умеет: «это приложение умеет начать запись», «это приложение умеет добавить заметку», – чтобы Siri могла сцепить эти действия между приложениями от имени пользователя. Версия Siri 2026 года также обладает осведомлённостью об экране: она видит, что у вас на дисплее, и действует по этому, так что можно сказать «сделай это фото ярче, потом положи его в мою рабочую заметку», и она перенесёт результат из одного приложения в другое. Важно, что действия ограничены – приложение объявляет ровно те возможности, которые открывает, а не агент свободно кликает где угодно. Для разработчика видео-приложения это самый прямо применимый из пяти: если вы выпускаете iPhone-приложение, объявление нужных App Intents – это то, как ваши фичи становятся тем, что умеет Siri, с защитными рамками, встроенными в фреймворк, а не прикрученными сбоку.

Пять в одном взгляде

Поставьте пятёрку рядом – и семейства встают на места. Таблица ниже – та, которую стоит сохранить.

ПродуктСемействоЧем управляетАвтономияЛучше всегоНа что смотреть
Claude CodeTrack B (строить)Ваш код, терминал, инструменты разработкиВысокая, человек одобряет коммитыМиграции, рефакторинги, многофайловые фичи, починка CIНужны тесты + ревью; не замена решений по архитектуре
OpenAI Operator (ChatGPT agent mode)Track A (использовать)Веб-браузерХод за ходом, спрашивает подтверждениеВеб-задачи – формы, заказ, бронированиеОтдельный продукт закрыт, ушёл в ChatGPT; слаб в полных десктоп-задачах
Manus AITrack A (использовать)Браузер + свой кодовый sandboxОчень высокая, длинные задачи без присмотраEnd-to-end исследование и результат из одного промптаНепредсказуемая цена по кредитам; вендор теперь у Meta
Perplexity CometTrack A (использовать)Веб-страницы в своём браузереАссистент + агент на страницеРутина в браузере, пересказы, вкладки/формыЭто целый браузер; агент рядом, а не внутри вашего приложения
Apple IntelligenceTrack A (использовать)Приложения на телефоне, через App IntentsОграниченная, приватность, на устройствеМеж-аппные действия, которые вы объявили; голос SiriВозможности ограничены объявленными intents; только платформы Apple

Таблица 1. Пять computer-use агентов 2026 года, отсортированы по семействам. Track B ускоряет разработку; Track A действует за пользователя. Автономия и риск растут вместе по мере спуска по строкам Track A.

Насколько они на самом деле хороши? Проверка реальностью на OSWorld

Вот раздел, который отделяет трезвый roadmap от разочарованного запуска. Самый честный публичный мерило общей способности к управлению компьютером – бенчмарк OSWorld: 369 реальных десктоп-задач по управлению файлами, веб-браузингу, офисным приложениям и операциям ОС, где агент либо выполняет задачу, либо нет. Поскольку OSWorld проверяет общий контроль десктопа, а не лёгкие веб-клики, его оценки – самое близкое к честному ответу на вопрос «может ли этот агент управлять моим компьютером?».

Цифра, которая всё держит, – уровень человека: около 72%. Именно так – на этих реалистичных задачах обычные люди успешны лишь примерно в 72% случаев, потому что задачи действительно мудрёные. Поэтому, читая оценку агента, меряйте её против 72%, а не против 100%.

Теперь арифметика, которую каждый владелец продукта должен один раз проделать вслух. Допустим, ваш сценарий сцепляет пять шагов агента, и каждый шаг, оптимистично, успешен в 90% случаев. Шанс, что вся цепочка пройдёт, – не 90%, а 0,9 умноженное само на себя пять раз:

успех от начала до конца = 0,90 × 0,90 × 0,90 × 0,90 × 0,90
                         = 0,90 ^ 5
                         ≈ 0,59

Итак, пятишаговая задача с сильным агентом «90% за шаг» завершается чисто меньше чем в 60% случаев. Растяните до десяти шагов – и вы у одного к трём. Это накопление и есть настоящая причина, почему агенты, ослепляющие в двушаговом демо, разочаровывают в десятишаговом продакшене, – и поэтому всё поле одержимо надёжностью на шаг и удержанием человека в петле на важных шагах.

На этом фоне прогресс 2026 года реален, но читать его надо осторожно. Сильнейшие общие агенты наконец достигли и чуть перешагнули уровень человека на OSWorld в конце 2025 и в 2026 году – ведущие frontier-модели от Anthropic и OpenAI на проверенном наборе бенчмарка попадают в низкие-средние 70-е, а исследовательский агент стал первым, кто перешёл планку ~72% в декабре 2025 года. Только-веб-задачи набирают гораздо выше, поэтому у Operator результат на WebVoyager был 87%, а на полном десктопе OSWorld – 38,1%. Вывод для вашего roadmap: агент, ограниченный узкой, веб-образной задачей, в 2026 году может быть по-настоящему готов к продакшену; агент, обещанный как «он может всё на вашем компьютере», разочарует, потому что общий контроль десктопа всё ещё держится около просто-человеческой надёжности, а просто-человеческая – недостаточно хороша, чтобы работать без присмотра.

Рисунок 3. Проверка реальностью. Веб-задачи почти решены; общий контроль десктопа лишь дотягивает до обычного человека; а сцепление шагов умножает долю отказов. Планируйте против планки 72%.

Сколько стоят эти агенты и почему счёт трудно предсказать

Стоимость computer-use агента вытекает прямо из цикла на Рисунке 1, и, увидев это, перестаёшь считать ценообразование загадкой. У каждого цикла две тарифицируемые части. Скриншот, на который смотрит агент, тарифицируется как входная картинка – модели надо прочитать изображение. Решение, которое она принимает, тарифицируется как выходной текст – модель выписывает действие. Так что каждый цикл «наблюдение-рассуждение-действие» стоит одного скриншота на вход плюс одного решения на выход, на той модели, которую вы выбрали.

Проговорим маленький пример вслух. Допустим, один цикл стоит примерно один-два цента на модели среднего уровня – реалистичная цифра 2026 года для скриншота плюс короткого решения. Тогда задача, на которую уходит сорок циклов, стоит:

стоимость одной задачи = 40 циклов × ~$0,015 за цикл
                       ≈ $0,60 за выполненную задачу

Шестьдесят центов звучит дёшево, и для одной задачи это так. Ловушка в том, что вы не знаете заранее, уйдёт ли на задачу сорок циклов или четыреста, – это зависит от того, сколько раз агент будет смотреть, путаться, повторять и снова смотреть. Задача, сошедшая с рельсов и зациклившаяся, тихо накрутит счёт в разы больше оценки. Именно поэтому кредитная модель Manus ощущается непредсказуемой и почему любому агенту, которого вы разворачиваете, нужны две рамки с первого дня: жёсткий лимит на число циклов на задачу и жёсткий лимит на расход. Проблема не в экономике; проблема в безграничной экономике. Такую стоимость на действие мы подробно оцениваем в уроке про стоимость ИИ.

Частая ошибка – относиться к агенту как к скрипту

Самое дорогое заблуждение в этой теме – относиться к computer-use агенту так, будто это традиционный скрипт автоматизации. Скрипт каждый раз делает одно и то же: при одном и том же входе он даёт один и тот же выход, и если он сработал раз, то работает всегда, пока сайт не изменится. Computer-use агент вероятностен – он каждый цикл выносит свежее суждение по скриншоту и может сделать разный выбор на одном и том же экране дважды. Команды, которые встраивают агента в критический путь так, словно он детерминирован – «агент всегда правильно кликнет Confirm», – это команды, которые потом объясняют клиенту, почему агент подтвердил не тот заказ.

Лекарство – не отказаться от агентов, а проектировать под их природу. Держите человека, одобряющего любое действие, которое тратит деньги, отправляет сообщение или удаляет данные, – так же, как Claude Code спрашивает перед коммитом, а Operator – перед подтверждением покупки. Ставьте лимиты на циклы и на стоимость, как выше. Предпочитайте максимально узкий охват: агент, ограниченный одной веб-образной задачей, гораздо надёжнее того, кому сказали «делай что угодно». И логируйте каждое действие, чтобы, когда агент сделает что-то неожиданное – а он сделает, – вы могли увидеть скриншот, который он видел, и решение, которое он принял. Зрелые продукты 2026 года встраивают эти рамки: Claude Code по умолчанию спрашивает разрешение перед изменением файлов, App Intents у Apple открывают только объявленные возможности, а Operator делает паузу для подтверждения на значимых шагах. Когда вы строите или покупаете агента, наличие этих рамок – первое, что надо проверять, раньше любого бенчмарка.

Строить, покупать или пропустить – для вашего видео-продукта

Вернём это к двум вопросам, на которые вам реально надо ответить. Для Track B – строить быстрее – решение в 2026 году простое, и ответ обычно «использовать». Claude Code и Cursor зрелы, цена за место мала против зарплаты инженера, а выигрыши на миграциях, рефакторингах и многофайловых фичах задокументированы и велики. Дисциплина не меняется относительно любой хорошей инженерной практики: держите тесты зелёными, проверяйте каждый коммит и пусть человек владеет архитектурой. Нет экзотического риска в том, чтобы направить кодового агента на собственный кодовый проект под ревью; минус плохой подсказки ловится до прода.

Для Track A – агент внутри вашего продукта – решение труднее, и честное умолчание – «сильно сузить охват или пока пропустить». Если задача, которую пользователи хотят автоматизировать, веб-образна и узка – вытащи эти числа из того портала, заполни эту повторяющуюся форму, – агент может быть готов к продакшену уже сегодня, с рамками выше. Если задача – это широкий контроль десктопа, проверка реальностью на OSWorld говорит подождать или ограничить, пока надёжность не подтянется. И прежде чем вообще строить общего агента, спросите, не сделает ли работу надёжнее за меньшие деньги ограниченная интеграция: если у системы, которой вы хотите управлять, есть нормальный «чёрный ход» – официальный интерфейс, построенный для программ, – использовать его напрямую быстрее, дешевле и куда надёжнее, чем заставлять агента щуриться на скриншоты. Суперсила агента – управлять софтом, у которого «чёрного хода» нет; тратить её на софт, у которого он есть, – самая частая ошибка переусложнения в этой категории.

Где здесь Фора Софт

Мы стоим по обе стороны этого деления каждую неделю. По части Track B кодовые ИИ-агенты теперь часть того, как мы строим системы видеоконференций, OTT, стриминга, видеонаблюдения, телемедицины и e-learning, которые поставляем с 2005 года, – они ускоряют миграции и механические части сборки, пока наши инженеры владеют архитектурой и ревью. По части Track A мы помогаем командам трезво решить, где агенту место внутри видео-продукта, а где ограниченная интеграция – более безопасный и дешёвый ответ, и как вшить рамки человеческого одобрения, потолка по стоимости и логирования до того, как что-либо коснётся реального пользователя. Услуга, которую мы оказываем чаще всего, – не столько «добавить агента», сколько «честно скажите нам, должно ли это вообще быть агентом, и сделайте это безопасным, если должно». Это суждение, применённое к видео-вертикалям, которые мы знаем, и есть ценность.

Ключевые выводы

  • Computer-use агент управляет софтом, глядя на экран и кликая, как человек – без специального «чёрного хода».
  • Каждый из них выполняет один цикл: наблюдай скриншот, рассуждай, действуй, снова наблюдай, повторяй.
  • Агенты Track B (Claude Code, Cursor) быстрее строят ваш продукт; агенты Track A (Operator, Manus, Comet, Siri) действуют за пользователя.
  • Меряйте способность против ~72% уровня человека на OSWorld; веб-задачи легки, общий контроль десктопа – нет.
  • Многошаговые цепочки накапливают отказ: пять шагов по 90% завершаются чисто меньше чем в 60% случаев.
  • Вшейте одобрение человека, лимит циклов и лимит расхода до того, как агент коснётся реального пользователя.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.