Google открыл computer use в Gemini API: агент видит экран и сам кликает

24 июня Google перевёл computer use в public preview. Инструмент встроен прямо в gemini-3.5-flash — наравне с function calling и Search grounding — и позволяет агенту управлять браузером, мобильным устройством и десктопом, объясняя мотив каждого действия.

DB
DBG · по материалам Google — блог Gemini / Gemini API release notes
0

Google перевёл computer use в статус public preview: теперь агент на Gemini умеет смотреть на экран и действовать — водить мышью, печатать, кликать. Ключевое отличие от привычных обвязок в том, что это не отдельная модель, а встроенный инструмент внутри gemini-3.5-flash — ровно там же, где живут function calling, Google Search grounding и Maps. Та же модель, которая до этого вызывала ваши функции, теперь может водить курсором по интерфейсу, для которого никакого API просто не существует.

Поддерживаются три типа сред: браузер, мобильные устройства и десктоп. Каждое действие модель отдаёт не голым кликом по координатам, а с полем intent — коротким объяснением, зачем она это делает. Плюс в ответе может прийти safety_decision от внутреннего классификатора, который относит действие к одной из трёх категорий: обычное (разрешено), require_confirmation — требует подтверждения пользователя — и blocked. Доступ есть через Gemini API и через Gemini Enterprise Agent Platform; Google выложил reference implementation на GitHub и демо, поднятое на Browserbase.

Формально это догоняющий шаг: computer use в том или ином виде уже есть у Anthropic и OpenAI. Но нативность здесь важнее новизны — не нужно склеивать «модель для рассуждения» с «моделью для кликов» и терять контекст на границе между ними.

Что это значит на практике. Computer use — инструмент последней инстанции, и относиться к нему стоит соответственно. Он на порядок дороже и медленнее интеграции по API: каждый шаг агента — это скриншот в контекст, то есть тысячи токенов на действие, которое REST-запросом стоило бы копейки. Берите его туда, где API нет и не будет: легаси-интерфейсы, внутренние админки, чужие порталы без интеграции. Второй момент — require_confirmation надо реально обрабатывать в вашем UI. Если вы проигнорируете этот статус и не покажете человеку диалог, агент просто встанет посреди сценария, а вы будете искать причину в логах. И третье, самое неприятное: агент, который читает экран, читает и всё, что на нём написано, — включая текст, специально подложенный на страницу, чтобы им управлять. Prompt injection здесь перестаёт быть теоретическим риском и становится вопросом того, к каким аккаунтам и платёжным данным у агента вообще есть доступ. Правило простое: сессия агента — не ваша основная сессия, и кредов в ней должно быть ровно столько, сколько нужно на задачу.

Комментарии

Google открыл computer use в Gemini API: агент видит экран и сам кликает | DBG