- Календарь релизов 11–17 мая: Subnautica 2,... (8507)
- Google впервые обнаружила и заблокировала... (6778)
- AMD разрабатывает настольную Radeon RX 9050... (6572)
- Samsung выпустила One UI 8.5 для... (5977)
- На ПК стартовали предзаказы Subnautica 2 —... (6759)
- Спутник LINK прошёл испытания и приблизил... (5180)
- DJI показала мощные роботы-пылесосы Romo 2 —... (5458)
- Издателем Stellar Blade 2 выступит не Sony,... (7761)
- Следующая Vision Pro выйдет не раньше 2028... (5631)
- Первая частная индийская ракета отправится в... (5957)
- Смартфоны Samsung начнут блокировать... (7254)
- Фанатов заинтриговал мод, который переносит... (5665)
- TikTok позволит полностью отключить рекламу... (4830)
- Intel и Nvidia скоро выпустят первые... (4978)
- Смартфон Трампа может вообще не выйти —... (5553)
- Ключевые характеристики геймерского... (6739)
Теперь ИИ может взаимодействовать с веб-сайтами так же, как это делает человек: Google представила модель Gemini 2.5 Computer Use
Дата: 2025-10-09 08:44
Google выпустила новую модель искусственного интеллекта Gemini 2.5 Computer Use. Эта модель позволяет ИИ-агентам взаимодействовать с веб-сайтами и пользовательскими интерфейсами так же, как это делает человек, по утверждению Google. Она уже доступна в публичном ознакомительном режиме через API Gemini в Google AI Studio и Vertex AI.
Модель основана на возможностях визуального восприятия и рассуждения Gemini 2.5 Pro. Она может выполнять широкий спектр действий в браузере, таких как нажатие клавиш, ввод текста, прокрутка, наведение курсора, открытие раскрывающихся списков и навигация по URL-адресам. Google заявляет, что модель превосходит конкурирующие инструменты в нескольких бенчмарках, включая Online-Mind2Web, WebVoyager и AndroidWorld, сохраняя при этом меньшую задержку.
Изображение Midjourney В отличие от традиционных моделей ИИ, использующих API, Gemini 2.5 Computer Use обрабатывает скриншоты веб-интерфейсов и генерирует в ответ конкретные действия. Агент получает запрос на выполнение задачи, скриншот и историю недавних действий. Затем он анализирует интерфейс и выдает действие, например, нажатие кнопки или ввод данных в поле. Действие выполняется на стороне клиента, а новый скриншот отправляется обратно модели для продолжения выполнения задачи в цикле.
Google продемонстрировала эффективность модели на примерах, где агент сортирует стикеры на цифровой доске и переносит информацию о домашних животных с одного сайта в CRM-систему.
В настоящее время модель поддерживает 13 действий и лучше всего работает в веб-браузерах. Google заявила, что модель пока не оптимизирована для задач на уровне настольных ОС, хотя и продемонстрировала потенциал в мобильных бенчмарках.
Подробнее на iXBT
Предыдущие новости
Стало известно, с каких машин россияне пересаживаются на новенькие Lada Iskra
Дилерская сеть «Прагматика» поделилась с «Российской газетой» данными о программе трейд-ин для новой Lada Iskra. Около 80% автомобилей, которые покупатели готовы сдать в обмен на новинку, — это модели Lada. Лидером является Lada Granta, также часто сдают Lada Niva и Lada Vesta в начальных комплектациях. Оставшиеся 20% приходятся на иномарки, преимущественно старше 15 лет....
Nvidia получила лицензии, необходимые для экспорта в ОАЭ ускорителей вычислений на миллиарды долларов США
Ещё в мае по итогам визита в ОАЭ американского президента Дональда Трампа (Donald Trump) была достигнута договорённость о строительстве в этой стране крупного вычислительного центра мощностью до 5 ГВт, для работы которого потребовалось бы более 2 млн ускорителей Nvidia. Последней удалось получить необходимые для поставок в ОАЭ экспортные лицензии только недавно. Источник...
Воров, крадущих кабели InstaVolt для зарядки электромобилей, теперь быстро отслеживают по встроенным GPS-трекерам
Компания InstaVolt укрепила свои кабели для зарядных станций электромобилей кевларовой оболочкой, что усложнило их перерезание. Кроме того, компания в сотрудничестве с поставщиком GPS-оборудования Trackit247 внедрила функцию GPS-отслеживания в режиме реального времени на всех зарядных кабелях своей сети. Технология обновляет местоположение каждые три секунды, что позволяет...
449 л.с., полный привод, запас хода более 1100 км и технологии Huawei: в России остались только две версии Aito Seres M7
Гибридные кроссоверы Aito Seres M7 в шестиместной версии больше не доступны на российском рынке, сообщают «Китайские автомобили». Теперь модель предлагается только в двух пятиместных комплектациях по цене от 7 до 7,5 млн рублей без учета специальных предложений. Для российского потребителя более привычны 5-местные комплектации автомобилей. На это указывает как результаты...