- Спутниковая группировка Starlink теряет по... (1164)
- AST SpaceMobile перехватила клиента у... (1088)
- В России стартовали продажи... (1025)
- Blue Origin доставила ускоритель New Glenn... (1051)
- В Steam открылось тестирование Valor Mortis... (982)
- И BMW, как и Tesla, обогнал Mercedes по... (832)
- В Россию из Европы приехал Skoda Kodiaq с... (1056)
- Google Chrome, Safari и Microsoft Edge... (869)
- Нобелевскую премию по химии за 2025 года... (1248)
- Комета C/2025 A6 (Lemmon) даёт последний... (1015)
- Двухметровые кровати, душ, экраны и... (1211)
- Самое большое дополнение в истории Crusader... (812)
- Кома межзвёздной кометы 3I/ATLAS подтвердила... (996)
- Изгнанные Маском без выходного пособия... (1091)
- Миссия зонда NASA Juno вокруг Юпитера... (904)
- Synology отменила запрет на жёсткие диски WD... (1082)
Теперь ИИ может взаимодействовать с веб-сайтами так же, как это делает человек: Google представила модель Gemini 2.5 Computer Use
Дата: сегодня 08:44
Google выпустила новую модель искусственного интеллекта Gemini 2.5 Computer Use. Эта модель позволяет ИИ-агентам взаимодействовать с веб-сайтами и пользовательскими интерфейсами так же, как это делает человек, по утверждению Google. Она уже доступна в публичном ознакомительном режиме через API Gemini в Google AI Studio и Vertex AI.
Модель основана на возможностях визуального восприятия и рассуждения Gemini 2.5 Pro. Она может выполнять широкий спектр действий в браузере, таких как нажатие клавиш, ввод текста, прокрутка, наведение курсора, открытие раскрывающихся списков и навигация по URL-адресам. Google заявляет, что модель превосходит конкурирующие инструменты в нескольких бенчмарках, включая Online-Mind2Web, WebVoyager и AndroidWorld, сохраняя при этом меньшую задержку.

В отличие от традиционных моделей ИИ, использующих API, Gemini 2.5 Computer Use обрабатывает скриншоты веб-интерфейсов и генерирует в ответ конкретные действия. Агент получает запрос на выполнение задачи, скриншот и историю недавних действий. Затем он анализирует интерфейс и выдает действие, например, нажатие кнопки или ввод данных в поле. Действие выполняется на стороне клиента, а новый скриншот отправляется обратно модели для продолжения выполнения задачи в цикле.
Google продемонстрировала эффективность модели на примерах, где агент сортирует стикеры на цифровой доске и переносит информацию о домашних животных с одного сайта в CRM-систему.
В настоящее время модель поддерживает 13 действий и лучше всего работает в веб-браузерах. Google заявила, что модель пока не оптимизирована для задач на уровне настольных ОС, хотя и продемонстрировала потенциал в мобильных бенчмарках.
Подробнее на iXBT
Предыдущие новости
Стало известно, с каких машин россияне пересаживаются на новенькие Lada Iskra
Дилерская сеть «Прагматика» поделилась с «Российской газетой» данными о программе трейд-ин для новой Lada Iskra. Около 80% автомобилей, которые покупатели готовы сдать в обмен на новинку, — это модели Lada. Лидером является Lada Granta, также часто сдают Lada Niva и Lada Vesta в начальных комплектациях. Оставшиеся 20% приходятся на иномарки, преимущественно старше 15 лет....
Nvidia получила лицензии, необходимые для экспорта в ОАЭ ускорителей вычислений на миллиарды долларов США
Ещё в мае по итогам визита в ОАЭ американского президента Дональда Трампа (Donald Trump) была достигнута договорённость о строительстве в этой стране крупного вычислительного центра мощностью до 5 ГВт, для работы которого потребовалось бы более 2 млн ускорителей Nvidia. Последней удалось получить необходимые для поставок в ОАЭ экспортные лицензии только недавно. Источник...
Воров, крадущих кабели InstaVolt для зарядки электромобилей, теперь быстро отслеживают по встроенным GPS-трекерам
Компания InstaVolt укрепила свои кабели для зарядных станций электромобилей кевларовой оболочкой, что усложнило их перерезание. Кроме того, компания в сотрудничестве с поставщиком GPS-оборудования Trackit247 внедрила функцию GPS-отслеживания в режиме реального времени на всех зарядных кабелях своей сети. Технология обновляет местоположение каждые три секунды, что позволяет...
449 л.с., полный привод, запас хода более 1100 км и технологии Huawei: в России остались только две версии Aito Seres M7
Гибридные кроссоверы Aito Seres M7 в шестиместной версии больше не доступны на российском рынке, сообщают «Китайские автомобили». Теперь модель предлагается только в двух пятиместных комплектациях по цене от 7 до 7,5 млн рублей без учета специальных предложений. Для российского потребителя более привычны 5-местные комплектации автомобилей. На это указывает как результаты...