- ИИ-ускорители Nvidia Feynman могут получить... (3181)
- Новые комплектации официальных Li Auto... (3494)
- Samsung интегрирует Google Photos в свои... (2263)
- Пока все обсуждали цены на память, цены на... (3459)
- Xiaomi 17 Ultra Leica Edition получил... (2232)
- CATL запустит массовое производство... (3202)
- 7000 мАч, IP69 и две 200-мегапиксельные... (3237)
- У обанкротившегося производителя... (3023)
- Мини-ПК с Core Ultra 300 в цвете розового... (2164)
- Одна из самых больших GeForce RTX 5060, при... (2251)
- TSMC не справляется с заказами на 2- и... (2276)
- Microsoft оптимизировала «Проводник» в... (3294)
- На Тайване произошло одно из самых сильных... (2263)
- Китайский ответ на GeForce RTX 60:... (3145)
- Русская озвучка Clair Obscur: Expedition 33... (3342)
- Спрос на официальные Li Auto в России... (3318)
Теперь ИИ может взаимодействовать с веб-сайтами так же, как это делает человек: Google представила модель Gemini 2.5 Computer Use
Дата: 2025-10-09 08:44
Google выпустила новую модель искусственного интеллекта Gemini 2.5 Computer Use. Эта модель позволяет ИИ-агентам взаимодействовать с веб-сайтами и пользовательскими интерфейсами так же, как это делает человек, по утверждению Google. Она уже доступна в публичном ознакомительном режиме через API Gemini в Google AI Studio и Vertex AI.
Модель основана на возможностях визуального восприятия и рассуждения Gemini 2.5 Pro. Она может выполнять широкий спектр действий в браузере, таких как нажатие клавиш, ввод текста, прокрутка, наведение курсора, открытие раскрывающихся списков и навигация по URL-адресам. Google заявляет, что модель превосходит конкурирующие инструменты в нескольких бенчмарках, включая Online-Mind2Web, WebVoyager и AndroidWorld, сохраняя при этом меньшую задержку.
Изображение Midjourney В отличие от традиционных моделей ИИ, использующих API, Gemini 2.5 Computer Use обрабатывает скриншоты веб-интерфейсов и генерирует в ответ конкретные действия. Агент получает запрос на выполнение задачи, скриншот и историю недавних действий. Затем он анализирует интерфейс и выдает действие, например, нажатие кнопки или ввод данных в поле. Действие выполняется на стороне клиента, а новый скриншот отправляется обратно модели для продолжения выполнения задачи в цикле.
Google продемонстрировала эффективность модели на примерах, где агент сортирует стикеры на цифровой доске и переносит информацию о домашних животных с одного сайта в CRM-систему.
В настоящее время модель поддерживает 13 действий и лучше всего работает в веб-браузерах. Google заявила, что модель пока не оптимизирована для задач на уровне настольных ОС, хотя и продемонстрировала потенциал в мобильных бенчмарках.
Подробнее на iXBT
Предыдущие новости
Стало известно, с каких машин россияне пересаживаются на новенькие Lada Iskra
Дилерская сеть «Прагматика» поделилась с «Российской газетой» данными о программе трейд-ин для новой Lada Iskra. Около 80% автомобилей, которые покупатели готовы сдать в обмен на новинку, — это модели Lada. Лидером является Lada Granta, также часто сдают Lada Niva и Lada Vesta в начальных комплектациях. Оставшиеся 20% приходятся на иномарки, преимущественно старше 15 лет....
Nvidia получила лицензии, необходимые для экспорта в ОАЭ ускорителей вычислений на миллиарды долларов США
Ещё в мае по итогам визита в ОАЭ американского президента Дональда Трампа (Donald Trump) была достигнута договорённость о строительстве в этой стране крупного вычислительного центра мощностью до 5 ГВт, для работы которого потребовалось бы более 2 млн ускорителей Nvidia. Последней удалось получить необходимые для поставок в ОАЭ экспортные лицензии только недавно. Источник...
Воров, крадущих кабели InstaVolt для зарядки электромобилей, теперь быстро отслеживают по встроенным GPS-трекерам
Компания InstaVolt укрепила свои кабели для зарядных станций электромобилей кевларовой оболочкой, что усложнило их перерезание. Кроме того, компания в сотрудничестве с поставщиком GPS-оборудования Trackit247 внедрила функцию GPS-отслеживания в режиме реального времени на всех зарядных кабелях своей сети. Технология обновляет местоположение каждые три секунды, что позволяет...
449 л.с., полный привод, запас хода более 1100 км и технологии Huawei: в России остались только две версии Aito Seres M7
Гибридные кроссоверы Aito Seres M7 в шестиместной версии больше не доступны на российском рынке, сообщают «Китайские автомобили». Теперь модель предлагается только в двух пятиместных комплектациях по цене от 7 до 7,5 млн рублей без учета специальных предложений. Для российского потребителя более привычны 5-местные комплектации автомобилей. На это указывает как результаты...