- Память HBM4 от Samsung получила высшие... (2124)
- Назад в 80-е: новая Hyundai Sonata получит... (3944)
- Samsung обогнала Micron и вернула себе... (2156)
- В США в 2025 году сократили 55 тысяч рабочих... (3775)
- AMD опубликовала первые детали о Zen 6 —... (3744)
- Редкую Lada Tarzan 2 продают за 650 тыс.... (2330)
- Пользователь покупал обычные GeForce RTX... (2520)
- 190 л.с. и 8-ступенчатый «автомат» — за 28,8... (3790)
- Это уникальный концентрический... (3733)
- Продажи Land Rover в России в 2025 году... (2003)
- Клиент Steam стал 64-битным — поддержка... (3975)
- Мошенники маскируют DDR4 под DDR5: новый... (3219)
- Первый в мире бензиновый авто с HarmonyOS... (2996)
- Оказалось, что машины ASML для производства... (2887)
- Разработчики Lenovo Legion Go 2 могут... (2792)
- Для Nintendo Switch 2 могут появиться... (3506)
Теперь ИИ может взаимодействовать с веб-сайтами так же, как это делает человек: Google представила модель Gemini 2.5 Computer Use
Дата: 2025-10-09 08:44
Google выпустила новую модель искусственного интеллекта Gemini 2.5 Computer Use. Эта модель позволяет ИИ-агентам взаимодействовать с веб-сайтами и пользовательскими интерфейсами так же, как это делает человек, по утверждению Google. Она уже доступна в публичном ознакомительном режиме через API Gemini в Google AI Studio и Vertex AI.
Модель основана на возможностях визуального восприятия и рассуждения Gemini 2.5 Pro. Она может выполнять широкий спектр действий в браузере, таких как нажатие клавиш, ввод текста, прокрутка, наведение курсора, открытие раскрывающихся списков и навигация по URL-адресам. Google заявляет, что модель превосходит конкурирующие инструменты в нескольких бенчмарках, включая Online-Mind2Web, WebVoyager и AndroidWorld, сохраняя при этом меньшую задержку.
Изображение Midjourney В отличие от традиционных моделей ИИ, использующих API, Gemini 2.5 Computer Use обрабатывает скриншоты веб-интерфейсов и генерирует в ответ конкретные действия. Агент получает запрос на выполнение задачи, скриншот и историю недавних действий. Затем он анализирует интерфейс и выдает действие, например, нажатие кнопки или ввод данных в поле. Действие выполняется на стороне клиента, а новый скриншот отправляется обратно модели для продолжения выполнения задачи в цикле.
Google продемонстрировала эффективность модели на примерах, где агент сортирует стикеры на цифровой доске и переносит информацию о домашних животных с одного сайта в CRM-систему.
В настоящее время модель поддерживает 13 действий и лучше всего работает в веб-браузерах. Google заявила, что модель пока не оптимизирована для задач на уровне настольных ОС, хотя и продемонстрировала потенциал в мобильных бенчмарках.
Подробнее на iXBT
Предыдущие новости
Стало известно, с каких машин россияне пересаживаются на новенькие Lada Iskra
Дилерская сеть «Прагматика» поделилась с «Российской газетой» данными о программе трейд-ин для новой Lada Iskra. Около 80% автомобилей, которые покупатели готовы сдать в обмен на новинку, — это модели Lada. Лидером является Lada Granta, также часто сдают Lada Niva и Lada Vesta в начальных комплектациях. Оставшиеся 20% приходятся на иномарки, преимущественно старше 15 лет....
Nvidia получила лицензии, необходимые для экспорта в ОАЭ ускорителей вычислений на миллиарды долларов США
Ещё в мае по итогам визита в ОАЭ американского президента Дональда Трампа (Donald Trump) была достигнута договорённость о строительстве в этой стране крупного вычислительного центра мощностью до 5 ГВт, для работы которого потребовалось бы более 2 млн ускорителей Nvidia. Последней удалось получить необходимые для поставок в ОАЭ экспортные лицензии только недавно. Источник...
Воров, крадущих кабели InstaVolt для зарядки электромобилей, теперь быстро отслеживают по встроенным GPS-трекерам
Компания InstaVolt укрепила свои кабели для зарядных станций электромобилей кевларовой оболочкой, что усложнило их перерезание. Кроме того, компания в сотрудничестве с поставщиком GPS-оборудования Trackit247 внедрила функцию GPS-отслеживания в режиме реального времени на всех зарядных кабелях своей сети. Технология обновляет местоположение каждые три секунды, что позволяет...
449 л.с., полный привод, запас хода более 1100 км и технологии Huawei: в России остались только две версии Aito Seres M7
Гибридные кроссоверы Aito Seres M7 в шестиместной версии больше не доступны на российском рынке, сообщают «Китайские автомобили». Теперь модель предлагается только в двух пятиместных комплектациях по цене от 7 до 7,5 млн рублей без учета специальных предложений. Для российского потребителя более привычны 5-местные комплектации автомобилей. На это указывает как результаты...