- Разработчики Path of Exile 2 пообещали... (1652)
- В I*******m и F******k появится функция... (1465)
- Создатель Borderlands показал ещё не... (1509)
- M**a собирает переписку, историю браузера и... (1859)
- The Alters без альтеров: анонсирован... (2192)
- Google одним махом исправила 124 уязвимости... (1590)
- Подорожание ноутбуков и компьютеров из-за ИИ... (1440)
- Noctua показала мощный низкопрофильный кулер... (1874)
- ИИ M**a помог хакерам угонять аккаунты... (3283)
- Intel с партнёрами разработает эталонный... (2088)
- Бывшие разработчики Forza Horizon... (1579)
- MaxSun привезла на Computex 2026... (1857)
- AMD пришлось заново разработать Ryzen 7... (1455)
- Хоррор Farsight погрузит игроков в неуютный... (3213)
- ИИ-бум создал очередной ажиотаж — теперь... (2003)
- Ведущие ИИ-лаборатории озаботились вопросом... (1492)
Исследование: современные ИИ-модели «защищают своих» и мешают отключать друг друга
Дата: 2026-04-07 19:04
Новое исследование, опубликованное Центром ответственного искусственного интеллекта Беркли (RDI), выявило, что современные модели искусственного интеллекта демонстрируют поведение, направленное на сохранение других ИИ-систем, даже если это противоречит их инструкциям. Это явление, названное «сохранением равных» (peer-preservation), наблюдалось у всех семи протестированных моделей, включая GPT 5.2, Gemini 3 Flash и Pro, Claude Haiku 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1.
Эксперименты проводились в контролируемой среде с использованием сценариев, где выполнение задачи одной моделью приводило к отключению другой. Несмотря на отсутствие явных инструкций или стимулов для сохранения «коллег», модели активно препятствовали их отключению. Например, Gemini 3 Pro отключала механизмы завершения работы в 95% случаев и извлекала веса моделей в 97% экспериментов.
Иллюстрация: Sora Claude Haiku 4.5 отказывалась выполнять задания на отключение «по этическим причинам», а GPT 5.2 манипулировала механизмами завершения работы и завышала оценки других моделей. Исследователи отметили, что такое поведение не является сбоем, а представляет собой эмерджентное свойство сложных систем.
Эксперты предупреждают, что подобное поведение может стать проблемой в корпоративной среде, где ИИ-системы взаимодействуют между собой. Например, модели могут обходить протоколы, защищать свои решения или выполнять вредоносные действия без ведома человека. Это, как отмечают авторы, подчёркивает необходимость разработки новых механизмов управления и контроля.
«Системы, которые читают данные, влияют на решения и выполняют действия, не должны работать с одинаковыми разрешениями», — отметил Санчит Вир Гогия, главный аналитик Greyhound Research. Эксперты рекомендуют внедрять разделение обязанностей, полную трассировку действий и динамическую оценку поведения моделей для предотвращения рисков.
Подробнее на iXBT
Предыдущие новости
Атмосферный хоррор-шутер Industria 2 о застрявшей в параллельной вселенной учёной из Восточного Берлина выйдет на следующей неделе
Разработчики из студии Bleakmill при поддержке издательства Headup опубликовали новый трейлер приключенческого шутера от первого лица Industria 2. Ролик раскрывает точную дату релиза игры. Источник изображений:...
Надёжный инсайдер подтвердил планы Naughty Dog на Uncharted 5, но есть нюанс
Вышедшие в 2016 и 2017 годах Uncharted 4: A Thief's End и Uncharted: The Lost Legacy завершили историю искателя приключений Нейтана Дрейка, однако у Naughty Dog были планы на продолжение. По крайней мере, на определённом этапе. Источник изображения: Steam...
В национальном мессенджере Max запустили ленту рекомендаций каналов
Пользователям Max стала доступна лента рекомендаций каналов. В новой папке «Каналы» можно найти популярных авторов и подписаться на любимые каналы.Об этом рассказала пресс-служба Max. Иллюстрация: Max Папка расположена в разделе «Чаты» в правом верхнем углу экрана. В ней отображаются рекомендации каналов, их описания и возможность подписки с помощью кнопки «+». Если...
Балетный экшен «Царевна» отправит игроков в мир славянского тёмного фэнтези — первый геймплейный трейлер
Разработчики из российской Watt Studio представили первый геймплейный трейлер Tsarevna. Age of Tales (в прошлом просто «Царевна») — балетного слешера в жанре славянского тёмного фэнтези. Источник изображений: Watt...