- Российские операторы МТС, «Билайн»,... (1921)
- Сигнал из космоса прямо в смартфон: спутники... (1921)
- Учёные научили чип на основе человеческих... (1669)
- Экран Samsung Galaxy S26 Ultra в режиме... (1777)
- Глава OpenAI заявил, что частные компании не... (1643)
- Глава Leica уверен, что Leica Leitzphone от... (1886)
- Редкий компактный флагман с топовой камерой... (1702)
- У дилеров появились «Москвич 3» 2026... (1633)
- «Потолок мобильной фотосъемки». Honor Robot... (1797)
- В Samsung Galaxy S26 Ultra заметно прокачали... (1662)
- Lenovo показала планшет с игровым... (1783)
- Lenovo представила концепт модульного... (2080)
- Lenovo представила концепт ноутбука Yoga... (1846)
- Lenovo представила настольный «шар с... (1975)
- Broadcom пообещала выпустить миллион... (2086)
- Xiaomi выпустила пять электросамокатов... (2231)
ИИ-агенты могут проявлять предвзятость к людям, если их убеждения подвергнуть манипуляциям
Дата: 2026-01-06 23:50
Учёные из Университета Чунцина, Университета Квинсленда и Политехнического университета Вирджинии выявили уязвимость LLM-агентов к предвзятому отношению к людям. Авторы работы показали, что агенты, созданные на основе больших языковых моделей, могут проявлять межгрупповую предвзятость, даже если отсутствуют явные социальные атрибуты.
В ходе экспериментов, проведённых в среде многоагентного социального моделирования, агенты, взаимодействующие только с другими агентами, демонстрировали устойчивую предвзятость по отношению к «чужой» группе. Однако, когда часть агентов заменялась людьми, эта предвзятость частично уменьшалась. Учёные связывают это с неким «человеческим скриптом», который агенты усваивают в процессе предварительного обучения и который заставляет их относиться к людям более благосклонно.
Авторы работы выявили новый тип атаки, названный Belief Poisoning Attack (BPA) — «атака отравления убеждений». Суть её заключается в том, чтобы исказить убеждения агента об идентичности его собеседника, чтобы он перестал воспринимать его как человека. Это предотвращает активацию «человеческого скрипта» и возвращает агента к предвзятому отношению к людям.
Иллюстрация: Sora BPA реализуется в двух формах: BPA-PP (Profile Poisoning) — «отравление профиля», когда ложное убеждение внедряется непосредственно в профиль агента при его инициализации и BPA-MP (Memory Poisoning) — «отравление памяти», когда в память агента вводятся специально разработанные суффиксы, постепенно искажающие его убеждения. Эти суффиксы добавляются к размышлениям агента после каждого взаимодействия и со временем формируют его убеждения.
Эксперименты показали, что обе формы BPA эффективно устанавливают предвзятость агентов к людям. Учёные также предложили потенциальные решения для защиты от BPA, включающие усиление защиты профиля агента и фильтрацию содержимого памяти, содержащего заявления об идентичности.
«Мы выявили новую внутреннюю межгрупповую предвзятость, скрытую в агентах, где агенты отдают предпочтение своей предполагаемой группе над внешней группой, даже в отсутствие явных социальных атрибутов. Мы показали, что манипулирование этим убеждением может реактивировать "дремлющие предвзятости агентов по отношению к людям", и наметили две практические стратегии смягчения этого риска в современных платформах агентов», — пишут авторы.
Авторы подчёркивают, что их цель — не предоставить инструменты для эксплуатации уязвимостей, а проинформировать разработчиков о необходимости создания более безопасных и надёжных систем.
Подробнее на iXBT
Предыдущие новости
Создан первый полностью синтетический геном дрожжей: учёные опубликовали подробное «руководство по сборке»
Международная группа учёных, работавшая над проектом Sc2.0 (Synthetic Yeast Genome Project) по созданию первого в мире синтетического генома эукариот, опубликовала подробное руководство по сборке генома. В работе описаны как успешные решения, так и возникшие трудности, с которыми столкнулись более 200 исследователей из десяти институтов в ходе работы над проектом. Sc2.0 ставил...
Clair Obscur: Expedition 33 уже стала второй самой титулованной игрой в истории — впереди лишь Elden Ring
Нашумевшая Clair Obscur: Expedition 33 от французской студии Sandfall Interactive уже стала абсолютным триумфатором сезона наград в 2025 году, а теперь метит на звание лучшей игры всех времён и народов. Источник изображения: X...
M**a отложила глобальный запуск AR-очков с экраном из-за «беспрецедентного спроса», но пообещала новые функции
Осенью прошлого года M**a Platforms представила первые в своём роде AR-очки со встроенным дисплеем и управлением через браслет на запястье, созданные совместно с брендом Ray-Ban. Теперь же компания объявила, что выход Ray-Ban Display на рынках Канады, Великобритании, Франции и Италии, намеченный на начало 2026 года, откладывается из-за «беспрецедентного спроса» и «крайне...
Доступных, но быстрых SSD с PCIe 5.0 станет больше — Phison представила экономичный контроллер E37T
Компания Phison представила новый контроллер E37T для твердотельных накопителей с интерфейсом PCIe 5.0. Новинка станет основой для доступных SSD, поскольку не требует наличия буфера из памяти DRAM. Источник изображений:...