- Более 50 приложений в Google Play скрывали... (5307)
- Энтузиаст успешно запустил Windows 3.1 на... (5829)
- DLSS 5 приняли неоднозначно, но нейронный... (5537)
- United Launch Alliance вывела на орбиту... (6153)
- Какой флагманский смартфон 2026 года самый... (5938)
- В руководстве OpenAI провели очередные... (5994)
- Nvidia показала нейронное сжатие текстур:... (6057)
- Корабль Orion миссии Artemis II преодолел... (5167)
- Специалисты iFixit разобрали наушники Apple... (5864)
- Цена лицензий на кодеки H.264/AVC для... (4947)
- Wi-Fi отдыхает: ученые создали систему... (5647)
- «Я запёк свою видеокарту». Пользователь... (5457)
- 18-ядерный Intel Core Ultra 5 250KF Plus... (5713)
- Последние часы кометы C/2026 A1, летящей на... (4918)
- Беспроводная оптическая связь внутри... (5152)
- В Японии создали адаптер Wi-Fi, способный... (5803)
ИИ-агенты могут проявлять предвзятость к людям, если их убеждения подвергнуть манипуляциям
Дата: 2026-01-06 23:50
Учёные из Университета Чунцина, Университета Квинсленда и Политехнического университета Вирджинии выявили уязвимость LLM-агентов к предвзятому отношению к людям. Авторы работы показали, что агенты, созданные на основе больших языковых моделей, могут проявлять межгрупповую предвзятость, даже если отсутствуют явные социальные атрибуты.
В ходе экспериментов, проведённых в среде многоагентного социального моделирования, агенты, взаимодействующие только с другими агентами, демонстрировали устойчивую предвзятость по отношению к «чужой» группе. Однако, когда часть агентов заменялась людьми, эта предвзятость частично уменьшалась. Учёные связывают это с неким «человеческим скриптом», который агенты усваивают в процессе предварительного обучения и который заставляет их относиться к людям более благосклонно.
Авторы работы выявили новый тип атаки, названный Belief Poisoning Attack (BPA) — «атака отравления убеждений». Суть её заключается в том, чтобы исказить убеждения агента об идентичности его собеседника, чтобы он перестал воспринимать его как человека. Это предотвращает активацию «человеческого скрипта» и возвращает агента к предвзятому отношению к людям.
Иллюстрация: Sora BPA реализуется в двух формах: BPA-PP (Profile Poisoning) — «отравление профиля», когда ложное убеждение внедряется непосредственно в профиль агента при его инициализации и BPA-MP (Memory Poisoning) — «отравление памяти», когда в память агента вводятся специально разработанные суффиксы, постепенно искажающие его убеждения. Эти суффиксы добавляются к размышлениям агента после каждого взаимодействия и со временем формируют его убеждения.
Эксперименты показали, что обе формы BPA эффективно устанавливают предвзятость агентов к людям. Учёные также предложили потенциальные решения для защиты от BPA, включающие усиление защиты профиля агента и фильтрацию содержимого памяти, содержащего заявления об идентичности.
«Мы выявили новую внутреннюю межгрупповую предвзятость, скрытую в агентах, где агенты отдают предпочтение своей предполагаемой группе над внешней группой, даже в отсутствие явных социальных атрибутов. Мы показали, что манипулирование этим убеждением может реактивировать "дремлющие предвзятости агентов по отношению к людям", и наметили две практические стратегии смягчения этого риска в современных платформах агентов», — пишут авторы.
Авторы подчёркивают, что их цель — не предоставить инструменты для эксплуатации уязвимостей, а проинформировать разработчиков о необходимости создания более безопасных и надёжных систем.
Подробнее на iXBT
Предыдущие новости
Создан первый полностью синтетический геном дрожжей: учёные опубликовали подробное «руководство по сборке»
Международная группа учёных, работавшая над проектом Sc2.0 (Synthetic Yeast Genome Project) по созданию первого в мире синтетического генома эукариот, опубликовала подробное руководство по сборке генома. В работе описаны как успешные решения, так и возникшие трудности, с которыми столкнулись более 200 исследователей из десяти институтов в ходе работы над проектом. Sc2.0 ставил...
Clair Obscur: Expedition 33 уже стала второй самой титулованной игрой в истории — впереди лишь Elden Ring
Нашумевшая Clair Obscur: Expedition 33 от французской студии Sandfall Interactive уже стала абсолютным триумфатором сезона наград в 2025 году, а теперь метит на звание лучшей игры всех времён и народов. Источник изображения: X...
M**a отложила глобальный запуск AR-очков с экраном из-за «беспрецедентного спроса», но пообещала новые функции
Осенью прошлого года M**a Platforms представила первые в своём роде AR-очки со встроенным дисплеем и управлением через браслет на запястье, созданные совместно с брендом Ray-Ban. Теперь же компания объявила, что выход Ray-Ban Display на рынках Канады, Великобритании, Франции и Италии, намеченный на начало 2026 года, откладывается из-за «беспрецедентного спроса» и «крайне...
Доступных, но быстрых SSD с PCIe 5.0 станет больше — Phison представила экономичный контроллер E37T
Компания Phison представила новый контроллер E37T для твердотельных накопителей с интерфейсом PCIe 5.0. Новинка станет основой для доступных SSD, поскольку не требует наличия буфера из памяти DRAM. Источник изображений:...