- Датамайнеры: ремейк The Elder Scrolls IV:... (226)
- Затмить звезду: новый коронограф позволит... (230)
- Смартфоны получат этикетки с данными об... (211)
- Chery переписала цены на кроссоверы Tiggo 9,... (213)
- Для российских исследователей будут созданы... (210)
- Почему в максимально локализованной (на 90%)... (222)
- Нейросеть «Авито» A-Vibe анализирует диалоги... (225)
- «АвтоВАЗ» взял на работу поющего... (223)
- Механика против роботов: новый Porsche 911... (227)
- Бета-версия футбольного экшена Rematch от... (218)
- Настоящее корейское качество — сделано в... (221)
- Мощный конкурент iPhone 16 Pro Max и Galaxy... (209)
- Oppo представила недорогой смартфон Oppo K13... (207)
- Черная дыра в центре галактики M83:... (217)
- Дуров раскрыл, что может его заставить... (216)
- Флагманский кроссовер Omoda C7... (212)
98,7% опасных запросов заблокировано: OpenAI усиливает защиту ИИ-моделей от биоугроз с помощью автоматизированного мониторинга
Дата: 2025-04-19 20:21
Компания OpenAI объявила о внедрении новой системы безопасности для своих моделей o3 и o4-mini, направленной на предотвращение их использования в создании биологических и химических угроз. Разработанный монитор анализирует запросы пользователей в реальном времени и блокирует те, что связаны с рискованными сценариями, такими как разработка биологического оружия.
Согласно внутреннему отчёту OpenAI, система основана на алгоритме, который отслеживает «рассуждения» моделей, чтобы выявлять нарушения политик контента. В рамках тестирования специальная группа по проверкам на уязвимости (так называемая «красная команда») потратила более 1000 часов на симулирование опасных диалогов. В 98,7% случаев o3 и o4-mini отказывались предоставлять информацию, связанную с биоугрозами. Однако компания признаёт, что тесты не учитывали ситуации, когда пользователи повторно формулируют запрещённые запросы после блокировки. Поэтому часть ответственности по-прежнему возложена на человеческий контроль.

Новые модели, особенно o3, демонстрируют повышенную эффективность в ответах на сложные технические вопросы, что, по оценкам OpenAI, увеличивает потенциальные риски. Хотя текущие версии не достигают «порога высокого риска», их возможности превосходят предыдущие разработки, включая GPT-4. Для минимизации угроз компания интегрировала аналогичную систему мониторинга в генератор изображений GPT-4o, который теперь автоматически блокирует попытки создания изображения запрещённых тематик (CSAM).
Критики, включая партнёра по тестированию Metr, указывают на недостатки в подходе OpenAI. Например, для модели o3 было выделено мало времени на проверку устойчивости к обманным тактикам. Кроме того, запуск GPT-4.1 на прошлой неделе прошёл без публикации отчёта по безопасности, что вызвало вопросы о прозрачности компании.
OpenAI продолжает совершенствовать «Рамочную программу готовности», акцентируя внимание на химических и биологических угрозах. Несмотря на прогресс в автоматизации, баланс между инновациями и безопасностью остаётся сложной задачей. Успех новых мер во многом зависит от способности систем адаптироваться к эволюции методов злоумышленников, а также от сотрудничества разработчиков с независимыми исследователями.
Подробнее на iXBT
Предыдущие новости
Тут вам и новейшая RTX 5060 Laptop, и Ryzen AI 7 350 для соответствия категории Copilot+, и отличный экран. Представлен ноутбук Asus TUF Gaming A14
Компания Asus представила новую версию ноутбука TUF Gaming A14, которая сочетает сразу несколько привлекательных функций и особенностей. фото Asus Во-первых, тут установлена новейшая GeForce RTX 5060 Laptop в виде 110-ваттной версии. Во-вторых, в основе лежит очень энергоэффективный и весьма мощный процессор Ryzen AI 7 350, который заодно соответствует категории Copilot+. ...
Учёные открыли новый цвет, который невозможно увидеть без стимуляции глаза лазером
Исследователи из Калифорнийского университета в Беркли утверждают, что открыли новый цвет, который невозможно увидеть в обычных условиях. С помощью лазера они стимулировали отдельные клетки сетчатки глаза, в результате чего участники эксперимента увидели оттенок, выходящий за пределы естественного восприятия человеческого зрения. Об этом рассказала The Guardian. Источник...
У земных лишайников обнаружился потенциал для выживания на Марсе
Вопрос о том, существовала ли на Марсе жизнь, остаётся открытым до сих пор, а его нынешняя среда с интенсивной радиацией и разреженной атмосферой представляется для жизни совсем не благоприятной. Но есть версия, что там моли бы выжить земные лишайники. И недавно она нашла новое подтверждение. Источник изображения: David Clode /...
Квантовые компьютеры не так безопасны, как считалось: обнаружен новый метод взлома
Исследователи раскрыли уязвимость квантовых компьютеров, адаптировав атаку Rowhammer, известную в классических системах. Rowhammer нарушает работу памяти DRAM, многократно обращаясь к соседним ячейкам. Ученые из Гданьского университета показали, что аналогичный эффект достижим в квантовых системах: многократные манипуляции с кубитами вызывают перекрестные помехи, изменяя...