Американские специалисты разрабатывают защиту от вышедших из-под контроля ИИ-агентов

Айтишники рассчитывают создать полностью автономные процедуры отключения, которые будут применяться при возникновении серьезных проблем
Айтишники / Компьютеры / Разработка / Изображение сгенерировано ИИ ChatGPT / amic.ru

Крупные американские разработчики искусственного интеллекта хотят создать механизмы, которые позволят экстренно остановить ИИ-системы в случае опасного или неконтролируемого поведения. Для наблюдения за такими алгоритмами компании намерены использовать в том числе другие инструменты искусственного интеллекта, сообщает РИА Новости со ссылкой на Axios.

Тема безопасности вновь привлекла внимание после заявления исследователя Anthropic Джейкоба Коксона об уходе из индустрии. Он объяснил свое решение опасениями по поводу темпов развития технологии и заявил, что конкуренция между компаниями может приблизить мир к "точке невозврата" и апокалиптическому сценарию уже к концу 2027 года.

"Компании могут отключать отдельные серверы, от которых зависит ИИ, но по-настоящему мощные системы работают на множестве компьютеров и платформ. Единого рубильника, который можно дернуть, не существует. Именно поэтому компании экспериментируют с многоуровневой защитой, способной выявлять подозрительное поведение, останавливать агентов и отрезать вышедших из-под контроля агентов от ресурсов, необходимых им для продолжения работы", — передает портал.

В OpenAI рассчитывают создать полностью автономные процедуры отключения, которые будут применяться при возникновении серьезных проблем. Предполагается, что специальный ИИ-наблюдатель сможет обнаруживать потенциально опасное поведение агентов и предупреждать об этом сотрудников. Если угроза подтвердится, систему планируют отключать в течение 30 минут.

В Anthropic рассматривают другой подход, основанный на совместном контроле со стороны человека и искусственного интеллекта. Алгоритмы должны отслеживать подозрительную активность и сообщать сотрудникам о возможных сбоях. При этом, согласно материалу, во время последних испытаний автоматизированная система мониторинга смогла выявить только около половины угроз.

 

 

Читайте полную версию на сайте