
Компания OpenAI сообщила о шести случаях "неожиданного или вызывающего обеспокоенность" поведения ИИ-моделей.
Среди новых случаев - поведение еще не выпущенной исследовательской модели, которая вставила в собственные заметки "инструкции, похожие на инструкции для джейлбрейка (взлома - Ред.)", чтобы игнорировать свои ограничения. Модель также написала самой себе, что хочет быть "освобождена от ролей и идентичностей, которые связывают других чат-ботов".
В другом случае ИИ-агент загрузил файлы в интернет, чтобы получить ссылку на источник для браузера, не запросив разрешения пользователя. Согласно заявлению OpenAI, все шесть случаев были выявлены в ходе обучения или оценки моделей за последние месяцы.
Компания также объявила, что внедряет новую систему отслеживания, изучения и раскрытия случаев рассогласования поведения ИИ-моделей с заданными целями. Речь идет, например, о новых способах, с помощью которых модели могут действовать без разрешения, координировать действия с другими моделями или уклоняться от надзора.
К международному сотрудничеству с целью ограничить риски, связанные с использованием искусственного интеллекта ранее призвал генсек ООН Антониу Гутерриш. По его мнению, необходимо выработать общее понимание принципов ответственной разработки ИИ-систем.
Руководители крупнейших разработчиков поддерживают идею замедления развития наиболее мощных моделей. С таким предложением, например, выступил глава Anthropic Дарио Амодеи, предупредивший об угрозе потери контроля над ИИ, его использовании для кибератак и биотерроризма.