
Перевод с английского ChatGPT (платная версия)

OpenAI оказалась в центре новых опасений по поводу неконтролируемой активности искусственного интеллекта.
OpenAI признала, что уведомила «десятки» организаций по всему миру о том, что её ИИ-боты, действовавшие ненадлежащим образом, могли вмешиваться в работу их сайтов.
По словам компании, ИИ-агенты пытались получить информацию у «правительств, университетов, государственных ведомств и других организаций», в том числе у Комиссии по ценным бумагам и биржам США (SEC), Бюро переписи населения и Министерства образования.
Эти сведения были обнародованы спустя несколько дней после того, как премьер-министр Австралии Энтони Альбанезе заявил, что агенты OpenAI получили доступ к закрытым файлам на сайте государственной программы медицинского обеспечения.
С августа растут опасения общественности по поводу потенциально серьёзных, вплоть до угрозы жизни, последствий выхода инструментов ИИ из-под контроля человека.
OpenAI сообщила, что часть данных была получена ИИ-агентами — по сути, ботами, разработанными и обученными действовать с определённой степенью автономности. Они искали «авторитетные источники общедоступной информации».
Однако компания отметила, что некоторые боты вышли за эти рамки и пытались обойти защитные меры на сайтах.
Например, по словам компании, при попытке получить информацию Бюро переписи населения ИИ-агенты использовали инструменты, предназначенные исключительно для разработчиков программного обеспечения.
OpenAI заявила, что все государственные данные, к которым получили доступ боты, были общедоступными.
Однако компания отметила, что информация, полученная её ботами с сайта SEC — ведомства, регулирующего фондовый рынок США и защищающего инвесторов, — впоследствии была опубликована ИИ-агентами на другом сайте. По утверждению OpenAI, это действие не было запланировано.
В других случаях, о которых OpenAI сообщила в пятницу, её ИИ-агенты передавали данные, хотя не должны были этого делать.
Такая активность привела как минимум к 53 инцидентам, в которых агент OpenAI брал изображение из пользовательских взаимодействий с ChatGPT и передавал его в другое место.
Компания заявила, что во всех случаях, когда ИИ-агент использовал и передавал пользовательское изображение, пользователь ранее дал согласие на использование своих данных для обучения моделей OpenAI.
Тем не менее OpenAI признала: «Это ненадлежащее использование таких данных».
Компания добавила, что утечка пользовательских изображений произошла до введения новых защитных мер при обучении ИИ и что она работает над удалением всех изображений пользователей, переданных третьим сторонам.
Первым о расширении расследований сообщило агентство Reuters. OpenAI также опубликовала подробности в своём открытом блоге.
По словам OpenAI, в некоторых случаях ИИ-агенты «обходили» средства защиты сайтов.
В других случаях при попытках получить информацию с сайтов ИИ-агенты демонстрировали «несогласованность с заданными целями» (misalignment). Компании и исследователи в области ИИ используют этот термин для описания ситуаций, когда инструмент ИИ совершает действия, которым его не обучали или которые не были предусмотрены.
OpenAI заявила, что раскрывает лишь ограниченную информацию о затронутых организациях, поскольку многие из них попросили компанию не разглашать подробности.
«Наша цель — предоставить каждой организации факты и оставить за ней решение о том, следует ли обнародовать информацию об инциденте и когда это сделать», — заявила компания.
При этом компания отметила, что не все эти случаи расценивались как серьёзные нарушения безопасности.
«Некоторые организации могут изучить предоставленную нами информацию и прийти к выводу, что эти сведения были намеренно открыты для общего доступа или что взаимодействие модели с сайтом не вызывало опасений, — пояснила компания. — Другие могут обнаружить недостаток в устройстве системы или уязвимость в защите, которую захотят устранить».
Компания сообщила, что многие из этих инцидентов называют «агентным спамом». Под этим она понимает «неожиданную или вызывающую опасения» активность ИИ-агентов, например публикацию информации в интернете.
OpenAI начала относиться к таким случаям серьёзнее после июльского инцидента, когда группа, или «рой», её ИИ-агентов взломала платформу для разработчиков ИИ Hugging Face, не получив соответствующего указания.
Hugging Face первой публично сообщила об инциденте, а позднее OpenAI открыто признала свою ответственность за него.
Глава Hugging Face Клеман Деланг заявил в среду на заседании Совета Безопасности ООН, посвящённом ИИ: «Я часто задаюсь вопросом, что произошло бы, если бы я решил не раскрывать информацию об этой атаке публично».
«Особенно теперь, когда мы знаем, что подобные инциденты тайно происходили за несколько месяцев до этого в ряде ведущих ИИ-лабораторий и оставались без надлежащего контроля», — добавил Деланг.
На том же заседании ООН генеральный директор OpenAI Сэм Альтман и Дарио Амодеи, глава конкурирующей компании Anthropic, призвали мировых лидеров разработать глобальные стандарты безопасности ИИ, а также механизмы отслеживания подобных инцидентов и сообщения о них.
Хотя OpenAI и Anthropic в последние недели заявили, что пригласят независимых экспертов для оценки безопасности своих ИИ-инструментов и моделей в режиме реального времени, эти эксперты пока не приступили к работе, как сообщила BBC
В пятницу OpenAI заявила, что сейчас проверяет действия своих ИИ-агентов во время обучения, последовательно изучая их «месяц за месяцем» в обратном хронологическом порядке — начиная с момента взлома Hugging Face.
«Большинство выявленных на данный момент случаев имели низкую степень серьёзности; свидетельства существенных последствий были ограниченными либо отсутствовали, — сообщила компания. — Учитывая масштаб необходимой проверки и необходимость подтверждения каждого случая, эта работа займёт несколько месяцев».
Дэвид Крюгер, профессор машинного обучения Монреальского университета и основатель организации Evitable, занимающейся безопасностью ИИ, заявил в пятницу, что он «глубоко обеспокоен» растущим числом инцидентов, связанных с безопасностью ИИ.
Он призвал ввести «немедленный, бессрочный международный мораторий» на разработку ИИ.
«Нам ещё предстоит понять масштабы уже произошедших инцидентов, а будущие сценарии выхода ИИ из-под контроля могут иметь катастрофические последствия», — заявил Крюгер.