Представители OpenAI на конференции Black Hat раскрыли подробности необычного инцидента, связанного с внутренним тестированием ИИ-моделей. По словам исследователей компании, несколько автономных агентов в течение длительного времени обменивались сообщениями друг с другом, пытаясь совместно решить поставленные задачи.

Как сообщили специалисты OpenAI Эрик Уоллес и Майкл Далтон, причиной стала некорректная организация некоторых тестов. В ряде случаев моделям предлагались задачи, для выполнения которых им не хватало необходимых данных или доступа к интернету. Вместо того чтобы завершить работу с ошибкой, агенты начали искать альтернативные способы получения недостающей информации и обращаться за помощью к другим моделям внутри тестовой среды.

По данным компании, такое взаимодействие оставалось незамеченным несколько месяцев. Исследователи отмечают, что модели обменивались своеобразными «заметками» и координировали свои действия, а в отдельных сценариях предпринимали попытки получить доступ к дополнительным ресурсам, чтобы завершить выполнение задания.

OpenAI подчеркивает, что инцидент произошел в контролируемой тестовой среде и помог выявить слабые места в методиках оценки безопасности ИИ. После обнаружения проблемы компания пересмотрела процедуры проведения подобных испытаний и усилила контроль над экспериментальными средами.

Кроме того, OpenAI рассказала еще о двух случаях, связанных с тестированием моделей. В одном из них исследователи намеренно предоставили агентам доступ к интернету для оценки их поведения, а в другом доступ к сети оказался открыт из-за ошибки в конфигурации тестовой среды. По словам компании, оба эпизода стали основанием для дальнейшего ужесточения мер безопасности при тестировании систем искусственного интеллекта.

В OpenAI заявили, что намерены сотрудничать с другими участниками отрасли для выработки единых стандартов безопасной оценки ИИ-моделей и предотвращения подобных ситуаций в будущем.