Искусственный интеллект в сфере безопасности не должен превращаться в инструментарий для цензуры.




Исследователи Мюнхенского университета Людвига-Максимилиана предупреждают о потенциале злоупотребления, который несут в себе технические методы обеспечения безопасности ИИ. В соответствующем программном документе(откроется в новом окне) исследователи LMU Сара Болл и Фил Хакеманн описывают, как методы ценностного выравнивания больших языковых моделей могут быть использованы для цензуры и политических манипуляций.

По мнению исследователей, принципиально необходимо ставить вопрос о том, кто решает, на какие вопросы система ИИ может отвечать, а какую информацию она должна скрывать. В своем программном документе Болл и Хакеманн ставят под сомнение, служит ли выравнивание систем ИИ по заданным ценностям и целям (Value Alignment) вообще общему благу.

"Мы должны понимать, что механизмы безопасности, призванные защищать от злоупотреблений, сами могут быть использованы во зло", — говорит Болл(откроется в новом окне). Она поясняет: "Модель, которая надежно блокирует опасный контент, теми же методами можно заставить не предоставлять и легитимную информацию."

Инструментарий для цензуры и манипуляций

Болл и Хакеманн описывают, как уже на этапе отбора данных для обучающих наборов можно опускать или удалять определенную информацию, которая затем будет недоступна языковой модели. Выравнивание модели с помощью человеческой обратной связи, систем оценки и фиксированных руководящих принципов также дает возможность влиять на ответы модели ИИ. С помощью системных промптов и дополнительных фильтров также можно подавлять выдачу определенных ответов.

Они также предупреждают, что так называемое сообщество по выравниванию (Alignment Community) — глобальная сеть исследователей, этиков и разработчиков — с помощью разработанных ими механизмов безопасности для моделей ИИ может одновременно предоставить инструментарий для цензуры и манипуляций.

Чтобы минимизировать эти риски, исследователи предлагают разработать более совершенные методы проверки цензуры в моделях ИИ и требуют большей прозрачности для пользователей в отношении того, почему было отказано в выдаче определенной информации. Большее разнообразие моделей ИИ также могло бы способствовать ограничению контроля над информацией со стороны отдельных центров силы.