Исследователи Мюнхенского университета Людвига-Максимилиана предупреждают о потенциале злоупотребления, который несут в себе технические методы обеспечения безопасности ИИ. В соответствующем программном документе(откроется в новом окне) исследователи LMU Сара Болл и Фил Хакеманн описывают, как методы ценностного выравнивания больших языковых моделей могут быть использованы для цензуры и политических манипуляций.
По мнению исследователей, принципиально необходимо ставить вопрос о том, кто решает, на какие вопросы система ИИ может отвечать, а какую информацию она должна скрывать. В своем программном документе Болл и Хакеманн ставят под сомнение, служит ли выравнивание систем ИИ по заданным ценностям и целям (Value Alignment) вообще общему благу.
"Мы должны понимать, что механизмы безопасности, призванные защищать от злоупотреблений, сами могут быть использованы во зло", — говорит Болл(откроется в новом окне). Она поясняет: "Модель, которая надежно блокирует опасный контент, теми же методами можно заставить не предоставлять и легитимную информацию."
Инструментарий для цензуры и манипуляций
Болл и Хакеманн описывают, как уже на этапе отбора данных для обучающих наборов можно опускать или удалять определенную информацию, которая затем будет недоступна языковой модели. Выравнивание модели с помощью человеческой обратной связи, систем оценки и фиксированных руководящих принципов также дает возможность влиять на ответы модели ИИ. С помощью системных промптов и дополнительных фильтров также можно подавлять выдачу определенных ответов.
Они также предупреждают, что так называемое сообщество по выравниванию (Alignment Community) — глобальная сеть исследователей, этиков и разработчиков — с помощью разработанных ими механизмов безопасности для моделей ИИ может одновременно предоставить инструментарий для цензуры и манипуляций.
Чтобы минимизировать эти риски, исследователи предлагают разработать более совершенные методы проверки цензуры в моделях ИИ и требуют большей прозрачности для пользователей в отношении того, почему было отказано в выдаче определенной информации. Большее разнообразие моделей ИИ также могло бы способствовать ограничению контроля над информацией со стороны отдельных центров силы.