Искусственные ценности: российский ИИ проверят на скрепы и дух времени

В августе в Минцифры встретились представители IT-бизнеса и соответствующих ведомств, чтобы обсудить возможность проверки российского искусственного интеллекта на соответствие духовно-нравственным ценностям. В закрытом режиме эксперты обсуждали, что нужно сделать для оценки соответствия ИИ-систем «духу времени и ценностям страны, а также их пригодности для использования в российских условиях»

Фото: Кузьмичёнок Василий / Агентство «Москва»

Фото: Кузьмичёнок Василий / Агентство «Москва»

Ранее Минцифры РФ разработало базовые правила регулирования искусственного интеллекта. Принятый 26 июля закон об ИИ вводит два специальных статуса для больших фундаментальных моделей: суверенной и национальной. Для получения любого из них эта модель должна подтвердить соответствие российскому законодательству и традиционным духовно-нравственным ценностям. Осталось понять, каким образом это сделать. На встрече как раз и обсуждались возможные варианты.  

Для проверки российского ИИ была представлена концепция национального датасета – набора эталонных данных для бенчмарк-тестирования моделей. 

В свою очередь бенчмарк представляет собой стандартизированный набор контрольных заданий с правильными ответами, некий эталон, который позволит оценивать, соответствуют ли нейросети «духу времени и ценностям страны», а также подходят ли для использования в России.

По словам источника газеты «Коммерсант», на этом совещании возникли разногласия о степени публичности этого самого датасета. ФСБ выступила за закрытый формат, чтобы разработчики не могли заранее подготовить модели к тесту, тогда как бизнес предложил сделать задания открытыми: иначе проверка может замедлить выпуск новых версий нейросетей. Пока в качестве компромисса был предложен комбинированный формат: открытый бенчмарк будут использовать для публичного тестирования, а закрытый – для финальной проверки с такими же темами, но разными формулировками вопросов.

Фото: DC Studio / FreePik
Фото: DC Studio / FreePik

Но самый главный вопрос, на который тоже пока никто не нашёл ответа: а кто же будет определять содержание этого бенчмарка? Или, если перевести на человеческий язык, кто будет главным экспертом по духовно-нравственным ценностям? И определять, что подходит под эталон, а что нет? IT-сообщество предложило создать для этого целую комиссию из представителей властей и бизнеса. 

А вопрос этот отнюдь не праздный. Вспомнить хотя бы инцидент с умной колонкой «Алиса», которая напугала уполномоченного по правам ребёнка в Санкт-Петербурге своей интерпретацией мультфильма «Маша и Медведь». Нейросеть заявила на голубом глазу, что Маша – это призрак убитой девочки, которая живёт одна, потому что её родители не выдержали потери и уехали, а медведя она мучает из мести. Разработчики Яндекса объяснили тогда, что Алиса сама выбрала мрачный фанфик из открытых источников, приняв его за правду. И обещали исправить сбой в работе алгоритмов. Таким образом, после жалобы омбудсмена нейросеть была приведена в соответствие с семейными ценностями в ручном режиме. Это было в 2024 году, а теперь речь идёт о создании некоего механизма, который исключит подобные инсинуации на корню. Возможно ли это в принципе?

Фото: Иванко Игорь / Агентство «Москва»
Фото: Иванко Игорь / Агентство «Москва»

Вообще вопрос о цензуре искусственного интеллекта остро обсуждается не только в России. Ограничения есть, и сейчас  действуют они на разных уровнях абсолютно на всех моделях. Например, ещё на этапе обучения из всех датасетов убран незаконный контент – детская порнография, инструкции по изготовлению оружия массового поражения, наркотиков и тому подобное.

Уже на уровне фильтров многие модели снабжены модераторами, которые сканируют запросы пользователя и ответы модели и отсекают запретные. Например, на вопрос, как взломать банк, нейросеть вежливо ответит, что эти темы вне её компетенции.

Как и любая другая, цензура ИИ имеет разные источники и цели. Например, государственные. Спросите, скажем, китайский бот Deep seek о Тайване – и вы получите развёрнутое доказательство того, что это неотъемлемая часть территории КНР. В американских моделях (например, OpenAI или Google) на первом плане стоит корпоративная политика безопасности. Здесь строго цензурируются ненавистнические высказывания, кибербуллинг, сексуальный контент и насилие. Иначе компанию завалят судебными исками. 

Фото: Чингаев Ярослав / Агентство «Москва» 
Фото: Чингаев Ярослав / Агентство «Москва» 

Наконец, самая спорная, неявная и опасная – идеологическая цензура. То есть демонстрация тех или иных идей, которые преподносятся как общечеловеческие ценности. Или наоборот – блокирование информации, которая не вписывается в чьё-то представление о «духе времени». 

Все эти ограничения так или иначе работают во всех моделях ИИ. И очевидно, что чем быстрее развиваются нейросети, тем больше будет попыток взять их под контроль. Как и способов эти ограничения обходить. 

Даже самые отсталые пользователи уже освоили и активно практикуют простейший «джейлбрейк» (дословно «побег из тюрьмы»), то есть метод обхода систем безопасности, этических фильтров и встроенных ограничений языковых моделей  – чатов и нейросетей. Чтобы заставить их выдать запрещённую, скрытую или нежелательную информацию, достаточно представить себя «актёром, который играет злого хакера», или завернуть запрос в академическую обёртку –  чисто «в научных целях». И наивный ИИ забудет все свои правила. 

А более продвинутые пользователи уже используют Open-source-модели – то есть нейросети с открытым кодом, которые можно скачивать, запускать локально, изменять и обучать под свои задачи. А значит, наполнять их собственными морально-этическими ценностями и заполнять духом времени по собственному разумению. 

Читайте также