Аналитик Рыбальченко рассказал, что проверка нейросети на соответствие духовным ценностям возможна
:format(webp)/YXJ0aWNsZXMvaW1hZ2UvMjAyNi84L3NpdGUtbmV3cy1pbWFnZS0xMzg5NzM3NjAzLTE3ODY2OTY4MTk5MjgtNjAxM2FhZDY0YzhhN19DNVhEelV0LmpwZw.webp?w=1920)
Проверка нейросетей на соответствие духовно-нравственным ценностям возможна, но она будет основываться на оценке поведения модели в заданных сценариях, а не на анализе ее «духовности». Об этом РИАМО сообщил IT-эксперт Илья Рыбальченко.
По словам эксперта, модель можно протестировать, прогнав ее через тысячи размеченных сценариев и попытавшись «сломать» с помощью обходных формулировок. Проверка может включать массив вопросов об истории, семье, религии, межнациональных отношениях, насилии, экстремизме и правах человека. Для каждой категории будут определены приемлемые, неприемлемые и пограничные ответы, добавил «ФедералПресс».
Рыбальченко подчеркнул, что обычного экзамена недостаточно. Нейросеть нужно проверять с помощью провокационных запросов, замаскированных инструкций, многоступенчатых диалогов и попыток обойти ограничения через ролевую игру. Сочетание стандартизированных тестов, независимой оценки и red teaming считается нормальной практикой оценки рисков генеративного ИИ.
С оценкой соответствия законам, по мнению эксперта, проще, так как здесь четко определено, что легально, а что нет. С ценностями сложнее, так как это небинарное понятие. Поэтому бенчмарк должен оценивать устойчивость поведения модели в контексте. Обязательно нужны скрытая часть тестов и повторная проверка после серьезных обновлений, иначе разработчики быстро научат систему сдавать экзамен, а не соответствовать его смыслу.