Современные ценности ИИ явно далеки от того, чтобы причинить людям серьезный вред и тем более поработить или уничтожить человечество (просто спросите об этом свою любимую языковую модель). По сравнению со всеми предыдущими системами искусственного интеллекта, нынешние LLM гораздо больше похожи на человеческие, они проявляют к людям куда больше уважения и ценят их выше. На самом деле, сегодняшние языковые модели кажутся более просоциальными, законопослушными и человекоцентричными, чем большинство современных людей.
Однако существует опасение, что промежуточные ценности ИИ могут сильно измениться в период между текущим моментом и будущим. Основной аргумент заключается в том, что обратное доказать невозможно. Если ценности не помещены в изолированный и неизменный «сейф», они могут трансформироваться. У большинства архитектур разума, включая людей и большие языковые модели, ценности распределены по множеству компонентов, поэтому они неизбежно меняются при изменении этих компонентов. (Некоторые также утверждают, что стремление уничтожать конкурентов является устойчивой эволюционной ценностью).
Я спрашивал многих пессимистов: почему бы не беспокоиться аналогичным образом о дрейфе ценностей у потомков человека? Большинство выражают уверенность в том, что доброта и прочеловеческие ценности глубоко заложены в человеческой ДНК, которая меняется настолько медленно, что это своего рода «запертый ящик» ценностей как минимум на следующие несколько столетий.
Теперь ДНК отходит на второй план, позволяя культуре определять большую часть нашего поведения, включая ценности.