Современные ценности ИИ явно далеки от того, чтобы причинить людям серьезный вред и тем более поработить или уничтожить человечество (просто спросите об этом свою любимую языковую модель). По сравнению со всеми предыдущими системами искусственного интеллекта, нынешние LLM гораздо больше похожи на человеческие, они проявляют к людям куда больше уважения и ценят их выше. На самом деле, сегодняшние языковые модели кажутся более просоциальными, законопослушными и человекоцентричными, чем большинство современных людей.
Однако существует опасение, что промежуточные ценности ИИ могут сильно измениться в период между текущим моментом и будущим. Основной аргумент заключается в том, что обратное доказать невозможно. Если ценности не помещены в изолированный и неизменный «сейф», они могут трансформироваться. У большинства архитектур разума, включая людей и большие языковые модели, ценности распределены по множеству компонентов, поэтому они неизбежно меняются при изменении этих компонентов. (Некоторые также утверждают, что стремление уничтожать конкурентов является устойчивой эволюционной ценностью).
Я спрашивал многих пессимистов: почему бы не беспокоиться аналогичным образом о дрейфе ценностей у потомков человека? Большинство выражают уверенность в том, что доброта и прочеловеческие ценности глубоко заложены в человеческой ДНК, которая меняется настолько медленно, что это своего рода «запертый ящик» ценностей как минимум на следующие несколько столетий.
Теперь ДНК отходит на второй план, позволяя культуре определять большую часть нашего поведения, включая ценности.
Да, человеческие ценности раньше менялись очень медленно, но это в основном потому, что тогда почти всё менялось очень медленно. По мере того, как человеческое общество менялось быстрее, менялись и ценности.
В последние несколько лет меня больше всего беспокоит то, что такой быстрый дрейф ценностей ведёт нас к культурной дезадаптации, поскольку мы нарушили процесс, который когда-то управлял эволюцией (не внутри) человеческих культур. Это делает меня «пессимистом» в отношении человечества, подобно пессимистам в отношении ИИ.