К книге
Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всехКомментарии. Глава 4 Вы получаете не то, чему обучаете
75%
Комментарии. Глава 4 Вы получаете не то, чему обучаете
24

1 Petrie M. et al. Peahens Prefer Peacocks with Elaborate Trains. Animal Behavior, 41, no. 2 (1991): 323–31; Andersson M. Female Choice Selects for Extreme Tail Length in a Widowbird. Nature, 299 (1982): 818–20.

Хотя павы предпочитают павлинов с роскошными хвостами, не так уж очевидно, что роскошные хвосты вредят выживанию, их ведь можно использовать для запугивания (об этом свидетельствует тот факт, что павлины распускают хвосты при угрозе). Более понятный пример дорогостоящего полового украшения демонстрирует длиннохвостый бархатный ткач: эта птица сбрасывает свои длинные хвостовые перья в небрачный сезон. Но говорим мы о павлинах, потому что они привычнее.

2 Asimov I. I, Robot. Doubleday, 1950.

3 Kubrick S., Clarke A. C. 2001: A Space Odyssey. Metro-Goldwyn- Mayer, 1968.

4 Swift K. et al. Portal. Valve Corporation, 2007.

Редко, но все же такое случается. Например, первая видеоигра Portal изображает ИИ, подвергающий людей извращенным тестам, которые лишь отражают реальные научные эксперименты.

5 Rumbelow J., Watkins M. SolidGoldMagikarp (plus, prompt generation). LessWrong, February 5, 2023.

6 Rumbelow J., Watkins M. SolidGoldMagikarp III: Glitch Token Archaeology. LessWrong, February 14, 2023.

7 Russell S., Norvig P. Artificial Intelligence: A Modern Approach. Pearson, 2009; Soares N. et al. Corrigibility. October 18, 2014, preprint, published in 2015; Russell S. White Paper: Value Alignment in Autonomous Systems. November 1, 2014, people.eecs.berkeley.edu; Soares N., Fallenstein B. Aligning Superintelligence with Human Interests: A Technical Research Agenda. December 23, 2014, preprint, released in 2017, intelligence.org/2014/12/23/new-technical-research- agenda-overview.

До 2014 года мы называли это “проблемой дружественного ИИ”. Ведущий учебник по ИИ того времени, “Искусственный интеллект: современный подход” Стюарта Рассела и Питера Норвига, использовал эту терминологию в издании 2009 года со ссылкой на работу Юдковского. В 2014 году, когда ученые стали обращать на эти вопросы больше внимания, мы начали искать более совершенную терминологию. В беседе с Расселом мы остановились на термине “согласование” (alignment). Фолленстайн (научный сотрудник MIRI), Рассел, Соарес и Юдковский использовали этот новый термин в своих работах осенью 2014-го, и он занимал видное место в повестке технических исследований MIRI, опубликованной в конце того же года.

8 Marble A. Catching Claude Cheating. March 23, 2025, marble.onl; CharlesD353. I have also stopped using 3.7 for the same reasons – it cannot be trusted not to hack solutions to tests. X, April 18, 2025; seconds_0. It then started HIDING the functions where it was hard coding things. X, April 30, 2025.

Приводится резюме отчета Эндрю Марбла. Другие пользователи сообщали об аналогичном поведении. Модель Claude меньше жульничала, когда Марбл ругался на нее, а значит, подобное жульничество – не просто некомпетентность.

Предыдущая главаГлава 24 из 32Следующая глава