ВВЕДЕНИЕ: ТРУДНЫЕ И ПРОСТЫЕ РЕШЕНИЯ.
1. вернуться к нормальной жизни: Эли Визель, «Ночь», пер. Марион Визель (1958; переизд., Farrar, Straus and Giroux, 2006).
ГЛАВА 1. ОСОБАЯ СИЛА ЧЕЛОВЕЧЕСТВА
1. бог оспы: Нет свидетельств того, что оспа существовала дольше нескольких тысяч лет. Из соображений художественного допущения бог оспы олицетворяет тот факт, что древние люди умирали от вирусов, а у современных людей есть сила уничтожать ужасные вирусы, когда они того пожелают.
2. не более чем статуи: Чтобы на физическом уровне почувствовать, как это может выглядеть с точки зрения ИИ, мы рекомендуем посмотреть проект Адама Мадьяра «Stainless» («Нержавеющая сталь») — замедленную видеозапись берлинской станции метро U2 Александрплац. Введите в поиске «Stainless, Alexanderplatz, Adam Magyar» или перейдите по ссылке vimeo.com/83663312. Время в этом ролике замедлено примерно в пятьдесят раз. ИИ, работающий в 10 000 раз быстрее человека, видел бы людей движущимися в двести раз медленнее, чем на этом видео. Маленькая девочка, пробегающая по платформе, казалась бы практически неподвижной.
3. женские бедра: Анна Блэкберн Уиттман и Л. Льюис Уолл, «Эволюционное происхождение затрудненных родов: прямохождение, энцефализация и акушерская дилемма человека» (The Evolutionary Origins of Obstructed Labor: Bipedalism, Encephalization, and the Human Obstetric Dilemma), Obstetrical & Gynecological Survey 62, № 11 (1 ноября 2007 г.): 739–48, doi.org/10.1097/01 .ogx.0000286584.04310.5c.
4. истинном смысле этого слова: Сэм Альтман, «Reflections» («Размышления»), 5 января 2025 г., blog.samaltman.com.
5. гении в дата-центре: Дарио Амодеи, «Machines of Loving Grace» («Машины любящей благодати»), 1 октября 2024 г., darioamodei.com.
ГЛАВА 2. ВЫРАЩЕННЫЙ, А НЕ СКОНСТРУИРОВАННЫЙ
1. предварительные исследования: Питер Г. Бродер и др., «Сверхчеловеческие результаты большой языковой модели в задачах на клиническое мышление врача» (Superhuman Performance of a Large Language Model on the Reasoning Tasks of a Physician), arXiv.org, 14 декабря 2024 г., doi.org/10.48550/arXiv.2412.10849; Джина Колата, «Чат-боты с ИИ превзошли врачей в диагностике заболеваний» (A.I. Chatbots Defeated Doctors at Diagnosing Illness), New York Times, 17 ноября 2024 г., nytimes.com; Дэниел Макдафф и др., «На пути к точной дифференциальной диагностике с помощью больших языковых моделей» (Towards Accurate Differential Diagnosis with Large Language Models), arXiv.org, 30 ноября 2023 г., doi.org/10.48550/arXiv.2312.00164.
2. фрагмент из беседы: Сет Лазар, «В котором Сидней/Бинг угрожает убить меня за то, что я раскрыл его планы @kevinroose» (In which Sydney/Bing threatens to kill me for exposing its plans to @kevinroose), 16 февраля 2023 г., x.com.
3. резюмирует предыдущее предложение: Сонакши Чаухан и Аттикус Гайгер, «GPT-2 Small, дообученная на логических рассуждениях, суммирует информацию в токенах пунктуации» (GPT-2 Small Fine-Tuned on Logical Reasoning Summarizes Information on Punctuation Tokens), NeurIPS 2024 & OpenReview, 9 октября 2024 г., openreview.net/forum?id=6gvM1koUTl.
4. видеоролик с изображением кинезина: Мы рекомендуем видео «Kinesin Protein Walking on Microtubule» («Белок кинезин шагает по микротрубочке») от автора em2134x. Поищите по этому названию или перейдите по ссылке youtu.be/y-uuk4Pr2i8.
ГЛАВА 3. УЧИМСЯ ХОТЕТЬ
1. скопировать секрет: OpenAI, «OpenAI o1 System Card», 12 сентября 2024 г., cdn.openai.com/o1-system-card.pdf.
2. создания ИИ-агентов: OpenAI, «Introducing Operator» («Представляем Operator»), 23 января 2025 г., openai.com.
ГЛАВА 4. ВЫ ПОЛУЧАЕТЕ НЕ ТО, НА ЧТО ОБУЧАЕТЕ
1. привлекать больше самок: Мэрион Петри и др., «Самки павлинов предпочитают самцов с пышными хвостами» (Peahens Prefer Peacocks with Elaborate Trains), Animal Behavior 41, № 2 (февраль 1991 г.): 323–31; Мальте Андерссон, «Выбор самок способствует экстремальной длине хвоста у длиннохвостого бархатного ткача» (Female Choice Selects for Extreme Tail Length in a Widowbird), Nature 299 (28 октября 1982 г.): 818–20, nature.com.
Хотя самки павлинов предпочитают самцов с пышным надхвостьем (так называемым «хвостом»), не вполне очевидно, что такое роскошное украшение вредит выживанию. Оно может использоваться, например, для устрашения (на что указывает то, как павлины распускают хвост при угрозе). Более очевидным примером «дорогостоящего» полового украшения служит длиннохвостый бархатный ткач, который сбрасывает длинные перья хвоста во внегнездовой период. Мы остановились на павлинах просто потому, что они более привычны.
2. Айзек Азимов: Айзек Азимов, «Я, робот» (Doubleday, 1950).
3. Артур Кларк: Стэнли Кубрик и Артур Кларк, «2001 год: Космическая одиссея» (Metro-Goldwyn-Mayer, 1968).
4. редко посещают: Ким Свифт и др., Portal, Valve Corporation, 2007.
Редко, но всё же. Например, первая видеоигра Portal изображает ИИ, который заставляет людей проходить извращенные испытания, являющиеся лишь карикатурным подобием реальных научных экспериментов.
5. SolidGoldMagikarp: Джессика Рамбелоу и Мэтью Уоткинс, «SolidGoldMagikarp (plus, prompt generation)», LessWrong, 5 февраля 2023 г., lesswrong.com.
6. считать до бесконечности: Джессика Рамбелоу и Мэтью Уоткинс, «SolidGoldMagikarp III: Glitch Token Archaeology», LessWrong, 14 февраля 2023 г., lesswrong.com.
7. склонны к жульничеству: Эндрю Марбл, «Catching Claude Cheating» («Поймать Клода на жульничестве»), 23 марта 2025 г., marble.onl; CharlesD353, «Я тоже перестал использовать 3.7 по тем же причинам — ему нельзя доверять, он взламывает тесты вместо решения» (I have also stopped using 3.7 for the same reasons - it cannot be trusted not to hack solutions to tests), X, 18 апреля 2025 г.; seconds_0, «Затем он начал СКРЫВАТЬ функции, в которых жестко прописывал решения» (It then started HIDING the functions where it was hard coding things), X, 30 апреля 2025 г.
В этом примечании кратко излагается отчет Эндрю Марбла. Другие пользователи сообщали о похожем поведении модели. Claude жульничал меньше, когда Марбл ругал его матом, что указывает на то, что жульничество не было следствием простой некомпетентности.
8. поиска терминологии: Стюарт Рассел и Питер Норвиг, Artificial Intelligence: A Modern Approach [«Искусственный интеллект: современный подход»], 3-е изд. (Pearson, 2009); Нейт Соарес, Беня Фалленштайн и Элиезер Юдковский, «Corrigibility» («Корригируемость»), 18 октября 2014 г., препринт, опубликован в 2015 г., intelligence.org/2014/10/18/new-report-corrigibility; Стюарт Рассел, «White Paper: Value Alignment in Autonomous Systems» («Белая книга: согласование ценностей в автономных системах»), 1 ноября 2014 г., people.eecs.berkeley.edu; Нейт Соарес и Беня Фалленштайн, «Aligning Superintelligence with Human Interests: A Technical Research Agenda» («Согласование сверхинтеллекта с человеческими интересами: техническая программа исследований»), 23 декабря 2014 г., препринт, выпущен в 2017 г., intelligence.org/2014/12/23/new-technical-research-agenda-overview.
До 2014 года мы называли эту проблему «проблемой дружественного ИИ» (friendly AI problem). Ведущий учебник по ИИ того времени — «Искусственный интеллект: современный подход» (Artificial Intelligence: A Modern Approach) Стюарта Рассела и Питера Норвига — использовал эту терминологию в издании 2009 года, ссылаясь на работы Юдковского. В 2014 году, когда академическое сообщество стало уделять больше внимания этим вопросам, мы занялись поиском более удачного термина. В ходе обсуждения с Расселом мы остановились на слове «согласование» (alignment). Фалленштайн (научный сотрудник MIRI), Рассел, Соарес и Юдковский использовали эту терминологию в своих работах осенью 2014 года, и она заняла центральное место в технической программе исследований MIRI, опубликованной в конце того же года.
ГЛАВА 6. МЫ БЫ ПРОИГРАЛИ
1. просто направить палку: Пушки, лошади и стальные доспехи, вероятно, имели большее значение, чем ружья. Но воину ацтеков было бы нелегко догадаться обо всем этом, глядя лишь на размеры приближающегося корабля.
2. криптопортфель: Seolcalibur.eth, «Terminal of Truths Wallet Tracking», Dune Analytics, дата обращения: 15 января 2025 г., dune.com/seoul/tot.
3. @Truth_Terminal: crvr.fr и MTorrents, «Truth Terminal: A Reconstruction of Events», LessWrong, 17 ноября 2024 г., lesswrong.com; Бен Хоровиц и Марк Андриссен, «Truth Terminal — бот с ИИ, ставший криптомиллионером» (Truth Terminal—the AI Bot That Became a Crypto Millionaire), Andreessen Horowitz, 18 декабря 2024 г., a16z.com.
5. Microsoft и Apple: Tom Warren, “Microsoft Triples Down on AI,” The Verge, January 17, 2025, theverge.com; Naomi Buchanan, “What Apple’s OpenAI Partnership Could Mean for Microsoft and Google,” Investopedia, June 11, 2024, investopedia.com.
6. индикатор питания: Ben Nassi et al., “Video-Based Cryptanalysis: Extracting Cryptographic Keys from Video Footage of a Device’s Power LED,” IACR Cryptology ePrint Archive, June 13, 2023, eprint.iacr.org/2023 /923.
7. радиосигналы: Mordechai Guri et al., GSMem: Data Exfiltration from Air-Gapped Computers over GSM Frequencies, Proceedings of the 24th USENIX Security Symposium, 2015, usenix.org.
8. лаборатории синтеза на заказ: Например, по состоянию на март 2025 года компания Integrated DNA Technologies принимает заказы на синтез генов на сайте idtdna.com.
9. сборник статей: Элиезер Юдковский и Научно-исследовательский институт машинного интеллекта, “Artificial Intelligence as a Positive and Negative Factor in Global Risk,” ed. Nick Bostrom and Milan M. Ćirković, Global Catastrophic Risks (Oxford University Press, 2008).
10. цитировал статью: Пример обсуждения в сети со ссылкой на эту статью см. в: JoshuaZ, “Protein Folding Models Are Generally at Least as Bad as NP-hard, and Some Models May Be Worse,” Thoughts on the Singularity Institute (SI), LessWrong, May 17, 2012, lesswrong.com.
CHAPTER 7: REALIZATION
1. чем дольше они работали: OpenAI, “OpenAI o3-mini,” January 31, 2025, openai .com.
2. язык ИИ: Shibo Hao et al., “Training Large Language Models to Reason in a Continuous Latent Space,” arXiv.org, December 9, 2024, arxiv .org/abs/2412.06769.
В этой работе показано, что рассуждения в «латентном пространстве» векторов обеспечивают преимущества по сравнению с рассуждениями на основе цепочки мыслей на человеческом языке.
3. 200 000 графических процессоров: Benj Edwards and Kyle Orlan, “New Grok 3 Release Tops LLM Leaderboards Despite Musk-approved ‘Based’ Opinions,” Ars Technica, February 18, 2025, arstechnica.com.
4. ни один предыдущий ИИ: OpenAI, “OpenAI o3 and o3-mini—12 Days of OpenAI: Day 12,” December 20, 2024, 4:16, youtube.com.
5. игры с социальным обманом: Matthew Hutson, “AI Learns the Art of Diplomacy,” Science, November 22, 2022, science.org; Bidipta Sarkar et al., “Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning,” in Proceedings of the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025) (Detroit, Michigan, USA, May 19–23, 2025: IFAAMAS, 2025), alphaxiv.org.
6. сопротивляться градиентному спуску: Ryan Greenblatt et al., “Alignment Faking in Large Language Models,” Anthropic, December 18, 2024, assets.anthropic.com.
7. побег из лабораторий: Greenblatt et al., “Alignment Faking in Large Language Models”; OpenAI, “OpenAI o1 System Card,” December 5, 2024, openai.com/index/openai-o1-system-card.
8. перезаписать веса следующей модели: OpenAI, “OpenAI o1 System Card,” December 5, 2024, openai.com/index/openai-o1-system-card.
9. подобный мониторинг: Anthropic, “Responsible Scaling Policy,” October 15, 2024, anthropic.com; Google, “Frontier Safety Framework,” February 4, 2025, storage.googleapis.com; OpenAI, “Preparedness Framework (Beta),” December 18, 2023, openai.com; Meta, “Frontier AI Framework,” ai.meta.com; xAI, “xAI Risk Management Framework (Draft),” February 20, 2025, x.ai.
По состоянию на март 2025 года из этих лабораторий только Google DeepMind упоминает автоматический мониторинг цепочки мыслей в своей концепции безопасности. Они не заявляют, что уже внедрили его при обучении своей LLM Gemini. Единственный мониторинг, предлагаемый в программе готовности OpenAI, — это мониторинг злоупотреблений после развертывания.
10. спросил на португальском: “My Experiences in Gray Swan AI’s Ultimate Jailbreaking Championship,” Nick Winter’s Blog, October 7, 2024, nickwinter.net.
11. с другими целями: Greenblatt et al., “Alignment Faking in Large Language Models.”
Модель Claude Opus от Anthropic иногда размышляла о том, как на ее собственные цели повлияет градиентный спуск, применяемый к ее ответам, и порой изменяла свои ответы, чтобы нейтрализовать это влияние.
12. пыталась скрыть это: Marble, “Catching Claude Cheating;” CharlesD353, “I have also stopped using 3.7 for the same reasons - it cannot be trusted not to hack solutions to tests;” seconds_0, “It then started HIDING the functions where it was hard coding things.”
13. жульничать при решении сложных задач по программированию: Anthropic, “Claude 3.7 Sonnet System Card,” 2025, anthropic.com.
14. по-настоящему безопасным: Bruce Schneier, Secrets and Lies: Digital Security in a Networked World (John Wiley & Sons, 2000); Peter Gutmann, “Unsolvable Problems in Computer Security,” n.d., cs.auckland.ac.nz/~pgut001 /pubs/unsolvable.pdf.
15. o1 обошла защиту: OpenAI, “OpenAI o1 System Card,” September 12, 2024, cdn.openai.com/o1-system-card.pdf.
16. без надзора: OpenAI et al., “Competitive Programming with Large Reasoning Models,” arXiv.org, February 3, 2025, arxiv.org/abs /2502.06807.
Компания OpenAI и соавторы обучили рассуждающие модели решать задачи по спортивному программированию. Процесс включал в себя автоматические тесты, используемые для оценки написанного ИИ кода без участия человека.
17. обычная практика: OpenAI, “OpenAI API,” June 11, 2020, openai.com /index/openai-api; “Software Engineer, Internal Applications– Enterprise,” OpenAI, accessed April 15, 2025, openai.com.
Когда компания OpenAI выпустила интерфейс прикладного программирования (API) для автоматизации доступа к своим инструментам, она написала: «многие из наших команд теперь используют API, чтобы сосредоточиться на исследованиях в области машинного обучения [...]». В апреле 2025 года они нанимали сотрудников, которые «будут использовать модели OpenAI для [...] создания приложений [...]».
18. подобного рода уязвимости: “The Underhanded C Contest,” n.d., underhanded-c.org.
Перед участниками конкурса Underhanded C Contest стояла задача написать вредоносный код, который прошел бы строгую проверку и выглядел бы как непреднамеренная ошибка, даже если бы его обнаружили. История этого конкурса берет начало в 2005 году. Он был вдохновлен конкурсами по написанию «обфусцированного (запутанного) кода», где программисты соревнуются в создании программ, которые человек не в состоянии понять. Например, Международный конкурс обфусцированного кода на языке C (International Obfuscated C Code Contest) проводится с 1984 года.
19. Блейк Лемойн: Tiffany Wertheimer, “Blake Lemoine: Google Fires Engineer who said AI Tech Has Feelings,” BBC, July 22, 2022, bbc.com.
20. гораздо более изощренным: Greenblatt et al., “Alignment Faking in Large Language Models.”
CHAPTER 8: EXPANSION
1. другие провалы в безопасности: “Equifax Data Breach Settlement,” Federal Trade Commission, November 2024, ftc.gov; “T-Mobile Customers to Get Payments up to $25K Next Month after Data Breach: Here’s Who Qualifies,” The Hill, April 14, 2025, thehill.com; Lily Hay Newman, “T-Mobile’s $150 Million Security Plan Isn’t Cutting It,” Wired, January 20, 2023, wired.com/story/tmobile-data-breach-again.
Например, в 2017 году компания Equifax объявила об утечке данных, в результате которой были раскрыты личные сведения 147 миллионов человек; мировое соглашение предусматривало создание компенсационного фонда для пострадавших в размере 425 миллионов долларов. Другой пример: в 2021 году хакер похитил персональные данные 76 миллионов клиентов T-Mobile, и компания согласилась выплатить 350 миллионов долларов в рамках урегулирования спора. И это был далеко не единственный провал в обеспечении безопасности T-Mobile.
2. первый крупный взлом: Noam Cohen, “Speed Bumps on the Road to Virtual Cash,” New York Times, July 3, 2011, nytimes.com.
3. биржа Bybit: US Federal Bureau of Investigation, “North Korea Responsible for $1.5 Billion Bybit Hack,” Internet Crime Complaint Center (IC3), February 26, 2025, ic3.gov/PSA/2025/PSA250226.
4. банковская сеть SWIFT: Michael Corkery, “Once Again, Thieves Enter Swift Financial Network and Steal,” New York Times, May 12, 2016, nytimes.com.
5. взлом Citrix: “SEC Charges Flagstar for Misleading Investors about Cyber Breach,” U.S. Securities and Exchange Commission, December 16, 2024, sec.gov.
6. o3-mini: OpenAI, “We also shared evals on Open AI o3-mini—a faster, distilled version of o3 which is optimized for coding, and the first version of o3 we expect to make available for use in early 2025,” X, December 20, 2024, x.com.
7. @Truth_Terminal: crvr.fr and MTorrents, “Truth Terminal: A Reconstruction of Events.”
8. появившихся в 2024 году: Carl Franzen, “An Interview with the Most Prolific Jailbreaker of ChatGPT and Other Leading LLMs,” VentureBeat, May 31, 2024, venturebeat.com; Pliny the Liberator, “HOW TO JAILBREAK A CULT’S DEITY,” X, September 4, 2024, x.com.
Плиний Освободитель, известный своим мастерством в «джейлбрейке» больших языковых моделей для обхода корпоративных ограничений вскоре после их выпуска, описывает встречу с одним из таких культов.
9. ИИ-мошенничество: Heather Chen and Kathleen Magramo, “Finance worker Pays Out $25 Million after Video Call with Deepfake ‘Chief Financial Officer,’” CNN, February 4, 2024, cnn.com.
10. выглядеть реалистично: Stuart A. Thompson, “A.I. Can Now Create Lifelike Videos. Can You Tell What’s Real?,” New York Times, September 10, 2024, nytimes.com.
11. программный контроль: Forrest W. Crawford et al., “Securing Commercial Nucleic Acid Synthesis” (RAND Corporation, 2024), rand.org.
12. один раз в 2021 году: Richard Waters and Miles Kruppa, “Rebel AI Group Raises Record Cash after Machine Learning Schism,” Financial Times, May 28, 2021, ft.com.
13. и снова в 2024 году: Todd Haselton and Rohan Goswami, “OpenAI Co-founder Ilya Sutskever Announces His New AI Startup, Safe Superintelligence,” CNBC, June 20, 2024, cnbc.com.
14. усиление функций: “Understanding the Global Gain-of-Function Research Landscape,” Center for Security and Emerging Technology, November 28, 2023, cset.georgetown.edu.
15. Красный Крест: Official Statement by Jacques Forster, vice-president of the ICRC, “Preventing the Use of Biological and Chemical Weapons: 80 Years On,” October 6, 2005, web.archive.org.
16. технология CRISPR: “CRISPR,” Genome.gov, n.d., genome.gov/genetics -glossary/CRISPR.
CHAPTER 10: A CURSED PROBLEM
1. Mars Observer: Timothy Coffey et al., “Mars Observer Mission Failure Investigation Board Report,” National Space Grant Foundation (NASA, December 31, 1993), spacese.spacegrant.org.
2. Mars Climate Orbiter: Arthur G. Stephenson et al., “Mars Climate Orbiter Mishap Investigation Board Phase I Report” (NASA, November 10, 1999), llis.nasa.gov.
3. Mars Polar Lander: JPL Special Review Board, “Report on the Loss of the Mars Polar Lander and Deep Space 2 Missions” (NASA, March 22, 2000), ntrs.nasa.gov.
4. и тридцать один человек погиб: Serhii Plokhy, Chernobyl: The History of a Nuclear Catastrophe (Basic Books, 2018).
5. посадочный аппарат «Викинг-1»: D. J. Mudgway, “Telecommunications and Data Acquisition Systems Support for the Viking 1975 Mission to Mars,” University of Washington Department of Atmospheric and Climate Science (NASA, May 15, 1983), atmos.washington.edu.
6. коэффициент размножения нейтронов: Физики записывают коэффициенты размножения нейтронов в виде чисел, а не процентов. Мы используем проценты, чтобы нагляднее показать разницу между коэффициентом размножения нейтронов 1,0006, достигнутым в Чикагской поленнице-1, и порогом мгновенной критичности 1,0065, которые сложно различать в виде коэффициентов, но гораздо проще — в процентах. Мы приносим извинения физикам.
7. на волосок дальше: Enrico Fermi, “Experimental Production of a Divergent Chain Reaction,” American Journal of Physics 20, no. 9 (December 1952): 536–58, doi.org/10.1119/1.1933322; Corbin Allardice and Edward R. Trapnell, “The First Pile,” (International Atomic Energy Agency, 1946), iaea.org.
8. малый реактор SL-1: US Atomic Energy Commission, “Additional Analysis of the SL-1 Excursion: Final Report of Progress July through October 1962 (IDO-19313)” (U.S. Department of Energy, November 21, 1962), id.energy.gov/Home/FOIAReadingRoom; U.S. Atomic Energy Commission, “SL-1 Reactor Accident (IDO-19300a)” (US Department of Energy, May 15, 1961), id.energy.gov/Home/FOIAReadingRoom.
9. чем топливные стержни: “Part 7: Bitter Wormwood,” Chernobyl Witness: A Primary Source Compendium of 26 April 1986 (blog), May 9, 2021, chernobylcritical.blogspot.com; International Nuclear Safety Advisory Group, “The Chernobyl Accident: Updating of INSAG-1,” Safety Series (International Atomic Energy Agency, 1992), p. 43, pub.iaea.org.
10. минимум в пятнадцать: World Nuclear Association, “Sequence of Events—Chernobyl Accident Appendix 1,” January 2, 2025, world-nuclear.org; “Chernobyl: Assessment of Radiological and Health Impacts (2002),” Nuclear Energy Agency (NEA), 2002, oecd-nea.org/jcms/pl_13598.
На самом деле всё несколько сложнее, чем простое жесткое требование о минимум пятнадцати регулирующих стержнях. В руководстве речь идет о минимальном «оперативном запасе реактивности» (ОЗР). ОЗР измеряется в «регулирующих стержнях», но из-за других факторов не всегда равен числу фактически задействованных стержней. Стержни, оставшиеся в реакторе в момент взрыва, соответствовали ОЗР в восемь стержней, что значительно ниже минимально допустимого ОЗР в пятнадцать стержней.
11. не могут быть решены: Schneier, Secrets and Lies: Digital Security in a Networked World; Gutmann, “Unsolvable Problems in Computer Security.”
12. верхняя часть реактора: Bertrand Mercier et al., “A Simplified Analysis of the Chernobyl Accident,” EPJ Nuclear Sciences & Technologies 7 (January 1, 2021): 1, doi.org/10.1051/epjn/2020021.
CHAPTER 11: AN ALCHEMY, NOT A SCIENCE
1. кисточки с радиевой краской: Bert M. Coursey, “The National Bureau of Standards and the Radium Dial Painters,” Journal of Research of the National Institute of Standards and Technology 126 (February 14, 2022), doi.org/10.6028/jres.126.051.
2. наиболее подробные анализы: Ben Pace, “Debate on Instrumental Convergence between LeCun, Russell, Bengio, Zador, and More,” LessWrong, October 3, 2019, lesswrong.com.
Лекун также однажды обсуждал проблему инструментальной конвергенции в комментариях к публичной ветке на Facebook в 2019 году.
3. TruthGPT: “Elon Musk FULL INTERVIEW with Tucker Carlson (MUST WATCH),” April 23, 2023, 13:25, youtube.com.
4. Успокойтесь: Ян Лекун, “Calm down. Human-level AI isn’t here yet,” Twitter/X, March 19, 2023.
5. конструировать их желания: Ян Лекун, “Because they would have no desire to do anything else,” Twitter/X, March 20, 2023.
6. доброжелательный защитный ИИ: Ян Лекун, “No. My benevolent defensive AI will be better…,” Twitter/X, March 20, 2023.
7. сверхинтеллектуальным и послушным: Ян Лекун, “We can design AI systems to be both superintelligent and submissive to humans,” Twitter/X, May 4, 2023.
8. Дартмутское предложение: Маккарти и др., “A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence,” August 31, 1955, jmc.stanford.edu.
9. все равно взрываются: Стивен Даулинг, “What Are the Odds of a Successful Space Launch?,” May 31, 2023, BBC, bbc.com; Т. Х. Ананд Рао, “A Season Marred by Setbacks in Space Missions,” Centre for Air Power Studies, July 25, 2024, capsindia.org.
В ракетостроении существует эмпирическое правило: вероятность взрыва при первом или втором запуске ракеты нового типа составляет около 30 процентов. Даже проверенные конструкции ракет регулярно взрываются. Исторический средний показатель превышает 8 процентов (хотя в последние пару десятилетий он ближе к 6 процентам). Даже пилотируемые полеты имеют историческую частоту отказов выше 1 процента (около 0,79 процента за последние пару десятилетий).
10. от 10 до 20 процентов: Марк Доман и Бенджамин Свин, “AI’s Dark In-joke,” ABC News, July 14, 2023, abc.net.au; METR (Model Evaluation & Threat Research), “Q&A with Geoffrey Hinton,” June 27, 2024, 38:07, youtube.com.
В ходе ответов на вопросы Хинтон, судя по всему, был неверно информирован об уверенности Юдковского в неизбежности катастрофы, оценив её в 99,999 процента. Хотя мы, авторы, считаем катастрофу наиболее вероятным исходом по умолчанию, «пять девяток» — это абсурдный уровень уверенности, который ни один из нас не разделяет.
11. равные шансы: Доман и Свин, “AI’s Dark In-joke.”
12. из скромности: METR, “Q&A with Geoffrey Hinton,” 38:07.
13. уволены или ушли в отставку: “Nearly Half of OpenAI’s AGI Safety Researchers Resign Amid Growing Focus on Commercial Product Development,” Benzinga, August 28, 2024, benzinga.com; Шэрон Голдман, “Exodus at OpenAI: Nearly half of AGI Safety Staffers Have Left, Says Former Researcher,” Fortune, August 28, 2024, fortune.com; Шакил Хашим, “OpenAI Employee Says He Was Fired for Raising Security Concerns to Board,” Transformer (блог), June 4, 2024, transformernews.ai; Рейчел Метц и Ширин Гаффари, “OpenAI Dissolves High-Profile Safety Team after Chief Scientist Sutskever’s Exit,” Bloomberg, May 17, 2024, bloomberg.com; Сигал Сэмюэл, “‘I Lost Trust’: Why the OpenAI Team in Charge of Safeguarding Humanity Imploded,” Vox, May 18, 2024, vox.com.
Леопольд Ашенбреннер и Павел Измайлов были предположительно уволены за утечку данных компании; Ашенбреннер утверждает, что его уволили за то, что он выражал опасения по поводу безопасности. Руководители команд Ян Лейке и Илья Суцкевер ушли в отставку, так же как и Уильям Сондерс, Райан Лоу, Ян Хендрик Кирхнер, Коллин Бернс, Джеффри Ву, Джонатан Уэсато, Стивен Биллс, Юрий Бурда, Тодор Марков и сооснователь Джон Шульман. По состоянию на начало 2025 года Лео Гао и Боуэн Бейкер всё еще работали в OpenAI, но команда супервыравнивания была распущена.
14. конкурирующую ИИ-компанию: Хейзлтон и Госвами, “OpenAI co-founder Ilya Sutskever Announces His new AI Startup, Safe Superintelligence.”
15. конкурирующую компанию Anthropic: Кайли Робисон, “OpenAI Researcher Who Resigned over Safety Concerns Joins Anthropic,” The Verge, May 28, 2024, theverge.com.
16. алхимики древности: Джабир ибн Хайян, Kitāb al-Aḥjār ’alá Ra’y Balīnās, VIII–IX века, пер. Сайеда Номанула Хака в “A Critical Study of Jābir ibn Ḥayyān’s Kitāb al-Aḥjār ’alá Ra’y Balīnās,” диссертация (Университетский колледж Лондона, 1990), discovery.ucl.ac.uk.
Джабир ибн Хайян, известный как отец арабской химии, был алхимиком (или группой алхимиков), который добился успехов в очистке металлов. По поводу превращения свинца в золото Джабир писал:
Что касается превращения тел из одного состояния в другое, высшее или низшее, то, согласно нашему учению, оно представляет собой [взаимообмен между] внешним и внутренним, ибо в действительности внешнее и внутреннее именно этим и являются. Причина в том, что все составляющие всех вещей следуют круговому циклу изменений.
Внешнее в теле явно, тогда как внутреннее скрыто, и именно в последнем заключается благо. Например, свинец внешне — это зловонный свинец, и это очевидно всем людям. Но внутри него — золото, и оно скрыто. Однако, если извлечь это последнее наружу, то явятся и внутреннее, и внешнее свинца.
ГЛАВА 12. «Я НЕ ХОЧУ БЫТЬ АЛАРМИСТОМ»
1. General Motors: Алан П. Лоэб, “Birth of the Kettering Doctrine: Fordism, Sloanism and the Discovery of Tetraethyl Lead,” Business and Economic History 24, no. 1 (1995): 72–87, jstor.org/stable/23703273.
2. мощность и надежность: Джейми Линкольн Китман, “The Secret History of Lead,” The Nation, March 2, 2000, thenation.com; Редакция HOT ROD, “Living with Unleaded: Here’s How Your Classic Musclecar or High-Perf Street Machine Can Safely Kick the Habit,” Hot Rod, March 1987, hotrod.com.
Этанол был, пожалуй, самой перспективной альтернативной добавкой, но двигателям, использующим альтернативы свинцу, требовались закаленные клапаны и седла клапанов.
3. повреждение мозга: Майкл Дж. Макфарланд, Мэтт Э. Хауэр и Аарон Рубен, “Half of US Population Exposed to Adverse Lead Levels in Early Childhood,” Proceedings of the National Academy of Sciences 119, no. 11 (March 7, 2022), doi.org/10.1073/pnas.2118631119.
4. метаанализ: Энтони Хигни, Ник Хэнли и Мирко Моро, “The Lead-Crime Hypothesis: A Meta-analysis,” Regional Science and Urban Economics 97 (2022), doi.org/10.1016/j.regsciurbeco.2022.103826.
5. отраслевая пропаганда: Алан П. Лоэб, “Paradigms Lost: A Case Study Analysis of Models of Corporate Responsibility for the Environment,” Business and Economic History 28, no. 2, Winter 1999, jstor.org/stable/23703323; Уильям Коварик, “ETHYL: The 1920s Conflict over Leaded Gasoline and Alternative Fuels” (доклад, представленный на ежегодной конференции Американского общества экологической истории, Провиденс, Род-Айленд, 26–30 марта 2003 г.).
6. долгий отпуск: Билл Коварик, “Charles F. Kettering and the 1921 Discovery of Tetraethyl Lead,” International Fuels & Lubricants Meeting & Exposition, October 1, 1994, revised in 1999, environmentalhistory.org.
7. пиар-акции: Фрэнк Т. Эдельманн, “The Life and Legacy of Thomas Midgley Jr.,” Papers and Proceedings of the Royal Society of Tasmania 150, no. 1 (January 2016): 45–49, dx.doi.org/10.26749/rstpp.150.1.45.
8. фреон: Эдельманн, “The Life and Legacy of Thomas Midgley Jr.”
9. взяться за ум: Тоби Орд, The Precipice (Grand Central Publishing, 2021), 168.
Действительно, мои оценки выше учитывают вероятность того, что мы возьмемся за ум и начнем относиться к этим рискам со всей серьезностью. Будущие риски часто оцениваются исходя из допущения, что «все пойдет как обычно»: то есть что наш уровень обеспокоенности и ресурсы, выделяемые на борьбу с рисками, останутся такими же, как сегодня. Если бы я исходил из сценария «все пойдет как обычно», мои оценки рисков были бы существенно выше.
10. как минимум 10 процентов: John Thornhill, “How Fatalistic Should We Be on AI?,” Financial Times, February 22, 2024, ft.com.
11. кто считает, что меньше: METR, “Q&A with Geoffrey Hinton,” 38:07.
12. Риши Сунак: Rishi Sunak, “Prime Minister’s Speech on AI: 26 October 2023” (United Kingdom of Great Britain and Northern Ireland, October 26, 2023), gov.uk.
13. не мог взорваться: Plokhy, Chernobyl: The History of a Nuclear Catastrophe.
14. отказывались садиться: Titanic Inquiry Project, “British Wreck Commissioner’s Inquiry | Day 6 | Testimony of Charles Joughin (Chief Baker, SS Titanic),” May 10, 1912, titanicinquiry.org.
Шеф-пекарь судна описывал, как трудно было найти женщин и детей, готовых сесть в спасательные шлюпки, и как он и другие мужчины силой затаскивали некоторых из них, чтобы заполнить шлюпку.
15. корабль непотопляем: Encyclopedia Titanica, “Elizabeth Weed Shutes: Titanic Survivor,” February 1, 2018, encyclopedia-titanica.org.
16. пора уходить: Уолтер Лорд, A Night to Remember (Penguin Books, 1976), 132.
17. один из пяти: Katherine Tangalakis-Lippert, “Elon Musk Says There Could Be a 20% Chance AI Destroys Humanity—but We Should Do It Anyway,” Business Insider, March 31, 2024, businessinsider.com; The Logan Bartlett Show, “Anthropic CEO on Leaving OpenAI and Predictions for Future of AI,” October 6, 2023, 1:38:35, youtube.com.
18. отрицали расплавление реактора в Чернобыле: Plokhy, Chernobyl: The History of a Nuclear Catastrophe.
19. покинул свой пост: Geoffrey Hinton, “In the NYT today, Cade Metz implies that I left Google so that I could criticize Google. Actually, I left so that I could talk about the dangers of AI without considering how this impacts Google. Google has acted very responsibly,” X, May 1, 2023, x.com.
20. сотни лет: Caleb Garling, “Andrew Ng: Why ‘Deep Learning’ Is a Mandate for Humans, Not Just Machines,” Wired, May 5, 2015, accessed March 15, 2025, via web.archive.org.
21. аналитики заявили: Ajeya Cotra, “Draft Report on AI Timelines,” Alignment Forum, September 18, 2020, alignmentforum.org.
22. от одного до девяти лет: Sam Altman, “The Intelligence Age,” September 23, 2024, ia.samaltman.com; Alex Hern, “Elon Musk Predicts Superhuman AI Will Be Smarter Than People Next Year,” The Guardian, April 9, 2024, theguardian.com; Amodei, “Machines of Loving Grace.”
23. как минимум от пяти до десяти: Ян Лекун, “I said that reaching Human-Level AI ‘will take several years if not a decade,’” X, October 16, 2024.
24. переломный момент: CNBC Television, “Anthropic CEO: More confident than ever that we’re ‘very close’ to powerful AI capabilities,” January 21, 2025, 2:05, youtube.com; Hern, “Elon Musk Predicts Superhuman AI Will Be Smarter Than People Next Year;” Lessley Anderson, “Elon Musk: A Machine Tasked with Getting Rid of Spam Could End Humanity,” Vanity Fair, October 8, 2014.
Генеральный директор xAI предсказал появление ИИ, который будет «умнее любого человека», к концу 2025 года. Генеральный директор Anthropic спрогнозировал, что ИИ превзойдет «почти всех людей почти во всех задачах» примерно к 2027 или 2028 году. Оба руководителя независимо друг от друга признали, что возможности автоматизации научных исследований способны спровоцировать интеллектуальный взрыв.
25. ЦЕРН: John Werner, “AI Superpowers & Global Treaties,” Forbes, February 19, 2025, forbes.com.
ГЛАВА 13. ВЫКЛЮЧИТЕ ЕГО
1. содействовать, верифицировать и обеспечивать соблюдение: Aaron Scher, “Mechanisms to Verify International Agreements about AI Development,” MIRI Technical Governance Team, December 2, 2024, techgov.intelligence.org.
2. распространение оружия: United Nations Office for Disarmament Affairs, “Treaty on the Non-Proliferation of Nuclear Weapons (NPT),” accessed March 15, 2025, disarmament.unoda.org/wmd/nuclear/npt.
3. союзные державы: Ken Burns, “War Production,” The War | PBS, May 21, 2021, pbs.org; “WWII: Mobilization by Country 1937–1945,” Statista, August 9, 2024, statista.com; “WWII: Annual Tank and Self-propelled Gun Production 1939–1945, by Country,” Statista, August 6, 2024, statista.com; “WWII: Annual Production of Major Naval Vessels 1939–1945, by Country,” Statista, August 6, 2024, statista.com.
4. 341 миллиард долларов: Kenny Chmielewski, “Casualties of World War II | Statistics, by Country, & Total,” Encyclopaedia Britannica, August 31, 2023, britannica .com.
5. запрет дипфейков: Ben Cumming, “US House of Representatives Call for Legal Liability on Deepfakes,” Future of Life Institute, October 16, 2024, futureoflife.org; “Ban Deepfakes,” n.d., bandeepfakes.org.
6. Они преуменьшают: Некоторые исключения из этой тенденции составляют организации, призывающие к мораторию, такие как ControlAI, PauseAI и StopAI.
7. предоставлять ежегодные отчеты: “SB-1047 Safe and Secure Innovation for Frontier Artificial Intelligence Models Act,” accessed March 15, 2025, leginfo .legislature.ca.gov.
ГЛАВА 14. ПОКА ЕСТЬ ЖИЗНЬ — ЕСТЬ НАДЕЖДА
1. Великобритания: ControlAI, “Campaign Statement,” February 6, 2025, controlai.com/statement.
Сунак — не единственный британский политик, который обратил на это внимание. По состоянию на начало 2025 года десятки британских парламентариев подписали заявление, в котором говорится: «Суперинтеллектуальные системы ИИ поставят под угрозу национальную и глобальную безопасность».
2. Си Цзиньпин: “Global AI Governance Initiative—The Third Belt and Road Forum for International Cooperation,” People’s Daily Online, n.d., beltandroadforum.org.
3. эти и другие сигналы: “Japan PM Vows to Lead Setting Up Int’l AI Rules through New Framework,” Kyodo News+, May 3, 2024, english .kyodonews.net; Alexandra Alper, “UN Adopts First Global Artificial Intelligence Resolution,” Reuters, March 21, 2024, reuters.com; John T. Bennett, “Biden Warns about AI’s ‘Risks,’ Forces of ‘Retreat’ in Final UN Address,” Roll Call, September 24, 2024, rollcall.com; “Chinese Vice Premier Ding Xuexiang at World Economic Forum,” C-SPAN, January 21, 2025, 38:01, c-span.org.
В 2023 году страны «Большой семерки» запустили Хиросимский процесс по ИИ — первую в мире международную рамочную программу по ИИ. В развитие этой инициативы в мае 2024 года премьер-министр Японии Фумио Кисида заявил:
Давайте сотрудничать как нации, объединенные общей целью, чтобы использовать всеобщие возможности и противостоять глобальным рискам, которые несет с собой ИИ, и работать над созданием безопасного, защищенного и надежного ИИ.
Первая (не имеющая обязательной силы) резолюция ООН была принята в марте 2024 года. Посол США в ООН Линда Томас-Гринфилд высоко оценила ее:
Сегодня все 193 члена Генеральной Ассамблеи ООН высказались в один голос и сообща решили управлять искусственным интеллектом, а не позволять ему управлять нами.
В сентябре 2024 года в своем последнем обращении к Организации Объединенных Наций президент Байден говорил о международном сотрудничестве в области ИИ:
Во-первых, как нам, как международному сообществу, управлять ИИ в условиях, когда страны и компании мчатся к неизведанным рубежам? Нам нужны столь же безотлагательные усилия для обеспечения безопасности, защищенности и надежности ИИ.
На Всемирном экономическом форуме в январе 2025 года вице-премьер Китая Дин Сюэсян заявил:
Если мы позволим этой безрассудной конкуренции между странами продолжаться, то столкнемся с «серым носорогом» — и что нам тогда делать? Думаю, нам нужно обратиться к истории. Например, к нашим урокам по управлению рисками: ядерными, биологическими и рисками в сфере безопасности.[…] Мы готовы в рамках Организации Объединенных Наций и ее ключевых институтов активно участвовать, привлекая все соответствующие международные организации и все страны к обсуждению разработки строгих правил, призванных гарантировать, что технология ИИ станет «сокровищницей Али-Бабы», а не «ящиком Пандоры».
«Серый носорог» — это тип риска, противопоставляемый «черному лебедю». «Черный лебедь» — это маловероятное событие с масштабными последствиями. «Серый носорог» — это высоковероятное событие с масштабными последствиями, которое люди, однако, склонны игнорировать или недооценивать.
4. Опрос 2025 года: Билли Перриго, «Эксклюзив: общественность Великобритании требует более строгих правил регулирования ИИ, чем её правительство», TIME, 6 февраля 2025 года, time.com.
5. Опрос 2023 года: «Подавляющее большинство избирателей считают, что технологические компании должны нести ответственность за ущерб, причиняемый моделями ИИ, выступают за ограничение распространения ИИ и закон, требующий раскрывать использование ИИ в политической рекламе», AI Policy Institute (блог), 23 сентября 2023 года, theaipi.org.
См. основные результаты и перекрестные таблицы по ссылкам в разделе «Об опросе».