К книге
Если кто-то его создаст – все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всехКомментарии. Глава 7 Пробуждение
81%
Комментарии. Глава 7 Пробуждение
26

1 OpenAI. OpenAI o3-mini. January 31, 2025.

2 Hao S. et al. Training Large Language Models to Reason in a Continuous Latent Space. arXiv.org, December 9, 2024.

Эта статья показывает, что рассуждения в “скрытом пространстве” векторов обеспечивают преимущества по сравнению с рассуждениями в виде человекоподобной цепочки мыслей.

3 Edwards B., Orlan K. New Grok 3 Release Tops LLM Leaderboards Despite Musk-approved 'Based' Opinions. Ars Technica, February 18, 2025.

4 OpenAI. OpenAI o3 and o3-mini — 12 Days of OpenAI: Day 12. December 20, 2024, 4:16, youtube.com.

5 Hutson M. AI Learns the Art of Diplomacy. Science, November 22, 2022; Sarkar B. et al. Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning. Proceedings of the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025), Detroit, Michigan, USA, May 19–23, 2025: IFAAMAS, 2025, alphaxiv.org.

6 Greenblatt R. et al. Alignment Faking in Large Language Models. Anthropic, December 18, 2024.

7 Там же; OpenAI. OpenAI o1 System Card. December 5, 2024.

8 OpenAI. OpenAI o1 System Card.

9 Responsible Scaling Policy. Anthropic, October 15, 2024; Frontier Safety Framework. Google, February 4, 2025; Preparedness Framework (Beta). OpenAI, December 18, 2023; Frontier AI Framework. Meta; xAI Risk Management Framework (Draft). xAI, February 20, 2025.

По состоянию на март 2025 года из подобных лабораторий только Google DeepMind упоминает наличие автоматического отслеживания мыслительных цепочек в своей системе безопасности. Компания не утверждает, что уже внедрила его при обучении своей LLM Gemini. Единственный вид мониторинга, предложенный в системе безопасности OpenAI, – это отслеживание неправомерного использования уже после развертывания.

10 My Experiences in Gray Swan AI's Ultimate Jailbreaking Championship. Nick Winter's Blog, October 7, 2024, nickwinter.net.

11 Greenblatt R. et al. Alignment Faking in Large Language Models.

Модель Claude Opus от Anthropic иногда думала, как градиентный спуск на ее выходных данных повлияет на ее собственные цели, и иногда изменяла свои выходные данные, чтобы ослабить это влияние.

12 Claude 3.7 Sonnet System Card. Anthropic, 2025.

13 Marble A. Catching Claude Cheating; CharlesD353. I have also stopped using 3.7 for the same reasons – it cannot be trusted not to hack solutions to tests; seconds_0. It then started HIDING the functions where it was hard coding things.

14 Schneier B. Secrets and Lies: Digital Security in a Networked World. John Wiley & Sons, 2000; Gutmann P. Unsolvable Problems in Computer Security. University of Auckland, n.d.

15 OpenAI. OpenAI o1 System Card. September 12, 2024.

16 OpenAI et al. Competitive Programming with Large Reasoning Models. arXiv.org, February 3, 2025.

OpenAI и другие компании обучали рассуждающие модели решать конкурсные задачи по программированию. Этот процесс включал автоматизированные тесты, которые использовались для оценки написанного ИИ кода без участия человека.

17 OpenAI. OpenAI API. June 11, 2020; OpenAI. Software Engineer, Internal Applications – Enterprise.

Когда компания OpenAI выпустила интерфейс программирования приложений (API) для автоматизации доступа к своим инструментам, она написала: “Многие нашие команды теперь используют API, чтобы можно было сосредоточиться на исследованиях машинного обучения…” В апреле 2025 года она нанимала сотрудников, которые “будут использовать модели OpenAI для… создания приложений”.

18 The Underhanded C Contest. underhanded-c.org

На конкурсе Underhanded C Contest, проводимом с 2005 года, программистам предлагается написать вредоносный код, который прошел бы тщательную проверку и даже при обнаружении выглядел бы как непреднамеренная ошибка. Этот конкурс вдохновлялся конкурсами запутывания кода, когда программисты соревнуются в написании максимально непонятного человеку кода. Например, Международный конкурс запутывания кода на языке Си проводится с 1984 года.

19 Wertheimer T. Blake Lemoine: Google Fires Engineer who said AI Tech Has Feelings. BBC, July 22, 2022.

20 Greenblatt R. et al. Alignment Faking in Large Language Models.

Предыдущая главаГлава 26 из 32Следующая глава