В августе 2022 года транснациональный технологический конгломерат Meta [25], ранее известный как Facebook Inc.*, выпустил в США чат-бота BlenderBot52. Чат-бот был создан на основе модели Meta* OPT‐175B (Open Pretrained Transformer) и прошел масштабное исследование для создания механизма предотвращения генерации оскорбительных или опасных комментариев. Вскоре пользователи по всей стране стали критиковать BlenderBot за нападки на Facebook [26] (см. http://mng.bz/dd7v), распространение антисемитских теорий заговора (см. http://mng.bz/rjGe), за то, что он выдавал себя за Чингисхана или талибов (см. http://mng.bz/VRwW), и так далее.
В ноябре 2022 года была предпринята еще одна попытка: выпустили разговорный ИИ для научной работы под названием Galactica, который был обучен на 48 миллионах примеров из учебников, научных статей, веб-сайтов, конспектов лекций и энциклопедий (см. https://galactica.org/). Meta* попросила ученых опробовать эту публичную демоверсию, но уже через несколько часов люди стали публиковать галлюцинирующие или предвзятые ответы бота. Через три дня Meta* закрыла публичный доступ к боту, но для исследователей, которые хотели бы узнать больше о работе моделей, доступ остался открытым.
В следующий раз Meta* выбрала другой подход. Вместо того, чтобы запускать диалоговую систему в качестве готового продукта, компания выпустила несколько больших языковых моделей, чтобы другие исследователи могли заняться поиском решения таких проблем, как токсичность, предвзятость и галлюцинации, которыми страдают LLM. 24 февраля 2023 года Meta* публично представила серию больших языковых моделей Meta* AI, также известную как LLaMa53. Эти базовые модели были выпущены в конфигурациях с 7 миллиардами (7B), 13 миллиардами, 33 миллиардами и 65 миллиардами обучаемых параметров и снабжены подробным описанием того, как они были созданы. В своей исследовательской статье Meta* утверждает, что модель 13В, вторая наименьшая по размеру, превосходит GPT-3 по большинству критериев сравнения, а самая крупная модель с 65 миллиардами параметров конкурирует с лучшими большими языковыми моделями, такими как PaLM‐540 от Google54.
За выпуском LLaMa стояла цель – демократизировать доступ к большим языковым моделям, в частности путем выпуска компактных эффективных моделей, требующих небольших вычислительных ресурсов, поскольку тогда исследователи получат возможность изучать новые подходы и смогут найти решение для проблем, связанных с технологией. LLaMa была выпущена по некоммерческой лицензии для использования в исследовательских целях, и доступ к ней предоставлялся по запросу. Однако уже через неделю вся модель просочилась на веб-сайт 4chan и стала доступна для скачивания любому желающему55. Некоторые люди критиковали Meta [27] за чрезмерную «открытость» модели перед возможным ненадлежащим использованием, а другие утверждали, что свободный доступ к моделям – это важный шаг в создании более эффективных средств защиты. Для технологического конгломерата это стало началом скандала вокруг LLaMa.
Вскоре после этого, в марте 2023 года, исследователи из Стэнфордского университета представили чат-бота с искусственным интеллектом Alpaca, разработанного на основе модели LLaMa 7B (см. http://mng.bz/xjBg). Они выпустили веб-демонстрацию и заявили, что для тонкой настройки модели, обученной на 52 тысячах инструкций, потратили лишь 600 долларов. Всего неделю спустя исследователи из Стэнфорда удалили демонстрацию Alpaca, дополнив историю недолговечных чат-ботов Meta*. Несмотря на скромные затраты на создание демонстрации, ее хостинг обошелся недешево. У исследователей также возникли опасения по поводу галлюцинаций, безопасности, дезинформации и риска распространения вредного или токсичного контента. Их исследования и программный код доступны онлайн, что полезно для понимания вычислительных процессов и ресурсов, необходимых для разработки этой модели.
Компания Meta* выпустила 18 июля 2023 года Llama 2 – следующее поколение своей модели с открытым исходным кодом, сделав ее бесплатной для исследований и коммерческого использования. Они написали: «Мы верим, что современные большие языковые модели с открытым доступом будут также способствовать разработке полезного и более безопасного генеративного ИИ. Мы с нетерпением ждем возможности увидеть, что создаст мир с Llama 2»56.