Хотя эмерджентные способности были задокументированы в нескольких исследованиях, в сообществе машинного обучения пока нет единого мнения по этому вопросу. Команда ученых-информатиков из Стэнфордского университета утверждает, что эти так называемые эмерджентные способности проявляются не столько из-за неких качественных изменений в поведении моделей при достижении определенных размеров, сколько из-за методов, которыми исследователи оценивают модели2. В частности, резкое повышение качества работы в некоторых задачах, приписываемое эмерджентности, может быть, по крайней мере частично, обусловлено выбором показателя оценки качества, объемом тестовых данных, используемых для оценки (поскольку тестирование на меньшем количестве данных даст более искаженную оценку), а также количеством больших моделей, которые подвергаются оценке (поскольку больших моделей существует меньше, чем маленьких). Другими словами, авторы не оспаривают превосходство LLM во всех этих задачах, но они подвергают сомнению идею о том, что LLM в тех случаях, когда эмерджентные способности наблюдались, представляют собой фундаментальное отличие от предыдущих версий. Эмерджентное поведение зависит от выбранного показателя для оценки, и пока не ясно, какие показатели лучше, следует относиться с осторожностью к заявлениям, что при использовании более масштабных моделей, большего объема данных или изменения их типа мы можем наблюдать другие возможности.