Нейросети сужают кругозор: ответы ИИ оказались однообразнее поиска Google
Команда ученых из Ольборгского, Копенгагенского и ряда других университетов проверила 27 больших языковых моделей. Исследователи задали каждой из них 155 тем из 12 разных стран. В итоге модели сгенерировали примерно 1,7 миллиона ответов, которые содержали около 70 миллионов отдельных утверждений.
Чтобы оценить «разнообразие знаний», учёные использовали специальный метод: они разбивали ответы на отдельные утверждения, а затем с помощью эмбеддингов (векторных представлений смысла) измеряли, насколько эти утверждения семантически различны. Этот показатель назвали эпистемическим разнообразием. В качестве эталона взяли обычный веб-поиск: для каждой темы собрали до 40 страниц из Google.
В итоге ученые выяснили, что ни одна из протестированных моделей не достигла уровня разнообразия, который показывает базовый веб-поиск. Даже самая «разнообразная» модель уступала поисковику. В качестве примера приводят GPT-5: она выдавала как минимум на 18,7% менее разнообразные утверждения, чем результаты обычного Google-поиска по тем же темам.
При этом исследователи заметили и позитивный тренд: в большинстве серий моделей (кроме Qwen) с выходом новых версий разнообразие ответов действительно росло. То есть прогресс есть, но до уровня веб-поиска пока далеко.
Ещё один интересный нюанс: иногда более мелкие модели показывали чуть большее разнообразие, чем их крупные «собратья». А использование подхода retrieval-augmented generation (когда модель дополнительно подтягивает внешние данные) тоже помогало увеличить разнообразие.
Учёные не утверждают, что «коллапс знаний» уже произошёл. Но они выделяют потенциальный риск на перспективу: если люди всё чаще будут брать информацию именно из ИИ-чатов, общество может начать повторять ограниченный набор объяснений, которые модели склонны выдавать.
Есть и другой механизм: если однородные тексты, сгенерированные ИИ, станут массово использоваться как данные для обучения следующих поколений моделей или для RAG-систем, это может ещё сильнее сузить спектр информации, которую в итоге будут выдавать пользователи.
Ссылка на исследование:
https://arxiv.org/abs/2510.04226
Команда ученых из Ольборгского, Копенгагенского и ряда других университетов проверила 27 больших языковых моделей. Исследователи задали каждой из них 155 тем из 12 разных стран. В итоге модели сгенерировали примерно 1,7 миллиона ответов, которые содержали около 70 миллионов отдельных утверждений.
Чтобы оценить «разнообразие знаний», учёные использовали специальный метод: они разбивали ответы на отдельные утверждения, а затем с помощью эмбеддингов (векторных представлений смысла) измеряли, насколько эти утверждения семантически различны. Этот показатель назвали эпистемическим разнообразием. В качестве эталона взяли обычный веб-поиск: для каждой темы собрали до 40 страниц из Google.
В итоге ученые выяснили, что ни одна из протестированных моделей не достигла уровня разнообразия, который показывает базовый веб-поиск. Даже самая «разнообразная» модель уступала поисковику. В качестве примера приводят GPT-5: она выдавала как минимум на 18,7% менее разнообразные утверждения, чем результаты обычного Google-поиска по тем же темам.
При этом исследователи заметили и позитивный тренд: в большинстве серий моделей (кроме Qwen) с выходом новых версий разнообразие ответов действительно росло. То есть прогресс есть, но до уровня веб-поиска пока далеко.
Ещё один интересный нюанс: иногда более мелкие модели показывали чуть большее разнообразие, чем их крупные «собратья». А использование подхода retrieval-augmented generation (когда модель дополнительно подтягивает внешние данные) тоже помогало увеличить разнообразие.
Учёные не утверждают, что «коллапс знаний» уже произошёл. Но они выделяют потенциальный риск на перспективу: если люди всё чаще будут брать информацию именно из ИИ-чатов, общество может начать повторять ограниченный набор объяснений, которые модели склонны выдавать.
Есть и другой механизм: если однородные тексты, сгенерированные ИИ, станут массово использоваться как данные для обучения следующих поколений моделей или для RAG-систем, это может ещё сильнее сузить спектр информации, которую в итоге будут выдавать пользователи.
Ссылка на исследование:
https://arxiv.org/abs/2510.04226
What and Whose Knowledge? Measuring Epistemic Diversity in Large Language Models
Large language models (LLMs) are increasingly used as primary knowledge sources, yet their epistemic diversity - defined as the diversity of real-world claims in their outp...
arXiv.org