Заместитель директора фундаментальной библиотеки имени императрицы Марии Федоровны РГПУ им. А. И. Герцена Светлана Морозова представила результаты нового исследования библиографических конфабуляций — правдоподобных, но несуществующих ссылок, которые генеративные модели искусственного интеллекта создают для академических текстов и которые затем попадают в опубликованные научные работы. По ее данным, ни автоматические сервисы, ни большие языковые модели пока не обеспечивают стопроцентной точности и не могут полностью заменить профессионального библиотекаря-верификатора.
«Конфабуляция — это не ошибка или опечатка. Она возникает в результате взаимодействия пользователя с генеративной моделью, когда запрос, вероятностная генерация и отсутствие последующей проверки совместно производят правдоподобный, но не существующий библиографический объект, — пояснила Светлана Морозова. — Термин пришел из медицины: человек заполняет пробелы в памяти данными, которые кажутся ему абсолютно достоверными, без намерения обмануть. Так и модель комбинирует реальные элементы: фамилии авторов, фрагменты заглавий, журналы, годы выпуска, диапазоны страниц с выдуманными».
В рамках проекта «ИИллюзИИ и галлюцитирования» исследователи проанализировали 54 статьи из рецензируемых журналов и сборников, индексируемых в eLibrary.ru. В списках литературы этих работ зафиксирована 691 библиографическая позиция, из которых 306, или 44,3%, были признаны доказанно конфабулированными. Среди них — 96 книжных изданий и 210 статей. Исследование выявило устойчивые признаки таких ссылок: отсутствие электронных идентификаторов и минимальное указание интернет-ссылок, упоминание только статей из журналов без сборников, материалов конференций или глав из книг, использование двоеточия в 40% заглавий по схеме «общая научная рамка: уточнение». Прослеживается и шаблонность объемов. Современный тренд — смешение и комбинирование реальных авторов и реальных периодических изданий с достоверными сочетаниями года, тома, номера и общего числа страниц, что в сумме дает несуществующую ссылку.
Проверка 306 подтвержденных ложных ссылок проводилась с помощью сервисов «Идентификация библиографических записей» на платформе eLibrary.ru, CiteSure, Citely, GPTZero и Crossref, а также больших языковых моделей ChatGPT, Perplexity, DeepSeek и «ГигаЧат». Ни один из инструментов не дал стопроцентного совпадения с выводами библиотекаря-верификатора.
«Автоматическая детекция может быть полезным этапом, но не заменяет профессионального суждения о достоверности, контексте и последствиях распространения ложной библиографической информации, — подчеркнула Светлана Морозова. — Библиотекарю необходимо переходить от обсуждения проблемы конфабуляций к внедрению регулярных практик верификации, консультирования и обучения пользователей. Библиотеки могут взять на себя не только экспертную проверку библиографических описаний, но и разработку регламентов и методик, сочетающих ручную верификацию с автоматическими инструментами».
По словам эксперта, сегодня только специалист-верификатор может проследить цепочку распространения конфабуляций в последующих публикациях. В зарубежном публикационном поле такие «цепи» фиксируются с первой половины 2023 года, в российском — с конца 2024 года, в основном с 2025 года. В рамках проекта «ИИллюзИИ и галлюцитирования» ранее были подготовлены данные для сервиса, выявляющего сгенерированные списки литературы. Он внедрен в систему идентификации ссылок Российского индекса научного цитирования. Эти наработки использованы системами распознавания плагиата. Разработки герценовских экспертов представлены руководителям подразделений вуза, редколлегиям журналов, а также на международных и всероссийских мероприятиях.