Preview

Информатика

Расширенный поиск

Трехвекторный алгоритм обнаружения русскоязычных нейросетевых текстовых фрагментов на основе вероятностного анализа

https://doi.org/10.37661/1/1816-0301-2026-23-3-76-91

Аннотация

Цели. Целями работы являются разработка и программная реализация трехвекторного алгоритма обнаружения русскоязычных нейросетевых текстовых фрагментов на основе вероятностного анализа. Объект исследования русскоязычные тексты, предмет статистические признаки их происхождения. Особое внимание уделяется количественному сравнению предложенного подхода с базовыми одновекторными методами обнаружения детектором на основе перплексии и методом рангового анализа GLTR.

Методы. Предложенный алгоритм объединяет три вектора признаков: предсказуемость токенов, долю редких лексем и информационную плотность текста, оцениваемую через коэффициент алгоритмического сжатия. В качестве вероятностного ядра использована авторегрессионная языковая модель rugpt3small. Реализация выполнена на языке Python с применением библиотек transformers, PyTorch, NLTK и zlib. Экспериментальная проверка проводилась на выборке из 100 смешанных документов (16 000 предложений) пяти тематических групп, нейросетевые фрагменты которых сгенерированы четырьмя языковыми моделями: DeepSeek, GPT, Qwen и YandexAI. Качество оценивалось по отклонению от эталонной доли нейросетевого текста и классификационным метрикам.

Результаты. После применения калибровочной поправки средний индекс по выборке составил 45,2 балла при эталонном уровне 50, а значения для всех четырех моделей находились в узком диапазоне 44,4–45,9 балла, что свидетельствует об устойчивости алгоритма к выбору генеративной модели. Отклонение среднего индекса от эталона составило 4,8 балла против 11,1 балла у метода на основе перплексии и 7,6 балла у GLTR; F1-мера на уровне предложений достигла 0,76 против 0,63 и 0,66 соответственно.

Заключение. Трехвекторный алгоритм подтвердил свою эффективность в задаче обнаружения нейросетевых фрагментов и может служить основой для инструментов проверки академических текстов и систем антиплагиата. Дальнейшее развитие исследования связано с расширением выборки, проверкой устойчивости к перефразированию и редактированию, а также проведением абляционного анализа.

Об авторах

К. С. Крез
Белорусский государственный университет информатики и радиоэлектроники
Беларусь

Крез Карина Сергеевна , аспирант, ассистент кафедры проектирования информационно-компьютерных систем

ул. П. Бровки, 6, Минск, 220013



Е. Н. Шнейдеров
Белорусский государственный университет информатики и радиоэлектроники
Беларусь

Шнейдеров Евгений Николаевич , кандидат технических наук, доцент, доцент кафедры проектирования информационно-компьютерных систем, проректор по учебной работе

ул. П. Бровки, 6, Минск, 220013



И. П. Галяк
Белорусский государственный университет информатики и радиоэлектроники
Беларусь

Галяк Иван Павлович , студент кафедры проектирования информационно-компьютерных систем

ул. П. Бровки, 6, Минск, 220013



Д. Д. Ефименко
Белорусский государственный университет информатики и радиоэлектроники

Ефименко Даниил Дмитриевич , студент кафедры проектирования информационно-компьютерных систем

ул. П. Бровки, 6, Минск, 220013



Список литературы

1. Ивахненко, Е. Н. ChatGPT в высшем образовании и науке: угроза или ценный ресурс? / Е. Н. Ивахненко, В. С. Никольский // Высшее образование в России. – 2023. – Т. 32, № 4. – С. 9–22.

2. Федотова, А. М. Методика идентификации текстов, сгенерированных большими языковыми моделями / А. М. Федотова, А. С. Романов // Информатика и автоматизация. – 2025. – Т. 24, № 5. – С. 1444–1470.

3. Мачковская, Л. Я. Генеративные модели искусственного интеллекта в преподавании русского языка как иностранного: возможности, ограничения и риски / Л. Я. Мачковская, А. В. Фатина, О. А. Ветошкина // Международный журнал гуманитарных и естественных наук. – 2025. – № 11-1. – С. 73–78.

4. Айдагулова, А. Р. Особенности текстов, сгенерированных искусственным интеллектом / А. Р. Айдагулова // Вестник Башкирского государственного педагогического университета им. М. Акмуллы. – 2023. – № 4 (72). – С. 154–156.

5. Брызгалина, Е. В. Вызовы технологий искусственного интеллекта для этической экспертизы исследований живых систем / Е. В. Брызгалина // Теоретическая и прикладная этика: традиции и перспективы : материалы XVI Междунар. конф., Санкт-Петербург, 16–18 нояб. 2023 г. – СПб. : Изд-во С.-Петерб. гос. ун-та, 2024. – С. 57–58.

6. Вейс, И. А. Распознавание паттернов применения искусственного интеллекта при создании текстов / И. А. Вейс // Современные инновации, системы и технологии. – 2025. – Т. 5, № 1. – С. 1033–1040.

7. Василевская, А. В. ИИ в количественном исследовании: проверка устойчивости к манипуляциям и искажениям фактов / А. В. Василевская // Теоретическая и прикладная этика: традиции и перспективы : материалы XVI Междунар. конф., Санкт-Петербург, 16–18 нояб. 2023 г. – СПб. : Изд-во С.-Петерб. гос. ун-та, 2024. – С. 67–68.

8. Никитина, А. С. Человек или AI: к вопросу об авторстве / А. С. Никитина // Вестник молодых ученых и специалистов Самарского университета. – 2024. – № 1 (24). – С. 182–186.

9. Gehrmann, S. GLTR: Statistical detection and visualization of generated text / S. Gehrmann, H. Strobelt, A. M. Rush // Proc. of the 57th Annual Meeting of the Association for Computational Linguistics: System Demonstrations, Florence, Italy, 28 July – 2 Aug. 2019. – Florence, 2019. – P. 111–116.

10. DetectGPT: Zero-shot machine-generated text detection using probability curvature / E. Mitchell, Y. Lee, A. Khazatsky [et al.] // Proc. of the 40th Intern. Conf. on Machine Learning (ICML 2023), Honolulu, Hawaii, USA, 23–29 July 2023. – Honolulu, 2023. – P. 24950–24962.

11. Watermark for large language models / J. Kirchenbauer, J. Geiping, Y. Wen [et al.] // Proc. of the 40th Intern. Conf. on Machine Learning (ICML 2023), Honolulu, Hawaii, USA, 23–29 July 2023. – Honolulu, 2023. – P. 17061–17084.


Рецензия

Для цитирования:


Крез К.С., Шнейдеров Е.Н., Галяк И.П., Ефименко Д.Д. Трехвекторный алгоритм обнаружения русскоязычных нейросетевых текстовых фрагментов на основе вероятностного анализа. Информатика. 2026;23(3):76-91. https://doi.org/10.37661/1/1816-0301-2026-23-3-76-91

For citation:


Krez K.S., Shneiderov Y.N., Galyak I.P., Efimenko D.D. A three-vector algorithm for detecting Russian-language neural-network-generated text fragments based on probabilistic analysis. Informatics. 2026;23(3):76-91. (In Russ.) https://doi.org/10.37661/1/1816-0301-2026-23-3-76-91

Просмотров: 10

JATS XML


Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 1816-0301 (Print)
ISSN 2617-6963 (Online)