ПРИКЛАДНЫЕ ИССЛЕДОВАНИЯ

Стилистические девиации как маркер человеческого письма: сопоставительный анализ текстов на материале корпуса CoAT

Авторы

  • Анастасия Вадимовна Медведева Санкт-Петербургский политехнический университет Петра Великого, 195251, Санкт-Петербург, Политехническая улица, 29

Как цитировать

ГОСТ Медведева А. В. Стилистические девиации как маркер человеческого письма: сопоставительный анализ текстов на материале корпуса CoAT // Управление образованием: теория и практика. 2026. Т. 16. № 4. С. 498-507. DOI: 10.25726/j2589-9037-6347-b
APA Медведева, А. В. (2026). Стилистические девиации как маркер человеческого письма: сопоставительный анализ текстов на материале корпуса CoAT. Управление образованием: теория и практика, 16(4), 498-507. https://doi.org/10.25726/j2589-9037-6347-b

Аннотация

В статье осуществляется сопоставительный лингвостилистический анализ русскоязычных текстов человеческого и машинного происхождения на материале корпуса CoAT, выступающего в качестве репрезентативного ресурса парных материалов, распределенных по новостному, энциклопедическому, сетевому, дневниковому и смешанному доменам. Центральное место отводится стилистическим девиациям, понимаемым как мотивированные отклонения от статистического стандарта, возникающие в пространстве между статистической и коммуникативной нормами и придающие высказыванию измерение индивидуально-авторской интенциональности, в противовес усредненному, вероятностно-оптимизированному письму, тяготеющему к нормативной гладкости и лишенному подлинного следа сознательного выбора. Анализ синтаксических параметров фиксирует у человеческих микротекстов большую среднюю длину предложения, составляющую 10,46 слова против 8,4 у сгенерированных, а также существенно более высокую частоту инверсий, достигающую 14% по сравнению с 4,7%, причем в неформальных жанрах, таких как дневники и социальные сети, машинные тексты демонстрируют полное отсутствие инверсивных конструкций, что указывает на принципиально различный механизм организации высказывания, обусловленный у человека коммуникативной задачей, а у модели – жесткостью жанровых шаблонов. Парцелляция, хотя и представлена близкими долями, в человеческих текстах выступает осмысленным интонационным приемом, тогда как в машинных чаще носит характер механического разрыва синтаксической конструкции. Пунктуационные характеристики выявляют сходство средних значений по тире и многоточиям при кардинально различном распределении и функциональной нагрузке: у человека эти знаки концентрируются в эмоционально-насыщенных контекстах, обеспечивая эффект паузации и смыслового акцента как проявление ответственного поступка, в то время как у машины они преимущественно воспроизводят формальные шаблоны, характерные для энциклопедических материалов, отражая отсутствие внутренней интенции и рефлексивной настройки на адресата. Особенно показательна крайне низкая воспроизводимость скобок в сгенерированных текстах, выступающих одним из наиболее тонких авторских маркеров. Лексические параметры демонстрируют наиболее выраженные расхождения по фактологической насыщенности: трехкратное преобладание чисел и дат в человеческих текстах свидетельствует о спонтанной связи письма с конкретным опытом и реальным миром, недоступной модели, оперирующей обобщенными вероятностными последовательностями и избегающей конкретики вне жанровой обязательности. Частота имен собственных обнаруживает меньшую дифференциацию, будучи в значительной степени детерминированной информационными жанрами, однако распределение по доменам дополнительно подчеркивает жанровую ограниченность машинного письма, не проявляющего фактографию вне обязательных контекстов. Полученные результаты подтверждают сущностный характер различий между текстом, рожденным сознанием, включенным в физический и социальный мир, и текстом, порожденным статистическим предсказанием следующего токена, что позволяет рассматривать стилистические девиации как перспективный маркер человеческого письма, обладающий высокой релевантностью для автоматизированных систем поиска и фильтрации информации, задач верификации контента, оценки качества генеративных моделей по критерию способности воспроизводить индивидуальную вариативность, противодействия дезинформации и развития цифровой лингвистики в целом. Качественный анализ распределения признаков по жанрам и категориям раскрывает, что количественные совпадения не отменяют фундаментального различия в природе отклонений – осознанного авторского выбора versus механической имитации, что открывает пути к созданию чувствительных типологий, адаптируемых для иных языков и жанров, и к лонгитюдному отслеживанию эволюции машинного идиостиля. Таким образом, работа предоставляет комплексное обоснование того, что формальный учет стилистических девиаций с учетом их качественной природы служит надежным инструментом разграничения человеческого и искусственного письма, способствуя как теоретическому осмыслению идиостиля в эпоху нейросетей, так и решению прикладных задач обработки естественного языка в условиях стремительного роста цифрового контента.

Ключевые слова

стилистические девиации генеративные нейросети корпусная лингвистика идиостиль языковая норма CoAT

Библиографические ссылки

Абаева Е.С., Воеводина А.И. Идиостиль автора: вопросы параметризации // Филологические науки. Вопросы теории и практики. 2024. Т. 17. № 10. С. 3681-3687.

Бахтин М.М. Проблема речевых жанров // Эстетика словесного творчества. Москва: Искусство, 1979. С. 237-280.

Гальперин И.Р. Текст как объект лингвистического исследования. 3-е изд. Москва: УРСС, 2005. 137 с.

Горожанов А.И. Создание лингвистического корпуса на основе инструментов обработки естественного языка: планирование программных решений // Филологические науки. Вопросы теории и практики. 2023. Т. 16. № 5. С. 1616-1620.

Караулов Ю.Н. Русский язык и языковая личность. 7-е изд. Москва: ЛКИ, 2010. 264 с.

Клушина Н.И. Идиостиль в генеративном тексте // Коммуникативные исследования. 2025. Т. 12. № 4. С. 774-788.

Колмогорова А.В., Марголина А.В. Написанный vs сгенерированный текст: «естественность» как категория текстовая и психолингвистическая // Научный результат. Вопросы теоретической и прикладной лингвистики. 2024. Т. 10. № 2. С. 71-99.

Микаллеф Л.О. Лингвистика нейросетей как парадигма современной науки о языке // Мир науки, культуры, образования. 2025. № 1(110). С. 467-469.

Мордовин А.Ю. К вопросу о понятии репрезентативности корпуса текстов // Вестник ИГЛУ. 2009. № 1. С. 31-37.

Осетрова Е. В., Седова А. В. Характеристики сгенерированного текста: языковой и социально-коммуникативный анализ // Сибирский филологический форум. 2025. № 2 (31). С. 45–55. DOI: 10.24412/2587-7844-2025-2-45-55.

Прохоров А.И., Асадчая К.В. Инструментальные средства определения текста, сгенерированного при помощи нейросети // Научный вектор: сб. науч. тр. Под науч. ред. Е.Н. Макаренко. Т. 9. Ростов н/Д: Ростовский государственный экономический университет «РИНХ», 2023. С. 250-253.

Старкова Е.В. Проблема понимания феномена идиостиля в лингвистических исследованиях // Вестник Вятского государственного гуманитарного университета. 2015. № 5. С. 75-81.

Тельпов Р.Е., Ларцина С.В. Типовые различия естественных и сгенерированных нейронной сетью текстов в квантитативном аспекте // Научный диалог. 2023. Т. 12. № 7. С. 47-65.

Туркулец И.А. Композиционные особенности текстов, сгенерированных ChatGPT, как маркер несамостоятельности выполнения работ студентами // Правовая реальность в условиях цифровизации общества: материалы Всероссийской научно-практической конференции. Хабаровск: Дальневосточный государственный университет путей сообщения, 2023. С. 59-68.

Уразбаева Н.Ж. Человек и искусственный интеллект в письменной речи: проблема языковой интуиции нейросетей // Молодой ученый. 2026. № 16.1 (619.1). С. 24-25.

Черкасова М.Н., Тактарова А.В. Признаки сгенерированного текста в академическом дискурсе: проблема идентификации // Филологические науки. Вопросы теории и практики. 2024. Т. 17. № 7. С. 2226-2232.

Shamardina T., Saidov M., Fenogenova A., Tumanov A., Zemlyakova A., Lebedeva A., Gryaznova E., Shavrina T., Mikhailov V., Artemova E. CoAT: Corpus of artificial texts // Natural Language Processing. 2025. Vol. 31. Issue 1. P. 150–175. DOI: 10.1017/nlp.2024.38.

Выпуск

Раздел

ПРИКЛАДНЫЕ ИССЛЕДОВАНИЯ

Метрики

0 просмотров
0 скачиваний
Хотите опубликоваться?
Подать статью

Машиночитаемые метаданные