Документы

В статье описывается начальный этап создания лингвистически размеченного корпуса русских локальных документов и актов CorRIDA. В повседневной жизни носители русского языка всё чаще сталкиваются с необходимостью читать и подписывать различные официальные документы. Обычно это так называемые локальные документы, например, «Договоры на оказание платных услуг» или «Информированные согласия». Однако язык локальных документов исследован недостаточно и практически не рассматривался с применением корпусных методов.
Существующие корпусы русского языка пока не предоставляют возможностей для систематического анализа языка документа. Это связано в том числе с проблемами жанровой классификации и разметки нехудожественных текстов. Поэтому формирование корпуса локальных документов является актуальной задачей.
CorRIDA насчитывает 1,5 млн. слов, охватывает тексты, адресованные широким категориям пользователей (клиентам), принадлежащие трём социально значимым доменам (здравоохранение, образование, культура), и содержит в том числе разметку по типам текстов. Целью формирования корпуса является, во-первых, описание локальных документов разных типов через выделение и сравнение их языковых черт, во-вторых, оценка официально-деловых текстов с точки зрения их языковой сложности, удобства для восприятия и понимания «простым носителем» русского языка.
Переведенное названиеCORPUS OF RUSSIAN INTERNAL DOCUMENTS AND ACTS CORRIDA: GOALS, COMPOSITION AND STRUCTURE
Язык оригиналарусский
Название основной публикацииКомпьютерная лингвистика и вычислительные онтологии. Выпуск 2
Подзаголовок основной публикацииТруды XXI Международной объединенной научной конференции «Интернет и современное общество», IMS-2017, Санкт-Петербург, 31 мая – 2 июня 2018 г. Сборник научных статей
РедакторыА.В. Добров, В.П. Захаров, О.А. Митрофанова, М.В. Хохлова
Место публикацииСПб.
ИздательНИУ ИТМО
Страницы112-120
ISBN (печатное издание)978-5-7577-0584-2
СостояниеОпубликовано - 2018

    Предметные области Scopus

  • Гуманитарные науки и искусство (все)

    Области исследований

  • корпус русских локальных документов, официально-деловые тексты, типы текстов, социально-значимые домены

ID: 36371138