Ссылки

Статья посвящена созданию инструмента, способного автоматически классифицировать русские предложения, взятые из нормативных документов (законов), на содержащие и не содержащие правовую неопредённость. Для создания такого инструмента силами лингвистов и юристов разработан обучающий набор данных, содержащий 6000 предложений с метками и локусами неопределённости. Учтены только случаи, когда неопределённость вводится градуируемым прилагательным. В настоящей работе показано, как авторы использовали этот датасет в ряде экспериментов c классическими моделями машинного обучения и с трансформерной моделью. Применение аугментации в эксперименте с RuBERT позволило преодолеть проблему дисбаланса классов и достичь качества с показателем F1=0,89. При анализе языковых признаков, влияющих на предсказания модели, замечена концентрация прилагательных с приставкой не- в классе предложений с отсутствием неопределённости.
Переведенное названиеAutomatic Detection of Adjectival Vagueness in Russian Legal Texts: Dataset, Models, and Results
Язык оригиналарусский
Страницы (с-по)74-84
ЖурналInternational Journal of Open Information Technologies
Том13
Номер выпуска12
СостояниеОпубликовано - 2025

ID: 157209901