Результаты исследований: Научные публикации в периодических изданиях › статья › Рецензирование
Автоматическая детекция адъективной неопределённости в русском юридическом тексте: датасет, модели, результаты. / Берлин, Алена Евгеньевна; Блинова, Ольга Владимировна.
в: International Journal of Open Information Technologies, Том 13, № 12, 2025, стр. 74-84.Результаты исследований: Научные публикации в периодических изданиях › статья › Рецензирование
}
TY - JOUR
T1 - Автоматическая детекция адъективной неопределённости в русском юридическом тексте: датасет, модели, результаты
AU - Берлин, Алена Евгеньевна
AU - Блинова, Ольга Владимировна
PY - 2025
Y1 - 2025
N2 - Статья посвящена созданию инструмента, способного автоматически классифицировать русские предложения, взятые из нормативных документов (законов), на содержащие и не содержащие правовую неопредённость. Для создания такого инструмента силами лингвистов и юристов разработан обучающий набор данных, содержащий 6000 предложений с метками и локусами неопределённости. Учтены только случаи, когда неопределённость вводится градуируемым прилагательным. В настоящей работе показано, как авторы использовали этот датасет в ряде экспериментов c классическими моделями машинного обучения и с трансформерной моделью. Применение аугментации в эксперименте с RuBERT позволило преодолеть проблему дисбаланса классов и достичь качества с показателем F1=0,89. При анализе языковых признаков, влияющих на предсказания модели, замечена концентрация прилагательных с приставкой не- в классе предложений с отсутствием неопределённости.
AB - Статья посвящена созданию инструмента, способного автоматически классифицировать русские предложения, взятые из нормативных документов (законов), на содержащие и не содержащие правовую неопредённость. Для создания такого инструмента силами лингвистов и юристов разработан обучающий набор данных, содержащий 6000 предложений с метками и локусами неопределённости. Учтены только случаи, когда неопределённость вводится градуируемым прилагательным. В настоящей работе показано, как авторы использовали этот датасет в ряде экспериментов c классическими моделями машинного обучения и с трансформерной моделью. Применение аугментации в эксперименте с RuBERT позволило преодолеть проблему дисбаланса классов и достичь качества с показателем F1=0,89. При анализе языковых признаков, влияющих на предсказания модели, замечена концентрация прилагательных с приставкой не- в классе предложений с отсутствием неопределённости.
M3 - статья
VL - 13
SP - 74
EP - 84
JO - International Journal of Open Information Technologies
JF - International Journal of Open Information Technologies
SN - 2307-8162
IS - 12
ER -
ID: 157209901