Результаты исследований: Научные публикации в периодических изданиях › статья › Рецензирование
Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования. / Мурадян, Д. С.; Шутько, О. А.; Бушмелев, Ф. В.
в: Международная конференция по мягким вычислениям и измерениям, № 1 (29), 05.2026, стр. 297-300.Результаты исследований: Научные публикации в периодических изданиях › статья › Рецензирование
}
TY - JOUR
T1 - Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования
AU - Мурадян, Д. С.
AU - Шутько, О. А.
AU - Бушмелев, Ф. В.
N1 - Conference code: 29
PY - 2026/5
Y1 - 2026/5
N2 - Информация, публикуемая на Интернет-ресурсах, являются важным источником данных для функционирования множества современных сервисов и используется в задачах сбора, анализа, мониторинга, бизнес-аналитики и других. Однако, отсутствие API, высокая вариативность и частые изменения структуры сайтов существенно усложняют разработку и требуют постоянной актуализации парсеров. В последние годы большие языковые модели (Large Language Models, LLM) демонстрируют высокую эффективность в задачах анализа текста и генерации программного кода, что открывает новые возможности для автоматизации анализа данных из веб-ресурсов. В данной работе предлагается архитектура адаптивной системы извлечения веб-данных, расширяющая возможности традиционных методов веб-парсинга за счет внедрения и адаптации посредством LLM. Решение поддерживает два режима работы: генерацию Python-скриптов для парсинга страницы и структурирование информации из текста страницы. Для оптимизации затрат токенов LLM на генерацию парсеров, внедрен механизм семантического кэширования, позволяющий повторно использовать ранее сгенерированные парсеры на основе поиска похожих запросов в векторном пространстве. Проведена экспериментальная оценка системы на основе бенчмарка LiveWeb-IE. Результаты показали, что предложенная система с точностью 90 запрос более, чем в 10 раз.
AB - Информация, публикуемая на Интернет-ресурсах, являются важным источником данных для функционирования множества современных сервисов и используется в задачах сбора, анализа, мониторинга, бизнес-аналитики и других. Однако, отсутствие API, высокая вариативность и частые изменения структуры сайтов существенно усложняют разработку и требуют постоянной актуализации парсеров. В последние годы большие языковые модели (Large Language Models, LLM) демонстрируют высокую эффективность в задачах анализа текста и генерации программного кода, что открывает новые возможности для автоматизации анализа данных из веб-ресурсов. В данной работе предлагается архитектура адаптивной системы извлечения веб-данных, расширяющая возможности традиционных методов веб-парсинга за счет внедрения и адаптации посредством LLM. Решение поддерживает два режима работы: генерацию Python-скриптов для парсинга страницы и структурирование информации из текста страницы. Для оптимизации затрат токенов LLM на генерацию парсеров, внедрен механизм семантического кэширования, позволяющий повторно использовать ранее сгенерированные парсеры на основе поиска похожих запросов в векторном пространстве. Проведена экспериментальная оценка системы на основе бенчмарка LiveWeb-IE. Результаты показали, что предложенная система с точностью 90 запрос более, чем в 10 раз.
KW - Большие языковые модели
KW - веб-парсинг
KW - автоматизация анализа данных
KW - семантическое кэширование
KW - генерация кода
M3 - статья
SP - 297
EP - 300
JO - Международная конференция по мягким вычислениям и измерениям
JF - Международная конференция по мягким вычислениям и измерениям
IS - 1 (29)
T2 - XXIX Международная конференция по мягким вычислениям и измерениям (SCM-2026)
Y2 - 20 May 2026 through 22 May 2026
ER -
ID: 160342899