Информация, публикуемая на Интернет-ресурсах, являются важным источником данных для функционирования множества современных сервисов и используется в задачах сбора, анализа, мониторинга, бизнес-аналитики и других. Однако, отсутствие API, высокая вариативность и частые изменения структуры сайтов существенно усложняют разработку и требуют постоянной актуализации парсеров. В последние годы большие языковые модели (Large Language Models, LLM) демонстрируют высокую эффективность в задачах анализа текста и генерации программного кода, что открывает новые возможности для автоматизации анализа данных из веб-ресурсов. В данной работе предлагается архитектура адаптивной системы извлечения веб-данных, расширяющая возможности традиционных методов веб-парсинга за счет внедрения и адаптации посредством LLM. Решение поддерживает два режима работы: генерацию Python-скриптов для парсинга страницы и структурирование информации из текста страницы. Для оптимизации затрат токенов LLM на генерацию парсеров, внедрен механизм семантического кэширования, позволяющий повторно использовать ранее сгенерированные парсеры на основе поиска похожих запросов в векторном пространстве. Проведена экспериментальная оценка системы на основе бенчмарка LiveWeb-IE. Результаты показали, что предложенная система с точностью 90 запрос более, чем в 10 раз.
Язык оригиналарусский
Страницы (с-по)297-300
Число страниц4
ЖурналМеждународная конференция по мягким вычислениям и измерениям
Номер выпуска1 (29)
СостояниеОпубликовано - мая 2026
СобытиеXXIX Международная конференция по мягким вычислениям и измерениям (SCM-2026) - Санкт-Петербургский государственный электротехнический университет «ЛЭТИ» им. В.И. Ульянова (Ленина), Санкт-Петербург, Российская Федерация
Продолжительность: 20 мая 202622 мая 2026
Номер конференции: 29
https://scm.etu.ru/2026/ru/

    Области исследований

  • Большие языковые модели, веб-парсинг, автоматизация анализа данных, семантическое кэширование, генерация кода

ID: 160342899