Standard

Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования. / Мурадян, Д. С.; Шутько, О. А.; Бушмелев, Ф. В.

в: Международная конференция по мягким вычислениям и измерениям, № 1 (29), 05.2026, стр. 297-300.

Результаты исследований: Научные публикации в периодических изданияхстатьяРецензирование

Harvard

Мурадян, ДС, Шутько, ОА & Бушмелев, ФВ 2026, 'Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования', Международная конференция по мягким вычислениям и измерениям, № 1 (29), стр. 297-300. <https://elibrary.ru/item.asp?id=91650763>

APA

Мурадян, Д. С., Шутько, О. А., & Бушмелев, Ф. В. (2026). Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования. Международная конференция по мягким вычислениям и измерениям, (1 (29)), 297-300. https://elibrary.ru/item.asp?id=91650763

Vancouver

Мурадян ДС, Шутько ОА, Бушмелев ФВ. Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования. Международная конференция по мягким вычислениям и измерениям. 2026 Май;(1 (29)):297-300.

Author

Мурадян, Д. С. ; Шутько, О. А. ; Бушмелев, Ф. В. / Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования. в: Международная конференция по мягким вычислениям и измерениям. 2026 ; № 1 (29). стр. 297-300.

BibTeX

@article{ca3440494ad54dbeaa7f6453e945c98d,
title = "Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования",
abstract = "Информация, публикуемая на Интернет-ресурсах, являются важным источником данных для функционирования множества современных сервисов и используется в задачах сбора, анализа, мониторинга, бизнес-аналитики и других. Однако, отсутствие API, высокая вариативность и частые изменения структуры сайтов существенно усложняют разработку и требуют постоянной актуализации парсеров. В последние годы большие языковые модели (Large Language Models, LLM) демонстрируют высокую эффективность в задачах анализа текста и генерации программного кода, что открывает новые возможности для автоматизации анализа данных из веб-ресурсов. В данной работе предлагается архитектура адаптивной системы извлечения веб-данных, расширяющая возможности традиционных методов веб-парсинга за счет внедрения и адаптации посредством LLM. Решение поддерживает два режима работы: генерацию Python-скриптов для парсинга страницы и структурирование информации из текста страницы. Для оптимизации затрат токенов LLM на генерацию парсеров, внедрен механизм семантического кэширования, позволяющий повторно использовать ранее сгенерированные парсеры на основе поиска похожих запросов в векторном пространстве. Проведена экспериментальная оценка системы на основе бенчмарка LiveWeb-IE. Результаты показали, что предложенная система с точностью 90 запрос более, чем в 10 раз.",
keywords = "Большие языковые модели, веб-парсинг, автоматизация анализа данных, семантическое кэширование, генерация кода",
author = "Мурадян, {Д. С.} and Шутько, {О. А.} and Бушмелев, {Ф. В.}",
note = "eLIBRARY ID: 91650763; EDN: DZVXWD; XXIX Международная конференция по мягким вычислениям и измерениям (SCM-2026), SCM'2026 ; Conference date: 20-05-2026 Through 22-05-2026",
year = "2026",
month = may,
language = "русский",
pages = "297--300",
journal = "Международная конференция по мягким вычислениям и измерениям",
publisher = "Издательство СПбГЭТУ {"}ЛЭТИ{"}",
number = "1 (29)",
url = "https://scm.etu.ru/2026/ru/",

}

RIS

TY - JOUR

T1 - Адаптивная система парсинга веб-ресурсов на основе больших языковых моделей с использованием семантического кэширования

AU - Мурадян, Д. С.

AU - Шутько, О. А.

AU - Бушмелев, Ф. В.

N1 - Conference code: 29

PY - 2026/5

Y1 - 2026/5

N2 - Информация, публикуемая на Интернет-ресурсах, являются важным источником данных для функционирования множества современных сервисов и используется в задачах сбора, анализа, мониторинга, бизнес-аналитики и других. Однако, отсутствие API, высокая вариативность и частые изменения структуры сайтов существенно усложняют разработку и требуют постоянной актуализации парсеров. В последние годы большие языковые модели (Large Language Models, LLM) демонстрируют высокую эффективность в задачах анализа текста и генерации программного кода, что открывает новые возможности для автоматизации анализа данных из веб-ресурсов. В данной работе предлагается архитектура адаптивной системы извлечения веб-данных, расширяющая возможности традиционных методов веб-парсинга за счет внедрения и адаптации посредством LLM. Решение поддерживает два режима работы: генерацию Python-скриптов для парсинга страницы и структурирование информации из текста страницы. Для оптимизации затрат токенов LLM на генерацию парсеров, внедрен механизм семантического кэширования, позволяющий повторно использовать ранее сгенерированные парсеры на основе поиска похожих запросов в векторном пространстве. Проведена экспериментальная оценка системы на основе бенчмарка LiveWeb-IE. Результаты показали, что предложенная система с точностью 90 запрос более, чем в 10 раз.

AB - Информация, публикуемая на Интернет-ресурсах, являются важным источником данных для функционирования множества современных сервисов и используется в задачах сбора, анализа, мониторинга, бизнес-аналитики и других. Однако, отсутствие API, высокая вариативность и частые изменения структуры сайтов существенно усложняют разработку и требуют постоянной актуализации парсеров. В последние годы большие языковые модели (Large Language Models, LLM) демонстрируют высокую эффективность в задачах анализа текста и генерации программного кода, что открывает новые возможности для автоматизации анализа данных из веб-ресурсов. В данной работе предлагается архитектура адаптивной системы извлечения веб-данных, расширяющая возможности традиционных методов веб-парсинга за счет внедрения и адаптации посредством LLM. Решение поддерживает два режима работы: генерацию Python-скриптов для парсинга страницы и структурирование информации из текста страницы. Для оптимизации затрат токенов LLM на генерацию парсеров, внедрен механизм семантического кэширования, позволяющий повторно использовать ранее сгенерированные парсеры на основе поиска похожих запросов в векторном пространстве. Проведена экспериментальная оценка системы на основе бенчмарка LiveWeb-IE. Результаты показали, что предложенная система с точностью 90 запрос более, чем в 10 раз.

KW - Большие языковые модели

KW - веб-парсинг

KW - автоматизация анализа данных

KW - семантическое кэширование

KW - генерация кода

M3 - статья

SP - 297

EP - 300

JO - Международная конференция по мягким вычислениям и измерениям

JF - Международная конференция по мягким вычислениям и измерениям

IS - 1 (29)

T2 - XXIX Международная конференция по мягким вычислениям и измерениям (SCM-2026)

Y2 - 20 May 2026 through 22 May 2026

ER -

ID: 160342899