Данная работа рассматривает создание аннотированного набора данных для оценки качества извлечения аспектов. Область исследования представлена рецензиями на кинопродукцию. В процессе достижения цели производится построение размеченной выборки данных методом краудсорсинга, используемой для дообучения большой языковой модели; сравниваются применимые методы и обобщающие способности моделей. Для проведения исследовательской работы создаётся комплекс программ на языке Python, который реализует техническое решение для получения разметки данных, использует модели машинного обучения для реальных данных и позволяет проводить эксперименты. В течение проведения и по окончании экспериментов наблюдаются и анализируются различия в применимости алгоритмов и их поведение в зависимости от исходных данных.
Ключевые слова: Аннотирование; Автоматическое реферирование; Большая языковая модель; Квантизация; Классификация; Метрики качества генерации; Промпт-инжиниринг.
86 commits
Jupyter Notebook
99.2%
Данная работа рассматривает создание аннотированного набора данных для оценки качества извлечения аспектов. Область исследования представлена рецензиями на кинопродукцию. В процессе достижения цели производится построение размеченной выборки данных методом краудсорсинга, используемой для дообучения большой языковой модели; сравниваются применимые методы и обобщающие способности моделей. Для проведения исследовательской работы создаётся комплекс программ на языке Python, который реализует техническое решение для получения разметки данных, использует модели машинного обучения для реальных данных и позволяет проводить эксперименты. В течение проведения и по окончании экспериментов наблюдаются и анализируются различия в применимости алгоритмов и их поведение в зависимости от исходных данных.
Ключевые слова: Аннотирование; Автоматическое реферирование; Большая языковая модель; Квантизация; Классификация; Метрики качества генерации; Промпт-инжиниринг.
86 commits
Jupyter Notebook
99.2%