Современные алгоритмы машинного обучения с учителем используют признаковое описание объектов для создания классифицирующих моделей. Такое описание может включать в себя большое количество признаков в зависимости от решаемой задачи. В работе проведен анализ проблемной ситуации в рамках предметной области, связанной с составлением признакового описания объектов библиографических данных. Предложен способ решения данной проблемы за счет применения генетического алгоритма. Сформулированы принципы разработки программного модуля в общем виде и даны детали реализации на языке программирования Python. В результате решается проблема перегрузки признакового представления малозначимыми признаками, обучение и переобучение ускоряется без потери качества классификации. Генетический алгоритм разработанного программного модуля в составе программного комплекса обработки библиографических данных может применяться для отбора наиболее заначимых признаков. В ходе вычислительного эксперимента получены следующие результаты: число используемых признаков уменьшилось с 26 до 15, качество классификации увеличилось на 3 % за счет отсева признаков, способствующих переобучению.
1. Петров Е.Н. Исследование и разработка методики и алгоритма классификации библиографических данных с помощью условно-случайных полей // Итоги диссертационных исследований. Т. 2. Материалы Х Всероссийского конкурса молодых ученых. М.: РАН, 2018. С. 91–98.
2. Петров Е.Н., Черников Б.В., Борисова Е.А. Верификация методики классификации библиографических данных на основе условно-случайных полей. Ч.1 // Современные наукоемкие технологии. 2019.
№ 11. С. 113–118.
3. Berry M.W., Mohamed A.Z., Yap B.W. Supervised and unsupervised learning for data science. Springer International Publishing, 2019. 187 p.
4. Вороновский Г.К., Махотило К.В., Петрашев С.Н., Сергеев С.А. Генетические алгоритмы, искусственные нейронные сети и проблемы виртуальной реальности. X.: Основа, 1997. 112 с.
5. An improved gene expression programming based on niche technology of outbreeding fusion /
C.X. Wang, J.J. Zhang, S.L. Wu et al // Informatica. 2017. Vol. 41. P. 25–30.
6. Wang J., Li Z., Huang W., Xiao K. Character information extraction based on CRFsuite // 2016 International Conference on Advanced Electronic Science and Technology (AEST 2016). Atlantis Press, 2016.
P. 147–154.