Сравнение языковых моделей для извлечения именованных сущностей из текстов инструкций лекарственных средств для оценки рисков полифармакотерапии с помощью сети байеса
https://doi.org/10.25881/18110193_2026_2_18
Аннотация
Актуальность. На сегодняшний день не существует алгоритмов, способных учитывать взаимодействие трех и более одновременно применяемых лекарственных средств, что необходимо для снижения рисков проявления побочных эффектов при полипрагмазии. Для создания подобного алгоритма предлагается использовать байесовскую сеть – графическую вероятностную модель на основе семантического графа, который строится на информации, полученной из медицинских текстов. Однако для его построения необходимо проводить анализ обширного объема имеющихся медицинских текстов, что требует чрезвычайно больших временных и интеллектуальных затрат медицинских специалистов, ввиду чего существует необходимость автоматизации этого процесса.
Цель. Сравнение различных архитектур обработки естественного языка и технологий глубокого обучения для создания инструмента автоматического анализа текстовой медицинской информации о фармакокинетике и фармакодинамике, побочных эффектах и взаимодействиях для создания семантических графов, использующихсявпоследствии для построения байесовской сети анализа лекарственных взаимодействий.
Материалы и методы. Для автоматической разметки текстов медицинских инструкций можно использовать метод обработки естественного языка. В данной работе для выделения именованных сущностей в рамках исследования были протестированы модели глубокого обучения на основе архитектур BERT и T5 с использованием формата BIO.
Результаты. Наиболее высокую точность показали модели на базе BERT: RuBioBERT достигла показателя accuracy равного 0,9569±0,0052, немного опережая ruBERT, которая показала сопоставимые результаты. Выявлено, что предобучение на общих текстах дает преимущество на начальных этапах, тогда как специализированные модели, такие как RuBioBERT, становятся эффективнее при увеличении числа эпох обучения. Это связано с тем, что общеупотребительные тексты обеспечивают более универсальное представление языка, в то время как научные медицинские статьи отличаются своей спецификой, не полностью соответствующей структуре инструкций по медицинскому применению лекарственных средств.
Выводы. Модели BERT позволяют добиться качества разметки, близкого к экспертному, что делает их эффективным инструментом для построения семантического графа лекарственных взаимодействий. Автоматизация NER-разметки позволяет сократить трудозатраты экспертов и повысить точность обработки текстов. Таким образом, применение моделей BERT, таких как ruBERT и RuBioBERT, является перспективным методом для автоматизации анализа медицинских текстов и построения платформ для оценки сложных лекарственных взаимодействий.
Ключевые слова
Об авторах
Т. А. КуропаткинаРоссия
КУРОПАТКИНА Т.А., к.б.н.
г. Москва
Н. В. Кильмишкин
Россия
КИЛЬМИШКИН Н.В.
г. Москва
В. И. Пантелеев
Россия
ПАНТЕЛЕЕВ В.И., к.м.н.
г. Москва
Д. Д. Кубраков
Россия
КУБРАКОВ Д.Д.
г. Москва
П. М. Иванова
Россия
ИВАНОВА П.М.
г. Москва
Ю. П. Титов
Россия
ТИТОВ Ю.П., к.т.н.
г. Москва
С. Д. Валентей
Россия
ВАЛЕНТЕЙ С.Д., д.э.н., профессор
г. Москва
Н. Л. Шимановский
Россия
ШИМАНОВСКИЙ Н.Л., д.м.н., профессор, член-корреспондент РАН
г. Москва
Список литературы
1. Королева М.В., Ильницкий А.Н., Кудашкина Е.В., Коршун Е.И., Шарова А.А., Полев А.В. Современные направления фармакотерапии гериатрических пациентов: полиморбидность — полипрагмазия — депрескрайбинг // Современные проблемы здравоохранения и медицинской статистики. — 2019. — № 3. — С. 150-171.
2. Cucinotta D. Multimorbidity and polypharmacy: a risk factor for older patients. Acta Biomed. 2022; 93(2): e2022137.
3. Сычев Д.А., Отделенов В.А., Краснова Н.М., Ильина Е.С. Полипрагмазия: взгляд клинического фармаколога // Терапевтический архив. — 2016. — № 12. — С. 94-102.
4. Изможерова Н.В., Попов А.А., Курындина А.А., Гаврилова Е.И., Шамбатов М.А., Бахтин В.М. Полиморбидность и полипрагмазия у пациентов высокого и очень высокого сердечно-сосудистого риска // Рациональная фармакотерапия в кардиологии. — 2022. — № 1. — С. 20-26.
5. drugs.com. Available at: https://www.drugs.com. Accessed 07.06.2025.
6. medscape.com. Available at: https://www.medscape.com. Accessed 05.07.2025.
7. DrugBank: Drug Interaction Checker Available at: https://www.drugbank.com/clinical/drug_drug_interaction_checker. Accessed 05.07.2025.
8. WebMD. Available at: https://www.webmd.сom. Accessed 06.07.2025.
9. Murali K., Kaur S., Prakash A, Medhi B. Artificial intelligence in pharmacovigilance: Practical utility. Indian J Pharmacol. 2019; 51(6): 373-376.
10. Li Z., Wu W, Kang H. Machine Learning-Driven Metabolic Syndrome Prediction: An International Cohort Validation Study. Healthcare. 2024; 12(24): 2527.
11. Rodrigues P.P., Ferreira-Santos D., Silva A., Polónia J., Ribeiro-Vaz I. Causality assessment of adverse drug reaction reports using an expert-defined Bayesian network. Artif. Intell. 2018; 91: 12-22.
12. Wang L., Hao H., Yan X., et al. From biomedical knowledge graph construction to semantic querying: a comprehensive approach. Sci Rep. 2025; 15: 8523.
13. Polotskaya K., Muñoz-Valencia C.S., Rabasa A., Quesada-Rico J.A., Orozco-Beltrán D., Barber X. Bayesian Networks for the Diagnosis and Prognosis of Diseases: A Scoping Review. Machine Learning and Knowledge Extraction. 2024; 6(2): 1243-1262.
14. Arora P., Boyne D., Slater J.J., Gupta A., Brenner D.R., Druzdzel M.J. Bayesian networks for risk prediction using real-world data: a tool for precision medicine. Value Health. 2019; 22(4): 439-445.
15. Sarem M., Saeed F., Alsaeedi A., et al. A survey on text preprocessing techniques based on NLP tasks. Multimedia Tools and Applications. 2022; 81(20): 28443-28470.
16. Единая государственная система регистрации лекарственных средств и медицинских изделий. [доступ от 07.07.2025]. Доступ по ссылке: https://grls.rosminzdrav.ru/Default.aspx.
17. Бойцов С.А., Бубнова М.Г., Васюк Ю.А. и др. Хроническая сердечная недостаточность. Клинические рекомендации 2024 // Российский кардиологический журнал. — 2024. — № 29(11). — С. 6162.
18. Международная классификация болезней 10-го пересмотра (МКБ-10) [интернет]. [доступ от 07.07.2025]. Доступ по ссылке: https://mkb-10.com.
19. export_from_pdf.py. GitHub. Available at: https://github.com/kalengul/graph_model_midicine/blob/main/doccano/data_jsonl_export/export_from_pdf.py—Emhyr713/graph_model_midicine. Accessed 30.06.2025.
20. Finding. GitHub Available at: https://github.com/kalengul/graph_model_midicine/tree/main/semantic_graph/finding.—Emhyr713/graph_model_midicine. Accessed 30.06.2025.
21. Tabassum A., Patil D.R. A Survey on Text Pre-Processing & Feature Extraction Techniques in Natural Language Processing. IRJET. 2020; 7(6).
22. Python 3.11 [интернет]. Версия 3.11 [доступ от 08.07.2025]. Доступ по ссылке: https://docs.python.org/3.11/
23. Кукушкин А.Е. Razdel — сегментация русскоязычного текста на токены и предложения [интернет]. [доступ от 11.07.2025]. Доступ по ссылке: https://github.com/natasha/razdel
24. Alshammari N., Alanazi S. The impact of using different annotation schemes on named entity recognition. Egypt Inform J. 2021; 22: 295-302.
25. Creater_graph. GitHub. Available at: https://github.com/kalengul/graph_model_midicine/blob/main/Creater_graph/mark_BIO_spacy.py. —Emhyr713/graph_model_midicine. Accessed 30.06.2025.
26. Библиотека spaCy [интернет]. [доступ от 10.07.2025]. Доступ по ссылке: https://github.com/explosion/spaCy.
27. Кукушкин А.Е. Razdel — сегментация русскоязычного текста на токены и предложения [интернет]. [доступ от 11.07.2025]. Доступ по ссылке: https://github.com/natasha/razdel.
28. mark_sent_1.py. GitHub. Available at: https://github.com/kalengul/graph_model_midicine/blob/main/semantic_graph/full_pipeline/mark_sent_1.py . - Emhyr713/graph_model_midicine. Accessed 30.06.2025.
29. Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. In: Burstein J., Doran C., Solorio T., eds. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Vol. 1 (Long and Short Papers). Minneapolis, MN: Association for Computational Linguistics; 2019: 4171-4186.
30. Kuratov Y., Arkhipov M. Adaptation of deep bidirectional multilingual transformers for Russian language. arXiv preprint arXiv: 1905.07213. 2019.
31. Bobrova E.V., Makanov A.Z., Osnovin S.S., et al. Generating medical opinions and classification according to Bethesda using deep learning. Int J Open Inf Technol. 2023; 11(10): 119-129.
32. Ni J., Hernandez Abrego G., Constant N., Ma J., Hall K., Cer D., Yang Y. Sentence-T5: scalable sentence encoders from pre-trained text-to-text models. In: Findings of the Association for Computational Linguistics: ACL 2022. Dublin, Ireland: Association for Computational Linguistics; 2022: 1864-1874.
33. ruT5-base: модель для генерации текста на русском языке [интернет]. [доступ от 12.07.2025]. Доступ по ссылке: https://huggingface.co/ai-forever/ruT5-base.
34. ruT5-base-multitask: модель для выполнения нескольких текстовых задач на русском языке [интернет]. [доступ от 14.07.2025]. Доступ по ссылке: https://huggingface.co/cointegrated/rut5-base-multitask.
35. Doccano: инструмент с открытым исходным кодом для аннотации текстовых данных в задачах NLP [интернет]. [доступ от 14.07.2025]. Доступ по ссылке: https://github.com/doccano/doccano.
36. Nadeau D., Sekine S. A survey of named entity recognition and classification. Lingvisticæ Investigationes. 2007; 30(1): 3-26.
37. Powers D. Evaluation: From precision, recall and F-factor to ROC, informedness, markedness & correlation. Machine Learning Technology. 2008; 2: 2229-3981.
Рецензия
Для цитирования:
Куропаткина Т.А., Кильмишкин Н.В., Пантелеев В.И., Кубраков Д.Д., Иванова П.М., Титов Ю.П., Валентей С.Д., Шимановский Н.Л. Сравнение языковых моделей для извлечения именованных сущностей из текстов инструкций лекарственных средств для оценки рисков полифармакотерапии с помощью сети байеса. Врач и информационные технологии. 2026;(2):18-35. https://doi.org/10.25881/18110193_2026_2_18
For citation:
Kuropatkina T.A., Kilmishkin N.V., Panteleev V.I., Kubrakov D.D., Ivanova P.M., Titov Yu.P., Valentey S.D., Shimanovsky N.L. A comparative study of language models for named entity recognition from drug labels for polypharmacy risk assessment using bayesian networks. Medical Doctor and Information Technologies. 2026;(2):18-35. (In Russ.) https://doi.org/10.25881/18110193_2026_2_18
JATS XML