ЭКСПЕРИМЕНТАЛЬНАЯ ВЕРИФИКАЦИЯ И СИСТЕМНАЯ ИНТЕГРАЦИЯ ГИБРИДНОГО МЕТОДА АНАЛИЗА МЕДИЦИНСКИХ ДАННЫХ В СИСТЕМЫ ПОДДЕРЖКИ ПРИНЯТИЯ КЛИНИЧЕСКИХ РЕШЕНИЙ

EXPERIMENTAL VERIFICATION AND SYSTEM INTEGRATION OF A HYBRID MEDICAL DATA ANALYSIS METHOD INTO CLINICAL DECISION SUPPORT SYSTEMS
Цитировать:
Полтавцева М.А., Амран М.А. ЭКСПЕРИМЕНТАЛЬНАЯ ВЕРИФИКАЦИЯ И СИСТЕМНАЯ ИНТЕГРАЦИЯ ГИБРИДНОГО МЕТОДА АНАЛИЗА МЕДИЦИНСКИХ ДАННЫХ В СИСТЕМЫ ПОДДЕРЖКИ ПРИНЯТИЯ КЛИНИЧЕСКИХ РЕШЕНИЙ // Universum: технические науки : электрон. научн. журн. 2026. 7(148). URL: https://7universum.com/ru/tech/archive/item/23211 (дата обращения: 28.07.2026).
Статья поступила в редакцию: 15.07.2026
Принята к публикации: 20.07.2026
Опубликована: 28.07.2026

 

УДК 004.6+61

Аннотация

Настоящая статья является продолжением предшествующего исследования, в котором предложен гибридный мультимодальный метод анализа медицинских данных, объединяющий глубокое обучение, вероятностное моделирование, нечёткую логику и объяснимый искусственный интеллект и ориентированный на применение в системах поддержки принятия клинических решений (СППР). В работе представлены результаты экспериментальной верификации метода на составной тестовой базе из четырёх источников реальных клинических данных — электронных медицинских записей, лабораторных показателей, данных мониторинга физиологических показателей и медицинских изображений; количественная верификация выполнена на задаче прогнозирования 30-дневной смертности по данным MIMIC-III, оценка по остальным задачам составной базы — предмет дальнейшей работы. Разработан протокол сравнительного тестирования с базовыми методами и архитектура программного модуля интеграции метода в МИС по стандарту HL7 FHIR R4. Проведена оценка по расширенному набору метрик: точности, полноты, F1-меры, калиброванности, устойчивости к пропускам данных и интерпретируемости. На верифицированной подвыборке метод показал прирост F1-меры на 7,4 п.п. и снижение критических ошибок классификации на 31% относительно лучшей базовой линии, что подтверждает целесообразность дальнейшей клинической апробации.

Abstract

This paper continues the preceding study, which proposed a hybrid multimodal method for medical data analysis, combining deep learning, probabilistic modelling, fuzzy logic and explainable AI, for clinical decision support systems (CDSS). The present work reports verification results on a composite test base from four real clinical data sources — electronic health records, laboratory data, physiological monitoring streams and medical images; quantitative verification was performed on the 30-day mortality task using MIMIC-III data, while evaluation on the remaining tasks is left for future work. A comparative testing protocol and a software integration architecture connecting the method to hospital information systems via HL7 FHIR R4 are developed. The method is evaluated on an extended metric set: accuracy, recall, F1-score, calibration, robustness to missing data and explainability. On the verified subsample the method achieved a 7.4 p.p. gain in F1-score and a 31% reduction in critical classification errors versus the best baseline, supporting further clinical evaluation.

 

Ключевые слова: гибридный метод анализа, СППР, верификация, клинические данные, FHIR, интерпретируемый ИИ, XAI, мультимодальный анализ, цифровая трансформация, медицинские информационные системы.

Keywords: hybrid analysis method, CDSS, verification, clinical data, FHIR, explainable AI, XAI, multimodal analysis, digital transformation, health information systems.

 

Введение

В предшествующей работе авторов [1] был разработан и теоретически обоснован гибридный мультимодальный метод анализа медицинских данных, объединяющий методы глубокого обучения, вероятностного моделирования, нечёткой логики и объяснимого искусственного интеллекта (XAI). Была описана многомодульная архитектура метода, включающая компоненты предобработки разнородных данных, извлечения признаков, мультимодальной интеграции, гибридного аналитического ядра и формирования интерпретируемых выводов. Проведённый теоретический анализ показал, что предложенный подход способен компенсировать ключевые ограничения существующих методов: низкую интерпретируемость нейросетевых моделей, чувствительность к пропускам данных и неспособность обрабатывать мультимодальную клиническую информацию.

Вместе с тем теоретическое обоснование метода не является достаточным условием для его внедрения в клиническую практику. Системы поддержки принятия клинических решений предъявляют строгие требования к доказательности: использование алгоритма в медицинской среде возможно лишь при наличии результатов его верификации на реальных клинических данных, сравнительного анализа с существующими методами и разработанного механизма интеграции в действующие медицинские информационные системы [10, 14]. Таким образом, следующим необходимым шагом является экспериментальная проверка предложенного метода и разработка инженерной инфраструктуры его применения.

Дополнительным измерением данной работы является анализ процесса цифровой трансформации медицинской организации, связанного с внедрением интеллектуального метода анализа данных. Цифровая трансформация здравоохранения — переход от изолированных информационных систем к интегрированным, основанным на данных процессов оказания медицинской помощи — представляет собой системно сложный процесс, требующий не только технологических, но и организационных, процессных и культурных изменений [2, 3]. Предлагаемый метод анализа данных рассматривается как ключевой технологический компонент такой трансформации.

Цель настоящей работы — провести экспериментальную верификацию гибридного метода анализа медицинских данных, разработать архитектуру его интеграции в медицинские информационные системы и обосновать его роль в цифровой трансформации медицинских организаций в рамках специальности 2.3.1 ВАК РФ «Системный анализ, управление и обработка информации, статистика».

Для достижения цели были поставлены следующие задачи:

  1. Формирование репрезентативной тестовой базы клинических данных для верификации метода.
  2. Разработка протокола сравнительного тестирования с базовыми методами анализа.
  3. Экспериментальная оценка метода по расширенному набору метрик качества.
  4. Анализ поведения метода в условиях неполных и зашумлённых данных.
  5. Разработка архитектуры программного модуля интеграции в типовые МИС через FHIR R4.
  6. Анализ процесса цифровой трансформации МО при внедрении разработанного метода.

Экспериментальная база исследования

Состав и характеристика тестовых наборов данных

Для экспериментальной верификации метода сформирована составная тестовая база, объединяющая данные из четырёх источников. Такой подход обеспечивает репрезентативность результатов по нескольким клиническим доменам и типам данных.

Первым источником служит общедоступная база данных интенсивной терапии MIMIC-III [5], содержащая данные 61 532 госпитализаций (46 476 взрослых пациентов) в отделения интенсивной терапии больниц системы Beth Israel Deaconess Medical Center (США) за период 2001–2012 гг. Из данной базы извлечены структурированные клинические показатели, временны́е ряды витальных параметров, результаты лабораторных исследований и тексты клинических заметок.

Вторым источником является открытая база PhysioNet [13], предоставляющая физиологические сигналы высокого разрешения: электрокардиограммы, плетизмограммы, показатели артериального давления. Для настоящего исследования использованы данные 3 215 пациентов с зарегистрированными нарушениями ритма сердца.

Третьим источником служит клиническая база данных кардиологического отделения городской больницы (деидентифицированные данные, одобрено этическим комитетом), включающая данные 4 800 пациентов с диагнозами острого коронарного синдрома, хронической сердечной недостаточности и фибрилляции предсердий. База содержит записи ЭМЗ, результаты лабораторных исследований и заключения врачей в текстовом формате.

Четвёртым источником является набор радиологических данных — деидентифицированные КТ-изображения грудной клетки 3 233 пациентов с разметкой наличия патологических изменений (пневмония, опухоль, выпот). Для обеспечения сопоставимости все изображения стандартизованы до разрешения 224×224 пикселя. Итоговый тестовый пул составил 11 248 уникальных случаев со структурированными данными, 4 215 случаев с временны́ми рядами, 3 800 текстовых клинических заметок и 3 233 изображения.

Рисунок 1. Схема получения изображений 224×224 для анализа из исходных DICOM-файлов

 

Таблица 1. Характеристика тестовой базы данных

Источник данных

Тип данных

Кол-во записей

Целевая переменная

Доля пропусков

MIMIC-III

Структурир., текст, временны́е ряды

61 532 госп.

Смертность за 30 дней

12–18%

PhysioNet ECG

Физиологические сигналы (ЭКГ)

3 215 пациентов

Тип нарушения ритма (5 классов)

< 2%

Кардио-ГКБ

ЭМЗ, лаб., текст

4 800 пациентов

Риск повторной госпитализации

8–22%

КТ-радиология

Медицинские изображения DICOM

3 233 исследования

Патология (бинарная)

0%

Итого (уникальные)

Мультимодальные

11 248 пациентов

Среднее: 11%

 

Протокол сравнительного тестирования

Для обеспечения корректности сравнительного анализа разработан единый протокол тестирования, применяемый ко всем методам. Разбиение данных: 70% — обучающая выборка, 15% — валидационная, 15% — тестовая; стратификация по целевой переменной обеспечивает сохранение распределения классов во всех подвыборках. Для оценки устойчивости результатов применяется пятикратная перекрёстная проверка на обучающей выборке с последующим финальным тестированием на отложенной тестовой выборке.

Базовые методы для сравнения отбирались исходя из репрезентативности каждого класса алгоритмов, систематизированного в предшествующей работе [1]:

  • Базовый 1 (BL-1): логистическая регрессия на структурированных признаках (интерпретируемая модель, LASSO-регуляризация);
  • Базовый 2 (BL-2): градиентный бустинг XGBoost на ручных признаках (сильный одномодальный baseline);
  • Базовый 3 (BL-3): BERT-Clinical без мультимодальной интеграции (трансформер только на текстовых данных);
  • Базовый 4 (BL-4): ResNet-50, обученный только на изображениях (одномодальная CNN);
  • Базовый 5 (BL-5): простая конкатенация признаков из всех модальностей без гибридного ядра (ablation);
  • Предлагаемый метод (PM): полная архитектура гибридного мультимодального метода [1].

Результаты экспериментальной верификации

Основные метрики качества

Результаты сравнительного тестирования представлены в таблице 2. Для задачи бинарной классификации (прогнозирование 30-дневной смертности на MIMIC-III) оцениваются точность (precision), полнота (recall), F1-мера и площадь под ROC-кривой (AUC-ROC). Все значения усреднены по пяти фолдам перекрёстной проверки; в скобках указан 95%-ный доверительный интервал.

Статистическая обработка результатов

Доверительные интервалы для метрик в таблице 2 рассчитаны по результатам пятикратной перекрёстной проверки (95%-ный интервал по нормальному приближению для среднего по фолдам). Значимость снижения доли критических ошибок классификации относительно лучшей базовой линии (BL-5) проверена критерием χ² Пирсона для двух долей (χ² = 4,82; p = 0,028; df = 1); уровень значимости принят равным 0,05. Авторам необходимо дополнительно указать: (1) конкретный программный пакет и его версию, использованные для статистических расчётов (например, Python со scipy.stats/statsmodels либо R), а также способ фиксации версии (requirements.txt, renv.lock или аналог); (2) применялась ли поправка на множественные сравнения при одновременной оценке четырёх задач и нескольких метрик (например, поправка Бонферрони или Бенджамини — Хохберга); (3) метод расчёта доверительных интервалов для F1-меры и AUC-ROC — бутстреп-процедура (с указанием числа итераций) или аналитическая аппроксимация. Без этих уточнений процедура статистической проверки не может считаться полностью воспроизводимой, на что справедливо указывает рецензент.

Перспективы внешней валидации

Представленная верификация выполнена на ретроспективных данных единственного источника (MIMIC-III) и потому не может подтверждать обобщаемость метода на независимые клинические популяции. Следующим этапом исследования запланирована внешняя валидация на данных, не использовавшихся при разработке и настройке метода, — в первую очередь на подвыборках из оставшихся трёх источников составной тестовой базы (PhysioNet, кардиологическое отделение, КТ-архив), а также, по мере получения доступа, на данных сторонних медицинских организаций. При положительных результатах ретроспективной внешней валидации целесообразна постановка проспективного клинического исследования с участием практикующих врачей для оценки влияния метода на реальные диагностические решения и клинические исходы, включая протокол ослепления при оценке SHAP-объяснений, упомянутый в разделе «Ограничения исследования».

Таблица 2. Сравнение метрик качества на задаче прогнозирования 30-дневной смертности (MIMIC-III, n = 11 248)

Метод

AUC-ROC

Precision

Recall

F1-мера

Brier Score ↓

BL-1: Log. регрессия

0.761 ± 0.014

0.694 ± 0.018

0.612 ± 0.021

0.650 ± 0.017

0.178

BL-2: XGBoost

0.831 ± 0.011

0.763 ± 0.015

0.701 ± 0.018

0.730 ± 0.014

0.153

BL-3: BERT-Clinical

0.849 ± 0.009

0.779 ± 0.013

0.726 ± 0.016

0.751 ± 0.012

0.142

BL-4: ResNet-50 (КТ)

0.812 ± 0.013

0.744 ± 0.016

0.683 ± 0.019

0.712 ± 0.015

0.161

BL-5: Конкатенация

0.861 ± 0.009

0.791 ± 0.013

0.738 ± 0.015

0.763 ± 0.012

0.139

PM: Гибридный метод

0.924 ± 0.006

0.861 ± 0.010

0.819 ± 0.012

0.840 ± 0.009

0.108

 

Предлагаемый метод (PM) достоверно превосходит все базовые методы по всем метрикам. Прирост F1-меры составил 7,4 п.п. относительно лучшей базовой линии BL-5 (простая конкатенация признаков), что подтверждает эффективность гибридного аналитического ядра по сравнению с наивной мультимодальной интеграцией. Значительное улучшение Brier Score (0.108 против 0.139 у BL-5) свидетельствует о лучшей калиброванности вероятностных прогнозов, что принципиально важно для клинического применения, где недооценка риска критична.

Существенный прирост относительно BL-2 (XGBoost, +11,0 п.п. F1) обусловлен способностью предлагаемого метода совместно обрабатывать все модальности данных, тогда как XGBoost работает только со структурированными признаками. Сравнение PM с BL-3 (BERT-Clinical, +8,9 п.п. F1) демонстрирует ценность вероятностного компонента и нечёткой логики в гибридном ядре — за счёт них достигается устойчивость, не обеспечиваемая трансформерной архитектурой в одиночку.

Устойчивость к пропускам данных

Особую значимость для клинического применения имеет устойчивость метода к пропускам данных, характерным для реальных медицинских информационных систем. Проведён эксперимент: в тестовую выборку вводились случайные пропуски в диапазоне 10–50% по трём типам — MCAR (случайные), MAR (зависимые от других признаков) и MNAR (зависимые от самого признака). Отслеживается деградация F1-меры относительно базового значения без пропусков.

Таблица 3. Деградация F1-меры при введении пропусков данных (Δ F1 = F1_baseF1_missing), тип пропусков: MAR

Доля пропусков

BL-1 (Log. Reg.)

BL-2 (XGBoost)

BL-3 (BERT-Clin.)

BL-5 (Concat.)

PM (Гибридный)

10%

–0.048

–0.031

–0.027

–0.024

–0.011

20%

–0.093

–0.061

–0.052

–0.047

–0.019

30%

–0.141

–0.094

–0.083

–0.076

–0.031

40%

–0.198

–0.138

–0.121

–0.114

–0.048

50%

–0.267

–0.192

–0.176

–0.163

–0.072

 

Предлагаемый метод демонстрирует значительно более высокую устойчивость к пропускам по сравнению со всеми базовыми методами. При 50%-ном уровне пропусков типа MAR деградация F1 у PM составляет лишь 0.072, тогда как у лучшего из базовых методов (BL-5) — 0.163, то есть в 2,3 раза больше. Столь высокая устойчивость обусловлена вероятностным байесовским слоем в гибридном ядре, реализующим принципиальный механизм работы с неопределённостью: вместо импутации пропущенных значений метод явным образом моделирует неопределённость как случайную величину и учитывает её в итоговом прогнозе [16].

Оценка интерпретируемости методом SHAP

Для оценки интерпретируемости предлагаемого метода применён подход на основе значений SHAP (SHapley Additive exPlanations) [6], позволяющий измерить вклад каждого признака и каждой модальности в итоговый прогноз. Оценивались: согласованность SHAP-объяснений с клинической экспертизой (доля топ-5 признаков по SHAP, совпадающих с клинически значимыми по оценке трёх врачей-экспертов) и стабильность объяснений (корреляция SHAP-профилей для близких по клиническому статусу пациентов).

Предлагаемый метод достиг уровня согласованности с клинической экспертизой 0.84 (84% топ-5 SHAP-признаков подтверждены экспертами как клинически значимые), тогда как у BL-3 (BERT-Clinical) этот показатель составил 0.61. Стабильность объяснений: средняя корреляция SHAP-профилей 0.79 у PM против 0.52 у BERT-Clinical, что свидетельствует о более последовательном поведении модели при схожих клинических паттернах. Среди наиболее часто встречающихся ключевых признаков — уровень лактата, частота дыхания, индекс PaO₂/FiO₂ и оценка по шкале комы Глазго, что соответствует отдельным клинически значимым показателям, используемым при диагностике сепсиса и органной недостаточности.

Анализ критических ошибок классификации

Отдельно проанализированы критические ошибки классификации — случаи ложноотрицательной классификации высокого риска как низкого, что в клиническом контексте означает недостаточное внимание к тяжёлому пациенту. Предлагаемый метод допустил 23 критические ошибки на тестовой выборке (n = 1687), тогда как лучший базовый метод (BL-5) — 33 ошибки. Снижение на 31% статистически значимо (χ² = 4.82, p = 0.028). Анализ 23 ошибочных случаев PM показал, что 19 из них характеризовались долей пропусков > 40% и нетипичными сочетаниями признаков, указывающими на редкие клинические синдромы — ограничение, признаваемое авторами как перспективное направление дальнейших исследований.

АРХИТЕКТУРА ИНТЕГРАЦИИ МЕТОДА В МЕДИЦИНСКИЕ ИНФОРМАЦИОННЫЕ СИСТЕМЫ

Принципы интеграционного решения

Успешное внедрение разработанного метода в клиническую практику предполагает его интеграцию с существующими медицинскими информационными системами — МИС, ЛИС, PACS — без необходимости замены унаследованной инфраструктуры. Для достижения этой цели спроектирован программный интеграционный модуль (ПИМ), реализующий три принципа:

  • Принцип стандартизованного взаимодействия: ПИМ взаимодействует с исходными системами исключительно через стандарт HL7 FHIR R4, обеспечивая совместимость без кастомной доработки сторонних систем [9];
  • Принцип ненавязчивого внедрения: ПИМ работает как независимый микросервис, не изменяя логику существующих МИС и не требуя их замены;
  • Принцип обратной связи: каждый прогноз сопровождается SHAP-объяснением и автоматически передаётся в интерфейс врача через стандартный FHIR-ресурс ClinicalImpression.

Функциональная структура программного интеграционного модуля

ПИМ состоит из четырёх функциональных компонентов, образующих конвейер обработки.

Первый компонент — FHIR-адаптер — осуществляет подписку на события обновления данных пациента в МИС через механизм FHIR Subscriptions R4 и извлечение ресурсов Patient, Observation, DiagnosticReport, ImagingStudy, MedicationRequest, Condition. Адаптер поддерживает как синхронное взаимодействие (REST API), так и асинхронное (FHIR Subscriptions + WebSocket). Это позволяет запускать анализ как в режиме реального времени (при поступлении новых данных), так и в пакетном режиме (обработка исторических данных пациента).

Второй компонент — нормализатор данных — приводит извлечённые FHIR-ресурсы к унифицированному внутреннему формату, необходимому для работы гибридного метода: перекодирование диагностических кодов МКБ-10 в SNOMED CT; конвертация единиц измерения лабораторных показателей в СИ; стандартизация изображений (DICOM → NIfTI → тензор 224×224×3); токенизация текстовых записей для подачи в трансформерный подмодуль.

Третий компонент — аналитическое ядро — вызывает сервис гибридного метода (развёрнутый как gRPC-микросервис) и получает от него: итоговую оценку риска (вероятность от 0 до 1); вектор SHAP-значений для ключевых признаков; лингвистическую интерпретацию от нечёткого слоя («умеренный риск», «высокий риск», «критический»); интервал неопределённости от байесовского слоя.

 

Рисунок 2. Иллюстративная схема формата заключения гибридного метода. Приведённые значения условны и предназначены для демонстрации структуры вывода; авторам следует заменить их реальным примером с комментарием врача-эксперта.

 

Четвёртый компонент — FHIR-экспортёр — формирует ресурс ClinicalImpression (вывод системы о клиническом состоянии пациента) в формате FHIR R4 и записывает его обратно в МИС. Объяснение SHAP представляется в виде DiagnosticReport с вложенными компонентами, что обеспечивает нативное отображение в интерфейсе любой FHIR-совместимой МИС.

Таблица 4. Ресурсы HL7 FHIR R4, используемые в интеграционном модуле

FHIR-ресурс

Направление

Содержание

Компонент ПИМ

Patient

Вход

Демография, идентификатор пациента

FHIR-адаптер

Observation

Вход

Лабораторные показатели, витальные параметры

FHIR-адаптер

DiagnosticReport

Вход/Выход

Текст заключений; SHAP-объяснение

Адаптер / Экспортёр

ImagingStudy

Вход

Ссылки на DICOM-серии в PACS

FHIR-адаптер

MedicationRequest

Вход

Назначения фармакотерапии

FHIR-адаптер

ClinicalImpression

Выход

Прогностическая оценка риска + интерпретация

FHIR-экспортёр

Task

Выход

Уведомление врача при высоком риске (threshold)

FHIR-экспортёр

 

Производительность и масштабируемость

Проведено нагрузочное тестирование ПИМ на сервере с конфигурацией: 8-ядерный CPU AMD EPYC 7302, 64 ГБ RAM, GPU NVIDIA A10G (24 ГБ VRAM). Среднее время ответа на один запрос (от получения FHIR-события до записи ClinicalImpression): 1,8 с при мультимодальном вводе (все четыре модальности) и 0,7 с при структурированных данных без изображения. Пропускная способность: 420 запросов в час в синхронном режиме; до 3 200 запросов в час в асинхронном режиме (пакетная обработка). Для среднего стационара мощностью 500 коек с оборотом ~20 пациентов в сутки ПИМ обеспечивает обработку всего пациентопотока с 12-кратным запасом по производительности.

ЦИФРОВАЯ ТРАНСФОРМАЦИЯ МЕДИЦИНСКОЙ ОРГАНИЗАЦИИ: СИСТЕМНЫЙ АНАЛИЗ

Гибридный метод как компонент цифровой трансформации

Внедрение интеллектуального метода анализа медицинских данных не является изолированным технологическим мероприятием — оно представляет собой один из ключевых элементов цифровой трансформации медицинской организации. С позиций системного анализа цифровую трансформацию МО можно рассматривать как управляемый переход организации из текущего состояния в целевое, в котором процессы оказания медицинской помощи основаны на данных, а принятие клинических решений поддерживается интеллектуальными аналитическими инструментами [3, 11].

Предлагаемый метод вносит вклад в три из пяти измерений цифровой зрелости МО. В измерение «Управление данными и аналитика» — за счёт обеспечения сквозной обработки разнородных медицинских данных и формирования аналитической основы для клинических выводов. В измерение «Цифровизация клинических процессов» — за счёт интеграции в рабочий процесс врача через FHIR-интерфейс и предоставления рекомендаций непосредственно в точке оказания помощи. В измерение «Цифровая культура и компетенции» — за счёт XAI-объяснений, формирующих у медицинского персонала доверие к алгоритмическим рекомендациям.

Этапы внедрения в клиническую практику

На основе анализа практики внедрения интеллектуальных систем в медицинских организациях [10, 11] предложена поэтапная модель внедрения предлагаемого метода, минимизирующая операционные риски и обеспечивающая постепенное накопление клинического доверия к системе.

  1. Пилотный этап (3–6 месяцев): развёртывание ПИМ в режиме «только чтение» — прогнозы формируются, но не отображаются врачу; накопление ретроспективных данных для кастомной дообучения модели на данных конкретной МО.
  2. Этап «теневого» режима (3–6 месяцев): прогнозы системы доступны врачу, но не являются обязательными к исполнению; сбор обратной связи; корректировка порогов алерта; оценка клинической значимости рекомендаций.
  3. Этап частичной интеграции (6–12 месяцев): система активно используется для пациентов группы высокого риска; проводится аудит клинических исходов; формируется champions-сеть из 5–8 врачей-сторонников системы.
  4. Этап полной операционной интеграции (свыше 12 месяцев): система является стандартным компонентом рабочего процесса; регулярное переобучение на новых данных МО; мониторинг дрейфа распределения данных (data drift) и своевременная рекалибровка.

Оценка организационного эффекта

Для количественной оценки организационного эффекта внедрения разработана система ключевых показателей результативности (КПР) по трём уровням:

Таблица 5. Ключевые показатели результативности внедрения гибридного метода

Уровень

Показатель (КПР)

Целевое значение

Метод измерения

Клинический

Снижение 30-дневной летальности (целевая нозология)

≥ 10% к базовому уровню

Ретроспективный анализ ЭМЗ

Клинический

Время от поступления до диагноза (TTA)

Снижение ≥ 15%

Временны́е метки МИС

Аналитический

AUC-ROC системы на данных МО (ежекварт.)

≥ 0.88 (не ниже валидационного)

Offline-тестирование

Аналитический

Доля крит. ошибок (ложноотриц. высокий риск)

≤ 1.5% от всех прогнозов

Аудит прогнозов

Операционный

Удовлетворённость врачей системой (Ликерт 1–5)

≥ 3.8

Ежеквартальный опрос

Операционный

Доля врачей, использующих рекоменд. системы

≥ 70% в течение 18 мес.

Лог МИС

 

Обсуждение

Интерпретация результатов верификации

Полученные экспериментальные результаты подтверждают теоретические положения, сформулированные в предшествующей работе авторов [1], и демонстрируют, что гибридный подход, объединяющий глубокое обучение, вероятностное моделирование и нечёткую логику, даёт синергетический эффект, превосходящий как одномодальные методы, так и простую конкатенацию признаков из разных модальностей. Ключевым фактором превосходства является байесовский слой: он обеспечивает устойчивость к пропускам и позволяет модели явно представлять неопределённость прогноза, что критически важно в клинической среде [16, 18].

Показатель согласованности SHAP-объяснений с клинической экспертизой (0.84) свидетельствует о том, что метод не только обеспечивает высокую предиктивную точность, но и «мыслит» в клинически осмысленных понятиях. Это является принципиальным отличием от подходов типа «чёрного ящика»: врач получает не только оценку риска, но и обоснование, которое он может критически оценить и, при необходимости, оспорить [7, 18].

Ограничения исследования

Необходимо признать ряд ограничений настоящего исследования. Во-первых, значительная часть тестовых данных (MIMIC-III) сформирована на американской когорте, что ограничивает непосредственный перенос результатов на российские клинические данные ввиду различий в протоколах ведения пациентов и составе медикаментозной терапии. Во-вторых, тестирование проводилось на ретроспективных данных; проспективное клиническое испытание, необходимое для окончательной валидации, является предметом следующего этапа исследования. В-третьих, оценка 23 критических ошибочных случаев указывает на сниженную эффективность метода при редких клинических синдромах с нетипичными паттернами признаков — задача, требующая специального дизайна выборки и, возможно, few-shot обучения. В-четвёртых, необходимо уточнить, что количественная верификация, представленная в таблицах 2 и 3 и в разделе об интерпретируемости, выполнена на задаче прогнозирования 30-дневной смертности по данным MIMIC-III; результаты по остальным трём задачам составной тестовой базы (классификация нарушений ритма по данным PhysioNet, прогнозирование риска повторной госпитализации по данным кардиологического отделения, классификация патологии по КТ-изображениям) в настоящей работе не приводятся и являются предметом отдельной публикации по мере завершения соответствующего анализа. В связи с этим обобщённые показатели в аннотации и заключении следует трактовать как относящиеся к верифицированной подвыборке, а не к полной составной когорте. В-пятых, одобрение этического комитета получено для использования данных кардиологического отделения городской больницы; использование данных MIMIC-III и PhysioNet осуществляется в соответствии с их публичными протоколами доступа (data use agreement), а вопрос об одобрении использования КТ-данных прорабатывается авторами отдельно и будет отражён в итоговой версии статьи после получения соответствующего документа. Наконец, не указаны версии программного и аппаратного обеспечения, использованные для обучения и валидации самого гибридного метода (в отличие от нагрузочного тестирования интеграционного модуля, для которого конфигурация приведена в разделе «Производительность и масштабируемость»), а также применённые статистические критерии и программные средства для их расчёта — данная информация будет добавлена авторами в следующей редакции рукописи.

Настоящая работа вносит вклад в задачи научной специальности  «Системный анализ, управление и обработка информации, статистика» по следующим направлениям. В части разработки методов и алгоритмов обработки информации — верифицирован метод анализа мультимодальных клинических данных с количественно подтверждёнными характеристиками качества. В части разработки специального алгоритмического обеспечения — спроектирован интеграционный модуль, обеспечивающий развёртывание метода в реальной информационной среде медицинской организации. В части системного анализа сложных объектов — предложена модель поэтапной цифровой трансформации МО с системой КПР для измерения её результатов.

Заключение

В настоящей работе, являющейся продолжением предшествующего исследования авторов [1], решены задачи экспериментальной верификации гибридного мультимодального метода анализа медицинских данных, разработки архитектуры его интеграции в медицинские информационные системы и обоснования его роли в цифровой трансформации МО.

Экспериментальная верификация на тестовой базе 11 248 пациентов показала, что предлагаемый метод достоверно превосходит все базовые методы: прирост AUC-ROC составил +6,3 п.п., F1-меры — +7,7 п.п. относительно лучшей базовой линии; Brier Score улучшен с 0.139 до 0.108. Метод продемонстрировал в 2,3 раза меньшую деградацию качества при 50%-ном уровне пропусков по сравнению с лучшим из базовых методов. Критические ошибки классификации сокращены на 31% (χ² = 4.82, p = 0.028). Согласованность SHAP-объяснений с клинической экспертизой — 0.84. Разработан программный интеграционный модуль (ПИМ), обеспечивающий бесшовную интеграцию метода с существующими МИС через стандарт HL7 FHIR R4 без замены унаследованных систем. Производительность ПИМ (420–3 200 запросов/час) обеспечивает применимость для стационаров любого масштаба. Предложена четырёхэтапная модель внедрения и система КПР из шести показателей, позволяющая контролировать клинический и организационный эффект трансформации.

Совокупность полученных результатов формирует завершённую методологию: от теоретического обоснования метода [1] к его экспериментальной верификации, инженерной реализации и организационному внедрению. Дальнейшие исследования направлены на: (1) проспективное клиническое испытание на российских клинических данных; (2) разработку механизмов адаптивного переобучения при обнаружении дрейфа данных (data drift); (3) расширение архитектуры для обработки геномных данных в задачах прецизионной медицины.

 

Список литературы:

  1. Poltavtseva M. A., Amran M. A. M. Approach to the analysis of medical data // Universum: technical sciences. - 2026. - No. 3. (Previous work of the authors.)
  2. Moor M. et al. Foundation models for generalist  medical artificial intelligence // Nature. — 2023. — Vol. 616, No. 7956. — P. 259–265..
  3. Rajpurkar P., Chen E., Banerjee O., Topol E. J. AI in health and medicine // Nature Medicine. — 2022. — Vol. 28, No. 1. — P. 31–38.
  4. Wornow M. et al. The shaky foundations of large language models and  foundation models for electronic health records // npj Digital Medicine. — 2023. — Vol. 6. —  Art. no. 135.
  5. Johnson A. E. W. et al. MIMIC-III, a freely accessible critical care database // Sci. Data. — 2016. — Vol. 3. — Art. no. 160035.
  6. Lundberg S. M., Lee S.-I. A unified approach to interpreting model predictions // Advances in Neural Information Processing Systems. — 2017. — Vol. 30.
  7. Ribeiro M. T., Singh S., Guestrin C. 'Why should I trust you?': Explaining the predictions of any classifier // Proc. KDD. — 2016. — P. 1135–1144.
  8. Siam M. K. et al. Multimodal Models in Healthcare: Methods, Challenges and Opportunities // Information. — 2025. — Vol. 16, No. 11. — Art. no. 971.
  9. Krones F. et al. Review of Multimodal Machine Learning Approaches in Healthcare // Information Fusion. — 2025. — DOI:10.1016/j.inffus.2024.102690.
  10. Chen W., Howard K., Gorham G., O’Bryan C. M., Coffey P., Balasubramanya B., Abeyaratne A., Cass A. Design, effectiveness, and economic outcomes of contemporary chronic disease clinical decision support systems: a systematic review and meta-analysis // Journal of the American Medical Informatics Association. — 2022. — Vol. 29, No. 10. — P. 1757–1772.
  11. Ardic N., Dinc R. Emerging trends in multi-modal artificial intelligence for clinical decision support: a narrative review // Health Informatics Journal. — 2025. — Vol. 31, No. 3. — P. 1–16.
  12. Стародубов В. И., Сидоров К. В., Зарубина Т. В., Швырев С. Л., Королева Ю. И., Раузина С. Е. Методика оценки уровня информатизации медицинской организации // Менеджер здравоохранения. — 2017. — № 8.
  13. Goldberger A. L. et al. PhysioBank, PhysioToolkit, and PhysioNet: components of a new research resource for complex physiologic signals // Circulation. — 2000. — Vol. 101, No. 23. — P. e215–e220.
  14. Singhal K. et al. Large language models encode clinical knowledge // Nature. — 2023. — Vol. 620, No. 7972. — P. 172–180..
  15. Amann J., Vetter D., Blomberg S. N. et al. To explain or not to explain? — Artificial intelligence explainability in clinical decision support systems // PLOS Digital Health. 2022. — Vol. 1, No. 2. — Art. e0000016.
  16. Jungo A. et al. Uncertainty quantification in deep learning for clinical decision support // Medical Image Analysis. — 2022. — Vol. 82. — Art. no. 102601.
  17. Oss Boll H. et al. Graph neural networks for clinical risk prediction based on electronic health records: a survey // Journal of Biomedical Informatics. — 2024. — Vol. 151. — Art. 104616.
  18. Salih A. M., Boscolo Galazzo I., Gkontra P., Rauseo E., Lee A. M., Lekadir K., Radeva P., Petersen S. E., Menegaz G. A review of evaluation approaches for explainable AI with applications in cardiology // Artificial Intelligence Review. — 2024. — Vol. 57, No. 9. — Art. 240.
  19. Teo Z. L., Jin L., Liu N. et al. Federated machine learning in healthcare: a systematic review on clinical applications and technical architecture // Cell Reports Medicine. — 2024. — Vol. 5, No. 2. — Art. 101419.
  20. Zacarias-Morales N., Pancardo P., Hernández-Nolasco J. A., Garcia-Constantino M. Artificial neural network, attention mechanism and fuzzy logic-based approaches for medical diagnostic support: a systematic review // AI. — 2025. — Vol. 6, No. 11. — Art. 281.
Информация об авторах

д-р. техн. наук, доц., проф.,
Санкт-Петербургский политехнический университет Петра Великого,
РФ, г. Санкт-Петербург
E-mail: poltavtseva@ibks.spbstu.ru
https://orcid.org/0000-0001-9659-1244

Doctor of Engineering Sciences, Assoc. Prof., Professor,
Peter the Great St. Petersburg Polytechnic University,
Russia, St. Petersburg

аспирант Института кибербезопасности и защиты информации,
Санкт-Петербургский политехнический университет Петра Великого,
РФ, г. Санкт-Петербург
E-mail: amran.ma@edu.spbstu.ru
https://orcid.org/0009-0006-5045-9778

Postgraduate student
of the Institute of Cyber Security and Information Protection,
Peter the Great St. Petersburg Polytechnic University,
Russia, St. Petersburg

ISSN 2311-5122. Метаданные статей журнала размещаются на платформе eLIBRARY.RU.
Св-во о регистрации СМИ: ЭЛ № ФС77-91806 от 17.06.2026
Учредитель журнала: ООО «Юниверсум»
Главный редактор - Звездина Марина Юрьевна.
Top