同行 | npj Digital Medicine | 2026-03-10 | DOI 10.1038/s41746-025-02180-2
English Title: An artificial intelligence-powered learning health system to improve sepsis detection and quality of care: a before-and-after study

这篇 npj Digital Medicine 真正值得发的点,不是“又一个败血症 AI 模型分数不错”,而是作者把 AI 放进了一套能持续反馈的医院质控系统里。它要解决的不是单次预测,而是一个更难的临床管理问题:医院怎样才能持续发现败血症、减少漏识别、改进编码、再把这些变化真正反映到死亡率上。
作者在瑞士洛桑大学医院(CHUV)搭建了一套 Sepsis Learning Health System, SLHS。核心不是一个床旁报警器,而是一条闭环:标准化败血症路径 + HERACLES 算法 + 动态看板 + 人工复核。HERACLES 每 6 小时 回顾性读取电子病历片段,把住院过程分成“无败血症、可能败血症、确诊败血症”三类,再把结果送入仪表盘,供感染科团队和各病区持续改进诊疗流程。
核心结论: 这篇论文最重要的贡献,不是把败血症“预测准确率”再往上抬一点,而是展示了 AI 作为医院学习系统的一部分 可能怎样真正改变护理质量。作者分析了 97,559 次 SLHS 病区住院和 25,851 次 对照病区住院后发现:在部署 SLHS 的病区,败血症 ICD-10 编码显著上升,HERACLES 标记的败血症住院其院内死亡和 90 天死亡都下降,而对照病区没有出现相同趋势。它更像是一项“AI 驱动的制度实施证据”,而不是一句简单的“模型优于医生”。
作者: Jérémie Despraz, Raphaël Matusiak, Sylvain Meylan 等,CHUV Sepsis consortium
通讯作者: Sylvain Meylan
单位: Lausanne University Hospital(CHUV)Biomedical Data Science Center / Infectious Diseases Service,联合 Swiss Data Science Center
正式发表日期:2026-01-20。研究类型:单中心、前瞻性观察性、准实验性 before-and-after 研究
要点速览
1. 研究对象: CHUV 自 2020 年到 2024 年的住院数据;SLHS 注册库最终覆盖 97,559 次住院、57,180 名患者,对照病区为 25,851 次住院。
2. 系统结构: 不是单一预警算法,而是 标准化败血症路径 + HERACLES 表型识别 + 动态看板 + 专家复核 的学习闭环。
3. 模型表现: HERACLES 内部验证中,确诊败血症识别的 F1 最高到 0.71,后稳定在 0.68,precision 0.76、recall 0.62、AUROC 0.88。
4. 真实世界变化: SLHS 部署后,败血症 ICD-10 编码从 2.62% 升到 4.48%;在完全位于 SLHS 病区的住院中,从 1.55% 升到 3.58%。
5. 结局变化: HERACLES 标记的败血症住院里,院内死亡从 22.21% 降到 17.76%,90 天死亡从 29.75% 降到 25.01%;而对照病区未见同方向显著改善。
图解结果脉络
这篇文章的主线很清楚:图1 先解释为什么它不是一个孤立模型,而是一个学习型医疗系统;图2 再展示部署过程和 HERACLES 的识别性能;图3 最后回到这类系统真正该交代的终点:编码有没有变、死亡率有没有变、变化是否只发生在部署病区。
![]() |

图1:真正的创新不在“模型”,而在把 AI 放进医院会学习的闭环
图意: 图1最重要的是把这篇论文和普通“败血症预警模型”区分开。它不是做完算法就结束,而是把算法放进学习型医疗系统里,形成临床实践、数据、反馈、再实践的闭环。
1. 作者先画出了 Learning Health System 的“良性循环”:临床实践产生数据,数据变成知识,知识再回流到临床。
2. 在这个框架里,HERACLES 只是中间一环。它结合 Random Forest + LSTM,对每个患者住院过程中的 6 小时片段 进行表型判断。
3. 真正推动改变的是看板和人工监督。模型输出会生成质控指标,让临床团队看见“哪些病区、哪些环节、哪些病例”在掉链子,然后再反过来改路径和执行。
对应结论: 这篇论文最值得记住的第一点,是 AI 在这里被定义成“组织学习工具”,而不是一个直接替代临床判断的床旁黑箱。
![]() |

图2:HERACLES 有用,但它的价值更像“稳定抓住问题”,不是完美判案
图意: 图2把两件事放在一起看:一是系统在不同病区逐步落地,二是算法在落地过程中到底能做到什么水平。
1. 到 2024 年底,SLHS 注册库已经纳入 97,559 次住院。到 2024 年 8 月,共有 1043 次疑似败血症事件 被标准化路径记录,分布在 961 次住院 里。
2. HERACLES 对确诊败血症的内部验证表现是:F1 先升到 0.71,后稳定在 0.68,precision 0.76、recall 0.62、AUROC 0.88。这不是“几乎完美”,但足以支撑质控级监测。
3. 作者还做了更苛刻的外部测试。对 2020 年隔离病房 83 名患者、119 次住院 的全量人工标注数据,HERACLES 对确诊败血症的 recall 只有 0.27、precision 0.60、F1 0.37。这说明它并不适合被神化成“无漏检临床预警器”。
4. 但在 2022-2023 年 1345 次带败血症 ICD 编码的住院 测试里,它又表现出另一种特征:recall 0.83,识别出 1113/1345 例,真正被打成“无败血症”的只有 6 例,更多漏差落在“可能败血症”而不是完全漏掉。
对应结论: 图2最重要的读法不是“模型分数高不高”,而是“它更适合做持续监测和流程改进,而不是单枪匹马做即时床旁诊断”。
![]() |
图3:最关键的证据不是识别率,而是部署后编码和死亡率是否真的改变
图意: 图3是全篇最有分量的一张图,因为它真正回到了医疗系统层面的结果。
1. 在部署 SLHS 的病区,败血症 ICD-10 编码明显上升。包含 SLHS 病区的住院里,编码比例从 2.62% 升到 4.48%,OR 1.19;完全位于 SLHS 病区的住院中,从 1.55% 升到 3.58%,OR 1.27。而对照病区从 0.64% 到 0.78%,没有显著变化。
2. 对 HERACLES 标记为高概率败血症的住院,院内死亡在 SLHS 病区下降。包含 SLHS 病区的住院从 22.21% 降到 17.76%,OR 0.93;完全位于 SLHS 病区的住院从 20.54% 降到 15.27%,OR 0.89。
3. 90 天死亡也同步下降:包含 SLHS 病区的住院从 29.75% 降到 25.01%,OR 0.94;完全位于 SLHS 病区的住院从 32.99% 降到 26.11%,OR 0.91。对照病区则没有看到同等方向的显著改善,院内死亡甚至呈上升趋势。
对应结论: 这张图支撑的是“部署型 AI 系统可能带来制度层面的收益”,但它仍然不是随机对照证据,不能直接写成“HERACLES 造成死亡率下降”。
正文脉络
败血症一直是最典型的“大家都知道要早识别,但现实里很难一直做好”的临床问题。指南早就把及时抗生素、液体复苏和 bundled care 讲得很清楚,可真正落到医院运转里,问题往往不在知识缺失,而在识别不稳定、执行不统一、回顾依赖编码、反馈太慢。作者抓住的恰恰是这里:如果医院只能靠事后 ICD 编码来理解自己的败血症表现,那它看到的永远是一个失真的、滞后的质量图景。
所以这篇论文最聪明的地方,不是再做一个孤立预测器,而是把 AI 变成了败血症学习系统中的“中间基础设施”。HERACLES 不是实时床旁报警,而是每 6 小时回顾性计算一次败血症概率,把每次住院切成连续片段去看。它的结果不直接替代临床决策,而是进入 sepsis registry、仪表盘和路径评估,用来支持团队发现漏识别、观察编码变化、追踪病区表现,再用这些反馈去优化后续流程。
这一定位决定了这篇文章不能只看 AUROC。内部验证里,HERACLES 的确诊败血症识别可以做到 AUROC 0.88,看上去不差;但真正重要的是外部测试暴露出的边界。在隔离病房全量人工标注的独立测试集中,它对确诊败血症的召回只有 0.27,说明这套系统并不能被包装成“高敏感、可直接上线的实时报警工具”。但换个角度看,它又很少把真正的病例直接打成“无败血症”,更多时候是落在“可能败血症”上。这种行为模式更像一个偏保守的流程支持工具,而不是终局裁判。
也正因为作者没有把它包装成万能预警器,图3的结果才更有价值。部署 SLHS 后,败血症 ICD-10 编码明显上升,而 HERACLES 标记的败血症事件比例总体并没有同样幅度的上涨。这种组合意味着,变化很可能不是“医院突然多出了更多败血症”,而是“原来被漏掉或记不全的病例,被更稳定地识别并记录出来了”。对于败血症这样的高波动、高依赖流程执行的病种,这个改变量本身就很重要,因为没有更可靠的识别和记录,就谈不上真正的质量改进。
更进一步,死亡率的方向也和这个解释一致。在 SLHS 病区中,HERACLES 标记为高概率败血症的住院,其院内死亡和 90 天死亡都下降,而对照病区没有出现同方向改善。这个结果足以让人认真看待这套系统的制度价值,但还不够支撑强因果结论。作者自己也写得比较克制:这是单中心、准实验、before-and-after 设计,对照病区和部署病区病种结构不同,无法像随机试验那样隔离所有混杂因素。所以更稳妥的说法应该是,这套 AI 驱动的学习系统与更好的识别、记录和结局变化相关,而不是它已经被严格证明“直接降低了死亡率”。
从编辑角度看,这篇文章真正值得转述给读者的一点,是它把“AI in medicine”从单点模型竞赛,推进到了组织层面的学习能力。很多医疗 AI 论文到最后还是在比模型谁更准,但这篇工作更接近现实世界:医院要的不是一个永远分数更高的静态模型,而是一套能被持续更新、被人理解、能驱动流程改变、还能反过来修正自身的系统。HERACLES 当前还只能回顾性运行,还不是实时干预工具;但它已经展示了一个更有前景的方向,即 AI 不是作为额外负担叠加到临床,而是作为医院自我改进机制的一部分存在。
因此,这篇论文最值得记住的,不是“败血症 AI 又多了一个模型”,而是:当 AI 被嵌进标准化路径、质控看板和人工反馈环里,它可能不只是提高识别率,而是在改变医院如何学习自己的失败与改进。 对医疗系统来说,这比单次预测更接近真正可持续的价值。
最后落点
如果把这篇论文压缩成一句最稳的判断,它真正证明的不是“AI 已经能完美预测败血症”,而是:AI 作为学习型医疗系统中的一环,可能帮助医院更稳定地识别、记录和持续改进败血症照护。
下一步真正决定这条路能不能更大规模落地的,不是再把 AUROC 往上提一点,而是要把这类系统做成更强的实时闭环,并在多中心、可比较的环境里验证它是否还能保持同样的收益。
术语解释
Learning Health System: 学习型医疗系统。核心不是单次决策,而是让日常临床数据持续回流,推动流程和结果一起改进。
HERACLES: 本文的败血症识别算法,会把住院过程中的 6 小时片段分类为无败血症、可能败血症或确诊败血症。
F1-score: 综合 precision 和 recall 的指标。越高说明模型在“抓到病例”和“不过度误报”之间平衡得越好。
AUROC: 用来衡量模型区分阳性和阴性的整体能力。
ICD-10 编码: 医院结算和病案记录中的诊断编码。败血症编码增加不一定代表病更多,也可能代表识别和记录更完整。
准实验 before-and-after 研究: 不是随机对照,而是在部署前后比较趋势,因此能提示真实世界改进,但不能像 RCT 那样直接确立因果。
风险提示:本文为论文解读与信息整理,不构成医疗建议。
原文链接:https://doi.org/10.1038/s41746-025-02180-2
本文荟萃自,只做学术交流学习使用,不做为临床指导,本文观点不代表数字重症 ICU.CN立场。



微信扫一扫