没有哪个行业比医学吸引更响亮的 AI 营销宣传,也没有哪个行业对它的惩罚更严厉。一款过度承诺的销售工具,代价是一个糟糕的季度;而一款过度承诺的临床工具,代价是信任,有时甚至更多。因此,任何对医疗健康领域 AI 的诚实梳理,都必须从把这个领域分成三堆开始:哪些已经部署并奏效,哪些确实前景可期但仍处于早期,哪些不过是披着白大褂的新闻稿。
好消息是,第一堆如今是实实在在的。曾经在夜晚才能写完病历的临床医生,正在真实的诊室里使用环境记录助手。过去要花数周筛选论文以完成文献综述的研究人员,如今能在数小时内完成这项筛选。医疗系统正在自动化那些行政管道工作(排班、接诊登记、随访电话),这些工作本就从来不需要医生亲自去做。
本文将逐一梳理这三堆,并列出正在实际发挥作用的具体工具。这里链接的所有内容都来自我们的目录,你可以在其中浏览完整的241 款医疗健康与生命科学 AI 工具合集。
临床记录:医疗健康 AI 真正体现价值之处
从医学中最不起眼的问题说起:病历。每一次就诊都会产生文书,多年来一个老梗是,医生整天看病,而真正的活儿——打字——却留到晚上做。
环境记录助手正面攻克这个问题。[Nabla](/zh/ai-agent/nabla) 聆听临床对话并起草病历,提供环境采集、口述录入和实时智能,旨在提升文书质量和编码准确性。它的既定目标并非未来主义式的医学,而是减轻行政负担和临床医生的职业倦怠——这告诉你究竟是谁在真正购买它,以及为什么。
Abridge 也在同一片领域耕耘,其部署实证值得第一手阅读。UVM Health Network 案例研究报告称,在推行 Abridge 的环境文书记录后,临床医生的满意度提升了 53%。这个数字之所以重要,恰恰在于它衡量的是临床医生的工作生活,而不是模型的跑分。
诚实的注意事项是:环境记录助手负责起草,而非签字。每一份病历在进入病历档案之前,仍需临床医生审阅;一个把剂量或否定语(“无胸痛”对“胸痛”)听错的记录助手,会产出一个看起来很规整的错误。这些工具足够好,能省下实实在在的时间;但还没好到可以跳过通读复核——任何严肃的厂商也都不会这样宣称。
文献研究:另一个已经奏效的部署
第二堆稳固的成果属于研究人员,他们有自己版本的文书难题:文献增长的速度比任何人的阅读速度都快。
[Elicit](/zh/ai-apps/elicit-ai-for-scientific-research) 可跨越超过 1.38 亿篇学术论文进行检索,将系统性文献综述的部分环节自动化,并把论文中的数据提取为结构化表格。对医疗用途而言最重要的细节是句级引用:每一条论断都指向来源中确切的那句话,因此核实只需一次点击,而不是一种信仰行为。
[Consensus](/zh/ai-apps/consensus-ai-for-research) 以不同的角度切入同一个问题:它是一个覆盖同行评审文献的搜索引擎,旨在用已发表研究的实际发现来回答问题,并在此之上叠加了筛选和摘要功能。当你需要大规模提取和筛选时,用 Elicit;当你想就某个具体问题快速获得一份有来源支撑的文献解读时,用 Consensus。
两者都无法取代真正系统性综述中的判断性抉择:纳入标准、质量评估、权衡相互矛盾的发现。它们压缩的是机械性的中间环节,而你仍应把提取出的数据与原始论文逐一抽查核对,因为提取错误往往是悄无声息的。
在研究的写作环节,[Trinka AI](/zh/ai-apps/trinka-ai) 是一款专为学术、技术和医学写作打造的语法与语言检查工具,配有改写、查重和投稿就绪度检查功能。它比通用型助手更为专精,而这正是它的价值所在。
如果这是你的日常工作,有两个浏览页值得收藏:面向研究人员的 AI 工具和用于文档摘要的工具。
行政自动化:不光鲜,却悄然成为最大的应用面
在医疗系统中部署 AI 最安全的地方,是所有那些不需要临床判断的患者交互环节:排班、福利咨询、出院随访、诊疗缺口外联。这里也正是工作量所在。
[Hippocratic AI](/zh/ai-agent/hippocratic-ai-healthcare-agent) 正是为这片领域打造生成式智能体,覆盖照护管理、患者接触和再入院预防等用例,服务于医疗系统、支付方和制药公司。值得研究的设计决策是:它的智能体不做诊断、也不开处方。这条约束不是需要致歉的局限,而是该产品能够真正落地部署的根本原因——公司报告称,迄今已完成超过 1.8 亿次临床互动。
在医疗健康 AI 领域,最先规模化的工具,正是那些在监管者出手之前就已为自己划定边界的工具。
在支付方一侧,Oscar 的案例研究描述了利用 AI 自动化医疗保险流程并降低成本。理赔相关的文书工作是另一个风险偏财务而非临床的领域,因此迭代成本低廉。
生命科学公司也在内部上演着同样的打法。Moderna 部署的 ChatGPT Enterprise 是一次全组织范围的生产力推广,而非临床应用。而 Novo Nordisk 案例研究报告称,在药物研发中把临床文书工作从数周缩短到了数分钟。事实证明,监管文书本质上是一个文档问题,而文档问题正是当前模型最擅长处理的。
这里的注意事项是升级转接。一个面向患者的智能体,其安全性只取决于它的转接交接:当一通福利咨询电话变成“对了,我一直有胸痛”的那一刻,系统需要一条经过测试、而不仅仅是设计出来的人工通道。
药物发现:真科学,长引信
结构预测是 AI 在生物学中做到某件此前根本不可能之事的最清晰案例。[AlphaFold 3](/zh/ai-model/alphafold-3-google-deepmind) 预测蛋白质结构及其与其他分子的相互作用,而 [ESMFold2](/zh/ai-model/esmfold2-protein-structure-prediction) 则从氨基酸序列预测高分辨率的全原子三维结构,并对其模型开放访问。
作为研究工具,它们已经部署并奏效:结构生物学家使用它们,就像其他人使用搜索一样。但作为一条药物管线,引信很长。一个预测出来的结构是一个假设,而非一个分子;湿实验室验证、合成和临床试验仍横亘在模型输出与患者之间,而这些阶段没有一个因为第一步变快就随之缩短。把这一堆归类为:对研究人员而言今天就已奏效,作为改变最终抵达临床之物的途径则前景可期但仍处于早期。
规模化诊断:诚实的“尚未”
诊断 AI 是营销声浪最响、而部署实况最单薄之处,这道鸿沟是结构性的,而非模型质量的问题。一款诊断工具是一种受监管的医疗器械。它必须在每个使用它的场所的人群和设备上证明自己,融入临床工作流程,并回答当它出错时会发生什么这一责任问题。
这些都并非不可能。狭窄用途的诊断辅助工具如今就存在于医疗系统之中。但“AI 读你的影像”作为一种消费级规模的现实,是一个第二堆的说法,却被以第一堆的自信在兜售。耐人寻味的是,本文中已在运作的部署都聚集在文书、研究和行政周围:在这些地方,一个错误输出会被工作流程中本已存在的人工审核环节所拦截。
| 类别 | 代表性工具 | 2026 年的现状 |
|---|---|---|
| 临床记录 | Nabla、Abridge | 已部署并奏效。病历仍需临床医生签字确认 |
| 文献研究 | Elicit、Consensus、Trinka | 已部署并奏效。判断性抉择仍留给人类 |
| 行政与患者运营 | Hippocratic AI、Oscar | 已大规模部署。安全性系于转接升级路径 |
| 药物发现 | AlphaFold 3、ESMFold2 | 对研究人员而言已奏效。距离改变临床还有数年 |
| 规模化诊断 | 无 | 狭窄用途的辅助工具已存在。宽泛的宣称跑在了部署前面 |
如何把营销和产品区分开
有几个模式,能把你买得到的医疗健康 AI 和那些主要只是一个落地页的医疗健康 AI 区分开来。
- 产品会声明它不做什么。Hippocratic AI 以“不做诊断、不开处方”作为主打,是一种可信度信号,而不是弱点。
- 证据会指名一次部署。一份来自具体医疗系统的案例研究,胜过一个没有分母、没有人群、也没有作者的准确率百分比。
- 工作流程会把人纳入其中。让任何厂商向你完整演示临床医生审阅、修正并签署输出的那一刻。如果演示跳过了这一步,产品也就跳过了它。
- 健康养生要被标注为健康养生。[Headspace](/zh/ai-apps/headspace)(引导式冥想、睡眠资源、一个 AI 伴侣,外加真人辅导和治疗)和 [Rosebud](/zh/ai-apps/rosebud)(一款 AI 日记应用,用提示和模式洞察把你的记录反照给你)对自己的定位都很诚实。危险信号不是健康养生应用的存在,而是健康养生应用借用了它们并未挣得的临床用语。
要在不被厂商公告淹没的情况下跟上最新动态,NEJM AI Grand Rounds 是个好习惯:与在机器学习和临床实践交叉点工作的人对话,其怀疑程度正是这个领域应有的水准。
常见问题
如今医疗健康领域到底把 AI 用在了哪里?
2026 年真正有实际影响力的部署是:环境临床文书记录(如 Nabla 和 Abridge 等工具起草就诊病历)、文献研究(用 Elicit 和 Consensus 查找并筛选论文),以及行政自动化(如 Hippocratic AI 等智能体处理排班、接诊登记和随访)。诊断 AI 以狭窄的、受监管的形式存在,但其部署广度远不及营销所暗示的那样。
什么是 AI 医疗记录助手,病历是否仍需审阅?
AI 医疗记录助手聆听医生与患者的对话,自动起草临床病历,通常还附带编码建议。是的:每一份草稿在进入病历档案之前,都需要临床医生审阅并签字确认。它的价值在于节省起草时间,而不是省去审阅这一步。
AI 研究工具用于医学文献综述时可信吗?
像 Elicit 和 Consensus 这样的工具会把输出扎根于已发表的论文,而且 Elicit 提供句级引用,让论断能够对照来源加以核实。它们能可靠地压缩检索和筛选工作,但纳入决策、质量评估以及对矛盾证据的解读,仍应留给研究人员,提取出的数据也值得抽查核对。
AI 会取代医生吗?
当前的部署图景中没有任何迹象指向那个方向。今天奏效的工具,是在临床工作周围卸下文书、检索和行政负担,而不是去执行临床工作本身。而且最成功的厂商都明确地把产品设计成不做诊断、不开处方。近期的变化是医生手头的文书更少了,而不是医生更少了。
一家诊所在购买之前应如何评估一款医疗健康 AI 工具?
在真实条件下、针对你最棘手的工作流程进行试点;要求提供来自可比机构的部署实证,而非跑分数字;并在任何患者数据流入之前,把数据处理条款(保留期限、训练用途、业务伙伴协议)落成书面。然后再比较各个备选方案:我们的目录列出了241 款医疗健康与生命科学 AI 工具,并按其功能进行了标注。