AI-CURA:用大语言模型自动化ACMG变异判读与文献证据整合

AI-CURA用LLM自动化ACMG变异判读,提升罕见病基因诊断效率与一致性。

原文标题:用大语言模型重构ACMG判读流程:AI-CURA如何自动完成变异分类与证据整合

原文作者:数据派THU

冷月清谈:

香港基因组研究院团队在《Science Translational Medicine》发表 AI-CURA,一套面向遗传变异致病性分类的大语言模型自动化工作流。系统将 ACMG/AMP 指南拆分为规则引擎层和 LLM 推理层:前者自动处理13条无需文献支持的规则,后者针对7条依赖文献解释的规则进行证据抽取与判定。研究比较了 DeepSeek-R1 与 o3-mini-high,结果显示 DeepSeek-R1 在灵敏度、透明推理、本地部署和医疗数据安全方面更适合作为核心模型。在 ClinGen 专家注释的150个变异集合上,AI-CURA 最终分类一致率达96.0%,临床等效诊断一致率达99.3%;在 ClinVar 冲突变异重分析中,也能为70%的变异给出明确分类。文章认为,AI-CURA 有望缓解罕见病基因诊断中文献检索和证据整合的瓶颈,但目前仍主要覆盖孟德尔病 SNV 和短插入缺失,对图形、复杂表格及家系共分离证据处理仍有限。

怜星夜思:

1、AI-CURA 这类系统如果进入医院,应该是“辅助医生”还是可以直接给出诊断结论?
2、用 DeepSeek-R1 这类开源模型做医疗判读,本地部署是否比闭源大模型更有优势?
3、ACMG 规则里大量依赖文献证据,AI 自动读文献会不会放大论文质量参差不齐的问题?
4、“测序一次、动态解读”听起来很理想,但现实中患者数据长期重分析该怎么收费和管理?

原文内容

图片
来源:ScienceAI
本文约1500字,建议阅读5分钟
为罕见病基因诊断与变异重分析提供高效、可解释的解决方案。


在临床遗传学的实际工作流中,变异分类并不只是数据库匹配问题,而是一个高度依赖文献证据解释的过程。变异致病性分类需人工检索、解读海量文献,单例全基因组测序的人工解读平均耗时约 4 小时,是基因诊断流程的主要瓶颈。

在此背景下,由香港基因组研究院团队开发了AI-CURA——一套基于大语言模型(LLM)的遗传变异自动化分类工作流,以「AI-CURA, an automated LLM workflow for high-accuracy genetic variant classification」为题,于 2026 年 6 月 24 日发布在《Science Translational Medicine》。

论文链接:https://www.science.org/doi/10.1126/scitranslmed.adz4172

AI-CURA

随着全基因组测序在临床罕见病中的普及,如何高效解读数以万计的基因变异成为难点。美国遗传与基因组学院(ACMG)/分子病理学会(AMP)发布的指南将变异分类细分为20条证据规则,但其中许多(约 35%)依赖于文献证据解释。

AI-CURA 立足于这一背景,旨在建立一套自动化系统,以 LLM 辅助完成这些复杂规则的判定,将基因组数据与不断更新的知识库绑定,实现「测序一次、动态解读」的诊断流程。这种思路类似将临床专家的文献查阅和判读步骤转化为计算流程,提高效率和一致性。

图 1: AI-CURA 中自动化 ACMG 框架整体设计示意图。

AI-CURA 整体分为两部分:规则引擎层和 LLM 推理层

  • 规则引擎层自动执行 13 条无需文献的 ACMG 规则(占65%),包括等位基因频率证据、预测打分等。

  • LLM推理层处理 7 条需文献支持的规则:PVS1(RNA)、PS2/PM6、PS3、PS4、PM3、PP1、PP4。使用两种大型语言模型(DeepSeek-R1 和 o3-mini-high)进行文献摘要和证据提取。并针对每条规则设计专门 prompt 和辅助知识库,将 ClinGen 推荐、已知基因/表型关联信息整合进数据库。


在 7 条文献依赖规则的测试中,两款模型均达到 100% 特异性(无支持证据时不误判),DeepSeek-R1 灵敏度全面优于 o3-mini-high。经过精心优化的 DeepSeek-R1 几乎不遗漏文献支持证据,并且未引入错误判定。

最终,模型确认了 DeepSeek 作为核心 —— 其具备透明的分步推理过程、开源可本地部署(满足医疗数据安全要求),综合表现更优。对于那些需要深入理解的图像,团队额外开发了原型模块,通过 Claude-4.0-Sonnet 将文献中的家系图、复杂表格转换为文本,再接入主流程处理,弥补纯文本 LLM 无法解读图形证据的短板。

ClinGen 验证与实际应用

研究团队在 ClinGen 专家注释的 150 个变异集合上测试了 AI-CURA 的分类效果。该集包括多个 ACMG 分类标签的变异,均已由专业团队给出最终诊断。在这个测试中,AI-CURA 需要为每个变异应用所有 ACMG 规则并输出综合分类。

DeepSeek-R1 的 ACMG 规则应用完全一致率为 84.0%,最终分类一致率达 96.0%;若按临床等效标准(致病 / 可能致病视为同一临床等级),诊断一致率高达 99.3%,远优于不同实验室人工解读的平均差异水平。

图 2:AI-CURA 在 ClinGen 变异体分类及 ClinVar 冲突变异体重分析中的表现。

这些结果显示:DeepSeek-R1 在整个分类流程中高度再现了专家判断,几乎涵盖了所有致病证据。即便在少数出现规则级差异的案例,大多数也没有改变最终的判定,可见该系统临床可接受性很高。

表 1: AI-CURA 对 150 个 ClinVar 变异体重新分析的性能。

最后,研究模拟了 AI-CURA 对已有冲突解释的 ClinVar 变异的复诊情境。选取了 150 个 ClinVar 中包含多种分类冲突的变异,将 AI 结果与原始解释对比。

DeepSeek-R1 成功为 70% 的变异明确分类,最终分类与人工解读的一致率达98.7%,可有效提升未确诊病例的重分析诊断率。

加速罕见病诊断

仅从当下来看,AI-CURA 还有许多不足。它目前仅支持孟德尔病的单核苷酸变异、短插入缺失,对文献中的图形、复杂表格信息提取能力不足,家系共分离等依赖图形的规则准确率偏低。

但它在透明性、安全性等方面做的极好,框架的扩展也相当灵活。总体而言,AI-CURA 代表了基因组诊断流程的一个新范式:基因组数据不仅是一次性结果,而应视作能随着知识增长而持续释放价值的「活数据」。

编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



回答“辅助医生还是直接诊断”这个问题:我倾向于先定位成辅助医生。遗传变异判读牵涉患者表型、家族史、检测质量、数据库时效性,AI-CURA 能把证据整理得很快,但最后签字的人最好还是临床遗传医生。

2 个赞

动态解读有点像手机系统更新:你以为只是点一下,其实背后有服务器、版本管理、兼容性测试。只不过这里更新的不是表情包,而是可能改变一个家庭命运的诊断结果。

1 个赞

这个问题有点像自己做饭还是点外卖:本地部署更可控,但你得有厨房、有厨师、有食材管理。闭源模型方便,但医疗数据这锅菜,真不是随便送出去加工的。

我觉得开源模型最大的好处不是“便宜”,而是可审计。医院至少能知道模型、prompt、知识库、版本是怎么变的。闭源 API 今天表现好,明天更新一下输出风格变了,临床验证就很麻烦。

2 个赞

针对“AI 读文献会不会放大低质量论文”的担心,我认为会,而且这是核心风险之一。模型擅长提取文字证据,但不一定能像专家一样判断研究设计、样本量、家系质量和统计可信度。

1 个赞

也别神化本地部署。本地跑模型需要算力、运维、安全审计,还要有人持续更新医学知识库。很多医院信息科可能一听 GPU 集群就开始头疼。

3 个赞

我觉得 AI 反而可能让问题更透明。以前人工判读时,不同实验室引用哪些文献、怎么理解,外人未必看得清。AI-CURA 如果能把每条证据来源列出来,至少方便复核和追责。

2 个赞