当前位置: 首页 > news >正文

Nature正刊!| 基于可追溯推理的智能体系统重塑罕见病诊断

引言

罕见疾病影响着全球超3亿人,却长期深陷诊断困境——患者平均要经历长达5年以上的诊断奥德赛,反复转诊、误诊和治疗延误是常态。这背后是疾病的高度异质性、病例稀缺以及临床医生认知有限等多重挑战。

近日,一项发表于Nature的研究带来了突破性解决方案。由上海交通大学、新华医院等团队联合开发的DeepRare系统,构建了一个基于大语言模型的多智能体诊断决策支持框架。它不仅能处理自由文本、标准化表型术语和基因检测结果等多模态临床输入,更可生成带排名、且推理过程透明可追溯的诊断假设,在涵盖14个专科的2919种罕见病评估中展现出卓越性能,其诊断准确率甚至超越了资深临床专家

基本信息

  • 文章标题:An agentic system for rare disease diagnosis with traceable reasoning
  • 期刊:Nature
  • 影响因子:64.8
  • 发表时间:2026年2月18日
  • 研究单位:上海交通大学;上海交通大学医学院附属新华医院;上海人工智能实验室;哈佛医学院;中南大学湘雅医学院附属儿童医院
  • Github地址:https://github.com/MAGIC-AI4Med/DeepRare
  • 论文地址:https://doi.org/10.1038/s41586-025-10097-9

研究内容与方法

一、数据集构建与预处理

  1. 数据集来源

    • 公开数据集:RareBench(含MME、HMS、LIRICAL、RAMEDIS子集)、MyGene2、DDD、MIMIC-IV
    • 内部临床数据集:新华医院数据集、湖南医院数据集
  2. 预处理流程

    • 罕见病过滤:通过大语言模型(LLM)判断病例是否属于罕见病,代码片段:

      deffilter_rare_disease(case,llm_model):prompt=f"判断以下病例是否为罕见病:{case['text']},仅返回'是'或'否'"response=llm_model.invoke(prompt)returnresponse.strip()=="是"
    • 信息完整性过滤:移除无法提取有效HPO术语或无明确诊断的病例

    • 数据集划分:按时间顺序划分为测试集和相似案例库,代码片段:

      defsplit_dataset(dataset,test_ratio=0.2):sorted_dataset=sorted(dataset,key=lambdax:x['record_time'])split_idx=int(len(sorted_dataset)*(1-test_ratio))train_lib=sorted_dataset[:split_idx]test_set=sorted_dataset[split_idx:]returntrain_lib,test_set

二、系统整体架构设计

DeepRare系统三层架构示意图

系统采用三层模块化架构,参考Model Context Protocol(MCP)设计:

  1. 中央主机层:搭载记忆库的LLM核心,负责协调整个诊断流程、整合多源证据并生成最终诊断结果
  2. Agent服务器层:多个专业化功能Agent,负责执行特定子任务(如表型提取、知识检索)并与外部环境交互
  3. 外部数据源层:包含医学文献库、罕见病知识库、临床病例库、基因变异数据库等,为诊断提供权威证据支撑

三、核心诊断工作流程

系统诊断分为两个核心阶段,主流程代码片段:

defdeeprare_diagnosis(patient_input,central_host,agents,data_sources):# 阶段1:多源信息收集collected_evidence=collect_information(patient_input,central_host,agents,data_sources)# 阶段2:自反式诊断推理final_diagnosis,reasoning_chain=self_reflective_diagnosis(collected_evidence,central_host)returnfinal_diagnosis,reasoning_chain
1. 信息收集阶段

并行处理表型与基因型输入,实现多模态证据整合

  • 表型信息收集子流程

    1. HPO标准化:将自由文本临床描述转换为标准化HPO术语
    2. 知识与案例检索:调用知识搜索器、案例搜索器获取相关医学证据
    3. 专业表型分析:调用第三方工具生成初步诊断建议
  • 基因型信息收集子流程

    1. VCF文件注释:对原始基因变异文件进行功能、频率、致病性注释
    2. 变异优先级排序:基于群体频率、致病性预测、功能影响等指标排序变异
    3. 表型-基因型关联:LLM解释变异结果并关联表型特征
  • 证据整合与记忆更新:将所有收集到的证据存入中央主机记忆库,代码片段:

    defcollect_information(patient_input,central_host,agents,data_sources):evidence={}# 表型信息处理if'phenotype'inpatient_input:hpo_terms=agents['phenotype_extractor'].extract(patient_input['phenotype'])evidence['hpo']=hpo_terms evidence['knowledge']=agents['knowledge_searcher'].search(hpo_terms)evidence['similar_cases']=agents['case_searcher'].search(hpo_terms)evidence['pheno_analysis']=agents['phenotype_analyser'].analyse(hpo_terms)# 基因型信息处理if'genotype'inpatient_input:annotated_variants=agents['genotype_analyser'].annotate(patient_input['genotype'])evidence['genomics']=annotated_variants# 更新中央主机记忆库central_host.memory.update(evidence)returnevidence
2. 自反诊断阶段

基于记忆库证据生成诊断并进行自我验证,公式与代码结合:

  • 初步诊断生成:中央主机基于记忆库证据生成初步诊断列表,公式:
    D′=Ahost(P^,M∣<prompt>5)D' = A_{host}(\hat{P}, M | <prompt>_5)D=Ahost(P^,M<prompt>5)
    其中P^\hat{P}P^标准化表型集合MMM记忆库证据<prompt>5<prompt>_5<prompt>5诊断生成提示词

  • 自反验证与迭代:LLM对初步诊断进行合理性验证,若诊断不合理则重新收集证据,代码片段:

    defself_reflective_diagnosis(evidence,central_host):# 生成初步诊断initial_diag=central_host.generate_initial_diagnosis(evidence)# 自反验证诊断合理性reflection_prompt=f"验证以下诊断是否合理,若不合理请说明证据缺口:{initial_diag}\n证据:{evidence}"reflection_result=central_host.invoke(reflection_prompt)ifreflection_result['is_valid']:final_diag=initial_diagelse:# 针对证据缺口补充收集信息new_evidence=central_host.collect_more_evidence(evidence,reflection_result['gap'])final_diag=central_host.generate_initial_diagnosis(new_evidence)# 生成带可追溯参考的推理链reasoning_chain=central_host.generate_reasoning(final_diag,evidence)returnfinal_diag,reasoning_chain
  • 推理链后处理:验证推理链中参考链接的有效性,移除无效链接以减少幻觉

四、各Agent服务器的实现细节

1. 表型提取器(Phenotype Extractor)
  • 核心功能:将自由文本临床描述转换为标准化HPO术语

  • 实现步骤

    1. LLM提取候选表型实体:从文本中提取未归一化的症状/表型
    2. BioLORD归一化映射:将候选实体映射到HPO术语库,代码片段:
    defnormalize_hpo(candidate_terms,biolord_model,hpo_vocab):normalized_terms=[]fortermincandidate_terms:term_emb=biolord_model.encode(term,convert_to_tensor=True)# 计算与HPO词汇的余弦相似度sim_scores=torch.cosine_similarity(term_emb,hpo_vocab['embeddings'],dim=1)top_idx=torch.argmax(sim_scores).item()ifsim_scores[top_idx]>=0.8:normalized_terms.append(hpo_vocab['terms'][top_idx])returnnormalized_terms
2. 疾病归一化器(Disease Normalizer)
  • 核心功能:将自由文本疾病名称映射到Orphanet/OMIM标准化疾病ID
  • 实现逻辑:通过BioLORD计算疾病名称与标准化词汇的余弦相似度,阈值0.8以上保留映射结果
3. 知识搜索器(Knowledge Searcher)
  • 核心功能:检索医学文献、知识库中的权威诊断证据

  • 实现流程

    1. 多源检索:依次调用通用搜索引擎(Bing/Google)、专业医学数据库(PubMed/Orphanet/OMIM)
    2. 结果过滤与摘要:用轻量LLM提取关键信息并过滤非医学内容,代码片段:
    defsummarize_knowledge(web_pages,llm_model):summarized_evidence=[]forpageinweb_pages:prompt=f"提取以下网页中与罕见病诊断相关的关键信息,非医学内容返回'无效':{page['content']}"summary=llm_model.invoke(prompt)ifsummary!='无效':summarized_evidence.append({'content':summary,'url':page['url']})returnsummarized_evidence
4. 案例搜索器(Case Searcher)
  • 核心功能:从病例库中检索与输入表型相似的临床案例

  • 实现流程

    1. 初始检索:用OpenAI text-embedding-3-small编码HPO术语,基于余弦相似度取Top50候选病例
    2. MedCPT重排:用MedCPT-Cross-Encoder重新排序候选病例,代码片段:
    defrerank_cases(query_hpo,candidate_cases,medcpt_model):query_emb=medcpt_model.encode(query_hpo,convert_to_tensor=True)scored_cases=[]forcaseincandidate_cases:case_emb=medcpt_model.encode(case['hpo_terms'],convert_to_tensor=True)sim_score=torch.cosine_similarity(query_emb,case_emb,dim=0).item()scored_cases.append((case,sim_score))# 按相似度降序排序取Top10scored_cases.sort(key=lambdax:x[1],reverse=True)return[caseforcase,_inscored_cases[:10]]
    1. 相关性验证:用LLM验证候选病例与输入的临床相关性
5. 表型分析器(Phenotype Analyser)
  • 核心功能:集成专业表型分析工具生成诊断建议

  • 集成工具实现

    • PhenoBrain:通过API调用,输入HPO术语返回Top5罕见病诊断建议

    • PubCaseFinder:通过API调用,匹配PubMed病例库返回Top5诊断结果

    • Zero-shot LLM推理:用LLM基于HPO术语生成零样本诊断建议,代码片段:

      defzero_shot_pheno_diagnosis(hpo_terms,llm_model):prompt=f"基于以下HPO术语,给出Top5罕见病诊断建议:{hpo_terms}"response=llm_model.invoke(prompt)returnparse_diagnosis_response(response)
6. 基因型分析器(Genotype Analyser)
  • 核心功能:处理VCF文件,完成基因变异注释与优先级排序

  • 实现流程

    1. 调用Exomiser框架:集成gnomAD、PolyPhen-2、SIFT等数据源完成变异注释
    2. 变异优先级排序:基于群体频率、致病性预测、功能影响等指标排序,代码片段:
    defrun_exomiser(hpo_terms,vcf_path,exomiser_config):# 调用Exomiser命令行工具执行分析cmd=f"exomiser-cli --analysis FULL --hpo{hpo_terms}--vcf{vcf_path}--config{exomiser_config}"result=subprocess.run(cmd,shell=True,capture_output=True,text=True)# 解析Exomiser输出的排序后变异结果ranked_variants=parse_exomiser_output(result.stdout)returnranked_variants

五、关键技术模块实现

1. 参考链接验证模块
  • 核心功能:验证推理链中参考链接的有效性,减少幻觉,代码片段:

    defvalidate_references(references):valid_refs=[]forrefinreferences:try:response=requests.head(ref['url'],timeout=5)ifresponse.status_code==200:valid_refs.append(ref)exceptrequests.exceptions.RequestException:continuereturnvalid_refs
2. 可追溯推理链生成
  • 核心逻辑:为每个诊断结果生成包含证据来源、推理步骤的结构化推理链,公式:
    {D,R}=Ahost(D,I^,M∣<prompt>8)\{D, R\} = A_{host}(D, \hat{I}, M | <prompt>_8){D,R}=Ahost(D,I^,M<prompt>8)
    其中RRR可追溯推理链I^\hat{I}I^标准化多模态输入<prompt>8<prompt>_8<prompt>8推理链生成提示词

实验结果分析

DeepRare在基于HPO表型的诊断任务中全面超越现有方法

【性能基准测试:在诊断API、通用LLM、推理增强型LLM、医学调优LLM和智能体系统之间的比较评估。】

DeepRare在基于人类表型本体(HPO)的罕见病诊断任务中展现出卓越性能。在涵盖多个公共数据集的综合评估中,DeepRare的平均Recall@1达到57.18%,显著优于所有基线方法。

  • 智能体架构优势显著:DeepRare的智能体系统设计使其性能远超单一模型方法,证明了在复杂诊断推理中协调多个专业智能体的价值。
  • 推理能力是关键:具备显式推理链的推理增强型LLM(如Claude-3.7-Sonnet-thinking)普遍优于其通用版本,表明透明的推理过程有助于提升诊断准确性。
  • 规模与泛化性:通用大语言模型(如GPT-4o, DeepSeek-V3)的表现意外地超过了专门针对医学领域调优的较小模型(如Baichuan-M1),这可能反映了参数规模和更广泛训练数据带来的优势。
  • 跨数据集稳健性:如图所示,DeepRare在来自文献、病例报告和真实临床中心的所有八个测试数据集上均保持领先,特别是在RareBench-MME和RareBench-RAMEDIS数据集上Recall@1分别达到78%和71%,优势明显。
    【 基于HPO的跨数据集评估及DeepRare的比较性能。a, 在七个公共罕见病登记库上的诊断准确性;b, 在新华医院队列上的优异性能一致性。】

DeepRare在跨专科和长尾疾病诊断中表现优异

【跨14个人体系统的诊断准确性比较。】

DeepRare的诊断能力覆盖广泛的医学专科。根据MedlinePlus分类法对病例按14个专科系统进行分析,结果显示DeepRare在几乎所有专科中都大幅领先于基线模型。

  • 专科优势:在内分泌系统(准确率60% vs 第二名的32%)和消化系统(准确率49% vs 34%)等类别中,DeepRare表现出显著优势。其在肾脏和泌尿系统诊断中表现最佳(准确率66%),而在呼吸系统相对较低(31%),反映了其临床应用的边界。
  • 攻克长尾难题:针对数据稀疏的“长尾”疾病(病例数≤10),DeepRare展现出强大的泛化能力。对于31.8%的此类疾病,其Recall@1超过0.8,显著优于DeepSeek-V3(23.5%)和DeepSeek-R1(26.6%)。而专门的医学LLM(Baichuan-M1)在此设定下表现不佳,仅对2.5%的尾部疾病达到高召回率。
    【病例数超过10的疾病级别的召回性能比较,显示DeepRare的持续优越性。】

DeepRare整合基因数据提升诊断精度,其推理链获临床专家高度认可

【使用HPO和基因数据输入的诊断性能与基线方法及仅HPO输入的比较。】

当输入结合HPO表型和全外显子组测序(WES)基因数据时,DeepRare的诊断性能得到大幅提升。

  • 多模态输入增益:在新华医院数据集上,Recall@1从仅使用HPO时的39.9%跃升至69.1%;在湖南医院数据集上,从33.3%提升至63.6%
  • 超越专业工具:在与同样处理HPO和基因数据的生物信息学工具Exomiser的直接比较中,DeepRare在新华医院数据集上以69.1%的Recall@1显著优于Exomiser的55.9%,在湖南医院数据集上也以63.6%优于58.0%
    DeepRare的核心优势之一是生成透明、可追溯的推理链。由10位罕见病副主任医师对180个病例的评估显示:
  • 高证据准确性:在病例层面,参考文献的平均准确率达到95.4%,表明系统提供的诊断证据高度可靠且与决策直接相关。
  • 失败模式分析:对200个诊断失败案例的分析揭示了主要挑战。最常见的失败模式是“推理权重错误”(41.0%),即逻辑正确但对特定表型的权重分配欠佳;其次是“表型模拟诊断”(38.5%),体现了高表型重叠疾病区分的固有难度。而核心推理事实错误(2.5%)或证据链接错误(2.5%)则很少见,证明了系统核心知识和检索能力的稳健性。

优势与局限

优势

诊断性能卓越:在涵盖2,919种罕见病的多中心评估中,DeepRare的Recall@1平均达57.18%,显著超越现有最佳方法,并在与专家对比中展现出更高的诊断准确率。
推理过程透明可追溯:系统生成诊断假设的同时,提供基于可验证医学证据(如文献、指南、病例)的推理链,专家评审显示其证据事实性同意率高达95.4%,增强了临床可信度。
多模态输入与强泛化能力:系统能灵活处理自由文本、结构化HPO术语及基因组数据(VCF文件),并在来自亚欧美不同临床中心的真实世界数据上表现稳定,具备良好的跨人群与跨场景泛化能力

局限

知识检索机制有待优化:当前系统对表型信息进行聚合检索,未来可探索更精细、自适应的检索策略以进一步提升诊断精度,尤其在处理高度相似的表型时存在误判可能。
功能覆盖尚不全面:系统主要服务于已怀疑罕见病但未确诊的场景,在非专科场景下的初步“筛查”能力尚未充分验证和评估,限制了其在更早期诊断环节的应用。
系统复杂性与部署成本:多智能体架构整合了超过40种专业工具与知识源,并依赖大语言模型进行协调与推理,增加了系统的训练与部署复杂度,对计算资源要求较高

参考文献

  1. RareBench: Can LLMs Serve as Rare Diseases Specialists?Chen et al., 2024:该论文构建了包含多个公开数据源的罕见病诊断基准,是本研究进行跨数据集评估和性能比较的核心基准之一。DeepRare系统在RareBench的多个子集上进行了全面测试,其评估框架为本研究提供了重要的性能衡量标准

  2. Exomiser: Next-generation diagnostics and disease-gene discoverySmedley et al., 2015:本文介绍了Exomiser工具,用于整合表型(HPO)和基因型数据进行变异优先级排序和疾病诊断。本研究将Exomiser作为基因分析模块集成到DeepRare系统中,并在多模态输入场景下将其作为关键基线进行比较,证明了DeepRare的优越性能。

  3. MDAgents: An adaptive collaboration of LLMs for medical decision-makingKim et al., 2024:该论文提出了一个用于医疗决策的多智能体LLM协作框架。本研究将MDAgents作为现有智能体系统的代表进行对比,凸显了DeepRare在罕见病诊断这一特定任务上设计的专有架构和性能优势

  4. DeepSeek-V3 Technical ReportDeepSeek-AI et al., 2024:该技术报告详细介绍了DeepSeek-V3大型语言模型的架构与能力。本研究采用DeepSeek-V3作为DeepRare系统默认的中央宿主(Central Host)模型,其强大的推理和指令遵循能力是支撑整个智能体系统高效运行的基础。

  5. Model Context Protocol (MCP)Anthropic, 2025:该协议提出了一种用于构建LLM智能体系统的模块化架构标准。DeepRare的三层系统架构设计灵感来源于MCP,其“中央宿主-智能体服务器-外部数据源”的分层模式确保了系统的模块化、可扩展性和工具集成的灵活性

http://www.jsqmd.com/news/1320775/

相关文章:

  • Translumo:打破语言障碍的终极Windows实时屏幕翻译工具
  • 用于光束切趾的圆锯齿光阑
  • 来潮汕游玩怎么挑选本地导游?费用、预约、避坑完整攻略 - 纯玩旅游推荐官
  • 石家庄有哪些靠谱封闭式文武学校?完整名单整理,怎么报名入学? - 全国文武学校招生
  • 2026年财务章丢了需要登报吗?登报需要多少钱?一文说清
  • 3分钟掌握浏览器Cookie导出:Get-cookies.txt-LOCALLY本地安全指南
  • 2026 黄山考生异地单招复读怎么选?合肥共达食宿一体化封闭教学 - 教育为先
  • 归因分析实战:从差值法到因果推断,系统解析指标贡献度计算
  • 2026唯品会消费信用卡优惠全解析:合规服务商盘点、优质品牌推荐及申办避坑指南大全 - 行业观察网
  • 2026广州吊车租赁避坑:选型计费实体店攻略 - 观金堂
  • 佛山电缆回收行情速览:2026正规商家报价实测 - 广东再生资源回收
  • 如何一键获取国家教育平台的电子课本PDF文件?
  • 如何打造你的个人游戏管家:FitGirl游戏启动器完整使用指南
  • 2026年全封闭武校管理模式解读:寄宿制文武学校日常安排参考 - 圣龙武术朱老师
  • 2026美橡品浴室柜定制十大实力口碑榜,备婚新人照着选不踩坑,实力测评推荐 - 工业品网
  • 蓝速科技|2026 翻译机选购指南,按场景挑选适配机型
  • 文件上传漏洞渗透实战:BP与Python脚本双解法
  • 欧姆龙CJ2M-CPU15在EV电池分选机中的高速控制应用
  • 3分钟搞定Honey Select 2完整中文体验:一站式汉化增强解决方案
  • 武汉全封闭复读学校推荐|武汉襄五 2027 高考复读名校班、清北班办学优势 - 湖北找学校
  • 终极指南:如何彻底卸载Windows Edge浏览器并防止自动恢复
  • 2026芜湖高端宝马维保旗舰门店推荐 - 一知资讯
  • 2026年邯郸市格力商用空调选购梳理:御华风尚等正规企业信息汇总 - 品牌推荐达人
  • 2026 新南昌红谷滩防水补漏本地业主房屋修缮靠谱团队甄选指南 - 超人防水
  • 2026年RTU遥测终端哪家好?基于5大维度的品牌实力对比与选型指南 - 资讯综合
  • 海口爱马仕鞋服包包首饰回收哪家靠谱,2026二手爱马仕行情报价、避坑技巧与正规门店盘点 - 全国二奢机构参考
  • 3分钟彻底清理Windows“此电脑“:MyComputerManager终极免费解决方案
  • 从流量入口变迁,看昆明互加科技本地定制化GEO优化的现实意义 - 精彩城市
  • 大数据5V特征深度解析:从理论到实战的技术架构与工程挑战
  • 3分钟免费解锁Wand完整功能:游戏修改器终极方案指南