返回

文章详情

医疗领域大型语言模型的安全性与可靠性

Nature2026年8月19日 00:00

Gommers, J. 等. 在MASAI研究中,比较支持AI的乳腺X光筛查与不支持AI的标准双重阅读之间的间隔癌、敏感性和特异性:一项随机、对照的非劣效性、单盲、基于人群的筛查准确性试验。兰塞特 407 , 505–514 (2026). 文章 PubMed Google Scholar Lu, M. Y. 等. 多模态生成AI副驾驶用于人类病理学。自然 643 , 466–473 (2024). 文章 ADS CAS PubMed PubMed Central Google Scholar Singh, R., Bapna, M., Diab, A. R., Ruiz, E. S. & Lotter, W. AI在FDA授权的医疗设备中的应用:跨越1,016项授权的分类。NPJ数字医学 8 , 388 (2025). 文章 PubMed PubMed Central Google Scholar Griot, M., Vanderdonckt, J. & Yuksel, D. 在电子健康记录中实施大型语言模型。PLOS数字健康 https://doi.org/10.1371/journal.pdig.0001141 (2025). Armitage, H. 临床医生可以通过新的AI软件ChatEHR与医疗记录进行“聊天”。斯坦福医学 https://med.stanford.edu/news/all-news/2025/06/chatehr.html (2025). Moor, M. 等. 用于通用医疗人工智能的基础模型。自然 616 , 259–265 (2023). 文章 ADS CAS PubMed Google Scholar Clusmann, J. 等. 医学中大型语言模型的未来格局。医学通讯 3 , 141 (2023). 文章 PubMed PubMed Central Google Scholar Bubeck, S. 等. 人工通用智能的火花:与GPT-4的早期实验。预印本 https://doi.org/10.48550/arXiv.2303.12712 (2023). Singhal, K. 等. 使用大型语言模型朝着专家级医学问答。自然医学 31 , 943–950 (2025). 文章 CAS PubMed PubMed Central Google Scholar Gu, Y. 等. 准备状态的错觉:对大型前沿模型在多模态医学基准上的压力测试。预印本 https://doi.org/10.48550/arXiv.2509.18234 (2025). 该研究显示医学LLM基准可能高估真实世界的准备状态,因为基准未能捕捉到脆弱性和推理缺陷。 Omar, M. 等. 多模型保证分析显示大型语言模型在临床决策支持中对对抗性幻觉攻击高度脆弱。医学通讯 5 , 330 (2025). 文章 PubMed PubMed Central Google Scholar Bedi, S., Jiang, Y., Chung, P., Koyejo, S. & Shah, N. 大型语言模型中的医学推理的保真度。JAMA网络开放 8 , e2526021 (2025). 文章 PubMed PubMed Central Google Scholar Goh, E. 等. GPT-4对改善医生在患者护理任务中的表现的辅助:一项随机对照试验。自然医学 31 , 1233–1238 (2025). 文章 CAS PubMed PubMed Central Google Scholar McDuff, D. 朝着准确的鉴别诊断与大型语言模型。自然 642 , 451–457 (2025). 文章 ADS CAS PubMed PubMed Central Google Scholar Tu, T. 等. 朝着对话式诊断人工智能。自然 642 , 442–450 (2025). 文章 ADS CAS PubMed PubMed Central Google Scholar Palepu, A., 等. 探索用于专家级肿瘤学护理的大型语言模型。NEJM AI 2 , AIcs2500025 (2025). 文章 Google Scholar Singhal, K. 等. 大型语言模型编码临床知识。自然 620 , 172–180 (2023). 文章 ADS CAS PubMed PubMed Central Google Scholar Thirunavukarasu, A. J. 等. 医学中的大型语言模型。自然医学 29 , 1930–1940 (2023). 文章 CAS PubMed Google Scholar Van Veen, D. 等. 调整后的大型语言模型可以在临床文本摘要中超过医学专家。自然医学 30 , 1134–1142 (2024). 文章 PubMed PubMed Central Google Scholar Tierney, A. A. 等. 环境人工智能抄写员:一年后的学习和超过250万次使用。NEJM Catal. Innov. Care Deliv. https://doi.org/10.1056/CAT.25.0040 (2025). 文章 Google Scholar Heinz, M. V. 等. 用于心理健康治疗的生成AI聊天机器人的随机试验。NEJM AI 2 , AIoa2400802 (2025). Google Scholar Comanici, G. 等. Gemini 2.5:通过高级推理、多模态、长上下文和下一代主动能力推动前沿。预印本 https://doi.org/10.48550/arXiv.2507.06261 (2025). Zakka, C. 等. Almanac — 临床医学的检索增强语言模型。NEJM AI 1 , AIoa2300068 (2024). 文章 Google Scholar Wiest, I. C. 等. 大型语言模型用于胃肠病和肝病的临床决策支持。自然评论 消化病学与肝病 22 , 773–787 (2025). 文章 Google Scholar Ferber, D. 等. 用于肿瘤学临床决策的自主人工智能代理的开发与验证。自然癌症 6 , 1337–1349 (2025). 该研究为医疗保健中的第一个模块化LLM代理框架之一,集成生物医学工具和知识库用于临床决策。 文章 CAS PubMed PubMed Central Google Scholar Ge, J. 等. 使用检索增强生成的大型语言模型聊天界面的肝病特定开发。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡