返回

文章详情

LLM评估者验证存在性,而非缺失:AI临床记录中的遗漏盲点

Hacker News2026年9月2日 11:07

查看PDF HTML(实验性)摘要:环境AI书写者起草临床记录,已发布的审计发现其主要错误是遗漏:即遭遇中确定但记录中未反映的信息。标准检查是LLM评估者:第二个模型将记录与抄本进行阅读并标记问题。我们询问评估者是否能够检测到遗漏。公共语料库无法提供答案:其临床医生参考记录和抄本在实质上存在差异。我们的基准有500对来自审计事实表的单一错误记录,其中298个确实缺少命名事实,还有202个被添加或更改的控制记录。在八种评估者设计下,配对辨别(有缺陷的记录与其干净的双胞胎,0.5为转盘)在添加或更改内容上的得分为0.79-0.94,遗漏的得分为0.50-0.63。在单一记录上,任何设计都没有比完美记录更可靠地标记遗漏。措辞变化、投票和GEPA提示优化移动了操作点,但没有产生可用的检测方法。重组任务使其得以恢复:列出抄本中确定的事实,然后检查记录。两种方法独立到达这一目标并存在权衡:逐事实管道和一个GEPA演化提示,在一次调用中完成相同任务。该管道的标记命名缺失的事实及其严重性,假警报率为2.7%。单次请求检测更多(36.9%对比24.6%,p=0.002),假警报率为6.2%,每条记录的成本仅为十分之一。一位医生作者验证了70项内容,当两条路线出现分歧时,在10个中有10个上支持管道(p=0.002)。另一位临床医生(非作者)盲目评估了严重性标准,并在一个级别上达成一致。针对来自伴随普查的真实供应商记录,没有基准阈值的转移,但重新校准的单次请求检测的结果超过了八个中的最佳者,其假警报率为一半。其事实在其他地方被重述的遗漏会打败这两条路线。我们发布基准、提示和判断。评论:97页,8个图表。数据集:这个https URL。代码:这个https URL。伴随论文:“三分之一的记录:三个已部署AI书写者的验证普查,以及计数该普查的工具”主题:计算与语言(cs.CL);人工智能(cs.AI)ACM类:I.2.7引用为:arXiv:2608.31016 [cs.CL](或arXiv:2608.31016v1 [cs.CL]作为此版本)https://doi.org/10.48550/arXiv.2608.31016 arXiv发布的DOI通过DataCite(待注册)提交历史来自:Sebastian Fox [查看邮件] [v1] 2026年8月31日星期一 15:59:54 UTC(337 KB)

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡