AI 做临床开发,哪些任务值得先交给它?
临床开发团队选择第一个 AI 任务时,最值得优先考虑的,是能否在看到结果之后迅速确认它有没有做对。任务有明确材料、明确输出和明确审核人,才容易从一次演示走向持续使用。
可以先把工作分成三类:整理已有信息,提出供人讨论的备选方案,以及影响正式研究或医疗的决定。三类任务需要不同的核查方式。把一项试验的入排标准转成对比表,与决定放宽某条标准,涉及的判断和后果明显不同。
一个好的起点,是限定范围的证据整理。
例如,给定五项登记记录,提取研究人群、对照、终点和主要限制;或者从指定论文中提取主要结果及其对应表格。输出应保留原文位置、来源版本和无法确定的事项。AI 先形成可检查的表,负责人再核对关键单元格。
另一个可考虑的任务,是对现有文本做一致性检查。例如比较 synopsis 与访视表是否出现不同的评估时间点,或者发现同一缩写在不同章节有不同含义。这里要区分机械检查与专业结论:数字是否一致可以直接核对;评估安排是否科学合理,还需要医学、统计和运营判断。
能稳定交付一张可靠的证据表,已经可以成为下一步的基础。
让任务带着验收标准开始。
对试验对比表,可以要求每个事实都有来源,没有记载的内容写“公开资料未说明”;对方案检查,可以要求每个问题指明两个相关位置,并解释为什么可能存在矛盾。禁止让系统为了填满表格而补造字段。引用看起来完整也需要核实,既往研究记录过特定模型配置生成虚构文献或错误引文的情况。Scientific Reports 的原始研究支持把引用验证设为独立步骤;它不能代表所有当前模型的错误率。
评估是否值得继续时,建议同时记录初稿时间、审核时间和返工时间。单看生成速度,会漏掉清理错误所需的工作。还可记录关键条件遗漏、来源定位失败和未经支持的推断。对会改变人群定义或研究结论的错误,单独分析,比把所有错误平均成一个总分更有帮助。
设想一个内部试点:使用一组既有资料,比较当前人工流程与 AI 辅助流程的最终交付质量。先由团队定义必须正确的内容,再固定资料和输出格式。这个建议是一种试点设计,不是本团队已经取得节省时间的结果。测试材料应覆盖长句、否定条件、例外和版本差异,不能只有容易的样例。
涉及正式证据或决策时,要重新定义使用范围。
FDA 于 2025 年发布、核对时仍列为草案的药物监管决策 AI 指导文件,提出围绕具体使用情境和风险评估模型可信度。内部检索助手与为监管结论产生关键数据的模型,不应仅凭同一个“AI”标签采用相同评估方式。
团队可以为每个任务写一段简短说明:“使用哪些输入,产生什么输出,谁审核,允许支持什么决定,遇到缺失资料如何处理。”把这段说明放在工作入口,比只给一条很长的提示词更容易保持边界。
第一次采用 AI,值得从一个有真实需求、来源可查、结果可复核的任务开始。当审核工作确实减少,错误也被理解,再逐步扩展范围。能稳定交付一张可靠的证据表,已经可以成为下一步的基础。
本文面向临床开发专业读者,仅为行业信息分享,不构成具体业务、医疗或投资建议。