AI 在临床开发中,哪些工作已经值得认真尝试?
判断 AI 是否值得尝试,需要同时看任务有没有实际痛点、输出能否核查,以及公开研究究竟评估了什么。一个方向已有研究支持,并不等于任意工具在本团队都能稳定工作;但也足以帮助团队选择更具体的试点。
第一类值得认真测试的工作,是公开证据的检索与整理。
试验登记、论文和既有文档分散在不同位置,团队常需要重复寻找、提取和比较。一个有限范围的工作流,可以固定来源,输出关键字段与证据位置,再人工核查。这里的价值需要用实际审核和返工时间测量,不能仅凭生成速度宣布成功。
对文献引用尤其要区分“生成一个看起来像引用的字符串”和“检索到真实记录”。已有针对特定配置的生成引文研究记录了虚构和错误。选用系统时,应了解它是在检索来源,还是凭模型生成文献名称。公开研究的历史错误率,也不能直接套到当前产品。
现阶段值得认真尝试的,是那些能够把具体资料变成可检查成果的工作。
第二类是逐条件的试验相关性辅助判断。
2024 年发表于 Nature Communications 的TrialGPT 研究评估了检索、条件匹配与排序,也开展有限的医生辅助任务评估。研究提示这类工具值得在明确场景中测试,但评估材料和临床任务有边界;它不能证明所有医院都能获得相同收益,也不能确认最终入组。
如果团队尝试这一方向,输出应按条款给出依据和未知,而不是只有一个匹配分数。需要临床人员评估缺失资料、病情变化、其他方案条件和实际中心可用性。对患者资料的访问与处理,也要结合具体工作环境安排。公共材料测试与真实医疗工作,不能沿用同一套默认假设。
第三类是已有文档的一致性与可追溯性检查。
可以测试 synopsis、方案和访视表之间的用词、日期与安排差异,或检查每项终点是否对应数据采集。结构化的信息有助于建立这些连接。ICH M11 的共同方案结构提供整理背景,但不会自动证明任何生成工具具备合规能力。
这类工作适合从已解决的历史问题开始验收。给系统同一批文档,检查能否找到真实差异、是否产生大量不存在的问题,以及审核者是否容易回到原文。样例应覆盖扫描质量差、复杂表格、长句和不同版本,不只测试文字清楚的片段。
暂时不能用一个通用结论概括的,是自动优化完整开发策略。
预测研究成功率、确定样本量、挑选中心或生成外部对照,涉及不同模型、数据和统计假设。每种用途都需要相应证据与验证。一个系统能写出合理解释,并不说明它对这些问题都已经被证实有效。
建议把每项候选工作按三层证据记录:公开研究证明了什么,本地测试观察了什么,最终业务结果是否已经测量。三层不能相互替代。发布论文说明有研究证据;试点准确说明本地任务表现;减少返工或改善执行,则需要自己的记录。
团队也可以设置清楚的试点退出条件:关键错误无法稳定识别,原文不能定位,审核成本过高,或输入覆盖与实际工作不相称。停止一个不合适的试点,有助于把资源集中在真正可用的任务上。
现阶段值得认真尝试的,是那些能够把具体资料变成可检查成果的工作。每次只承诺一个明确用途,通过真实材料和完整审核过程决定是否扩大。这样既能利用已出现的研究进展,也能保留对自身工作负责的判断。
本文面向临床开发专业读者,仅为行业信息分享,不构成具体业务、医疗或投资建议。