烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究( 三 )


烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究5. 怎么撰写文章从这些表格我们可以看到 , 这类人工智能模型与医学结合的临床研究用的就是诊断准确性试验那一套 , 最好遵循STARD规范 。 涉及的统计方法不难 , 一般指标是准确率、假阳性率、灵敏度、特异度、阳性预测值、阴性预测值等 , 一般要做的图有混淆矩阵、ROC曲线、校准曲线、DCA曲线等 。 数据量的大小 , 数据如何划分 , 标签是否合理这几个上游层面的东西会更加重要 。
6. 总结这项研究构建了一个实时检测胃癌的程序 , 个人感觉是要迈向工程化的 。 文章还提供了网址() , 声称临床医生和患者还可通过公共网站免费访问开放共享的GRAIDS系统 , 并根据提示自行上传内镜图片 , 重新评估已有诊断的准确性 。 但不知道这个是否只针对内网还是什么其他原因 , 目前无法访问 。
有关人工智能和医学结合的文献研究一般噱头都会比较大 , 一些评价指标动辄90%以上 , 大有取代医生的势头 。 我们不必太在意 , 因为这些数据都是经过研究目的做过特定分类 , 比现实场景单纯许多 , 我们更需要批判地去阅读 。
就这项研究 , 起码有两项可以继续提升的地方 , 一是假阳性率高的问题 , 在前面已经说过了 。 二是可以抽取不同亚组再训练 。 这项研究的判别任务是是否胃癌 , 这对于明显的进展期癌症应该是很容易的 。 但程序应该不能准确判定这个可疑的病灶是早癌还是一般炎症、糜烂 , 也不能具体指明其他良性病灶属于什么 。 研究者可以抽取不同诊断的亚组做进一步多分类的训练 。 或许他们也在用已有的数据在改进了 , 值得期待 。 那么如果我们没有这么大量的数据 , 又该如何结合第六篇教程提到的迁移学习来进行研究呢 , 下一篇我们尝试解读一篇有关CT与人工智能的文献 , 参考价值可能更大 。
烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究7. AI在CT应用的文献解读最后 , 我们简单讲讲AI在CT应用的一篇文献 。 AI应用在CT上的研究开展得更早 , 切入会有难度 。 医院一般都有自己的CT数据 , 如何利用有限的数据资源开展临床研究 , 需要思路上的突破 。 近期南方医团队关于AI在新冠肺炎CT上的应用的文章[2] , 思路值得借鉴 。 下面简单概述一下 。
烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究1. 这篇文章和刚才消化内镜的文章研究思路上有什么不一样
回顾上篇文章 , 在建立算法前需要大量人力对内镜图片进行标注 , 但是在这篇文章中 , 抗疫期间人力不足 , 不具备人力标注的条件 。 所以 , 研究者创新地提出了一个“半监督”的方法 , 实际就是以当时患者的病情为结局标签 , 再去对比AI对CT判断是否准确 。 这样的好处是明显节省人力 , 但是缺点也有:患者病情判断依据之一就是影像学 , 现在反过来用病情判断CT分类的准确性 , 难免有既当裁判又当选手的嫌疑 。
2. 两篇文章算法上有什么不一样
主要是三点:
1.本研究的训练集为303例 , 测试集为105例 , 样本较小 , 采用的是迁移学习 , 而不是重头训练;
2.文章尝试了多个深度学习模型 , 最后选择了ResNet34网络 , 任务是二分类 。 上篇文章采用的是DeepLab’s V3+ , 任务是二分类和图像分割;
3.本篇文章的图片预处理会相对复杂 。 内镜的图片导出来就是jpg这类通用的格式 , 但CT有专用的格式 , 图片大得多 , 又是由多个横断面组成 , 需要把图片切分后才能进入算法 。 如图 , 一个患者的CT图片 , 在水平面上被切分为一张张224*224小图 , 横断面上的裁剪维度为3 , 裁剪后的每张小图都会有得分 , 最后算出所有图片得分 , 对应阳性还是阴性的分类 。


推荐阅读