烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究( 二 )


烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究2. 怎么预处理图片做图像人工智能识别前 , 图像一般都需要经过打标签、描绘轮廓等预处理 , 用来作为模型训练的金标准 。 你需要先告诉AI什么是对的 , 它才能学会自己判别 。 本研究的图片交给了中肿8名经验丰富的医生 , 分成四组 , 每组两个 , 进行分类、描绘肿瘤边界、质量控制 。 其中由专门一组医生负责肿瘤边界的描绘 。
3. 怎么训练AI模型我们第六篇内容讲的Inception V3用于分类 , 而这项研究采用的算法模型是DeepLab’s V3+ , 除了分类之外 , 还能做语义分割 , 就是把病灶用另外的颜色填充起来 。 所以这个模型能达到两个功能 , 一是辨别图片中有没有胃癌 , 二是把病灶给分割开 。 整篇文章更关注的是第一个功能 , 没怎么评价第二个功能的效果 , 不知道是什么原因 。
在计算机视觉识别里 , 有诸如图像分类、目标检测、语义分割等 , 不同的任务会有其常用的算法模型 , 其他用于语义分割的模型还有FCN、U-Net等 , 这些都是很成熟的算法 , 有经验的算法工程师可以熟练调包 。 正文并没有写算法的细节 , 没有提及用的是哪个深度学习框架 。
这项研究数据量这么大 , 估计是全套算法模型的参数都是自己跑出来的 , 而不是像我们第六篇这样的迁移学习 。 对于一篇医学论文来说 , 算法是工具 , 不是主要的内容 。 部分医生自学算法的时候 , 会走入一个误区 , 认为掌握算法是关键 , 但其实算法建模只是一部分 。 图像数据的预处理 , 与硬件的前端、后端对接 , 这些也会消耗大量时间 。 医生的优势是掌握医疗资源、专业知识和临床研究方法 , 找到合适的算法工程师合作有利于研究的开展 。 掌握一定的算法知识可以优化算法 , 但没必要用自己的兴趣爱好挑战别人的专业 。
4. 怎么评价模型表1是纳入患者的信息 , 文章只是简单地描述了一下各类人群占比 。 内镜领域总是以早癌检出率评价一个医院的内镜诊断水平 , 等于早癌例数/(早癌+进展期癌例数) , 日本声称达到70%以上 , 而我国不少医院都声称达到50%以上 。 不过真实世界的胃癌检出率又是如何呢 。 表1中 , 我们看黄色部分 , 5个中心的胃癌检出率波动在1%-5% , 相信这是比较符合真实世界的数据 。 中肿的患者大部分都是确诊或可疑肿瘤的 , 不具代表性 。
烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究表2是GRAIDS程序在不同验证集里的各种指标评价 , 一般这类医学人工智能的文章 , 模型准确性、灵敏度、特异度都很高 , 基本在90%以上 , 反而不太值得关注 , 我们需要看的是表现不佳的指标 。 这个模型的阳性预测值比较低 , 基本在50%以下 。
这可能是两个原因:
①这个AI程序的假阳性率高 , 遇到稍微像胃癌的都可能判断为胃癌 。 文章中提及了 , 这个程序会把正常的胃部结构 , 例如贲门、胃角之类的误判为胃癌 。 造成这样的原因 , 是因为算法层面只做了胃癌/非胃癌的二分类标签 , 没有对正常结构也做出分类 。 国内其他医院团队在后续的研究做出了改进 。
②胃癌患病率的问题 , 这个文章并没有提及 , 结合表1 , 我们看出真实世界的胃癌患病率仅有1%-5% , 而在灵敏度和特异度保持不变的情况下 , 人群患病率低会导致阳性预测值低 。 如果要提高阳性预测值 , 就应该进一步提高特异度 。
烟草味道|写给医生的人工智能体验课(七):如何开展与人工智能结合的临床研究表3是人机对比和人机结合的评价 , 让GRAIDS程序和三个级别的医生(专家、中级、新手)进行比较 。 对于新手级别的内镜医生 , 程序给他们提供了一个敏锐的眼睛 , 让他们不容易错过可能的病灶 。 但同时也给他们造成了更多假阳性的困扰 。 从False positive detections上看出 , AI假阳性率是5.2% , 最高 。 三类医生结合AI系统去判断后 , 假阳性率都上升了 , 大家都变得疑神疑鬼了 。 看来假阳性率是个能进一步研究的问题 。 文章并没有提及人和AI是怎么结合的 , 是采用了并联试验还是串联试验?进一步阐述可能会更好 。


推荐阅读