物体识别技术发展状况

在学术界,物体识别在过去的10几年中一直是热门话题,看看每年的顶尖会议和期刊上,这个方向的工作层出不穷。尽管如此,真正能够完全实用的非常少。在某些特定场合下,一些物体识别应用可以保证相当高的精度,如OCR,指纹识别和人脸识别。但是完全无约束的物体识别还难以实现。 然而,随着移动智能终端的爆发式增长,这方面的应用会越来越多。微软的Kinect就是一个典型的物体识别应用:通过对人体的特殊部位识别,完成体感控制的一部分。个人认为,物体识别技术会在未来会有非常广阔的发展空间。
■网友
关于物体识别,是计算机视觉领域的一个分支,很多做计算机视觉的学校、研究所都在做。比如,微软亚洲研究院,清华电子系,计算机系等。做的思路,一种是从检测或者分类的角度去做;另外一种从图像匹配图像的角度,数据库保存类别的各种物体图像,实际使用时,将实际采集的图像和数据库图像匹配,匹配上则认为当前物体属于数据库图像所属的类别,类似于病毒检测的原理。以我的观点,这一技术还远没有成熟,做一些简单的限定场景应用是可以的,想做很多物体的非限定场景应用很难。
■网友
物体检测是计算机视觉中的最常见应用之一,有极为广泛的用途。例如识别体育影像,确定哪个是运动员那个是篮球。或者你在找在桌上丢失钥匙时,就是在用人眼做物体识别,这时如果能通过机器来帮你完成,该多好啊。又比如交警通过物体识别,能够判定视频中的哪些车辆违纪。

物体识别这个问题经过近三十年的发展,从深度学习之前的人工特征提取,到之后逐步使用卷积神经网络进行特征提取和分类以及候选框的确定,直到端对端的模型使用一个网络完成所有任务,从而做到了更快的速度,更低的资源消耗,最终达到了实时的物体检测。


物体识别技术发展状况



不同与图像分类任务,物体识别要逐层的在图像中画出一个个框框,比如先识别出这是一只鸡,再识别出鸡的脑袋,翅膀等。之后对框中的图像进行分类,框框中的图像要尽可能的完整的包含待识别的物体。(如上图所示)

物体识别最简单粗暴的做法是在图片上滑动切割大大小小的框框,然后对每个框中的结果进行分类,从中选择那些分类可信度高的,但这样实在太慢了。在深度学习席卷计算机图像学之后,出现了一个系列的RCNN,包括基础板,加速板,升级加速版,其中的R代表regional。这里对其逐个进行详细介绍,从其进化中试图总结深度学习算法改进的一般道理。RCNN家族虽然已不是物体识别领域最新最好的方法,但其思路仍值得借鉴。

ps. 对卷积神经网络不熟悉的,可以看看你所不能不知道的CNN 复习下。


物体识别技术发展状况



物体识别技术发展状况



先说RCNN,这个最简单,就算将手动的特征提取换成了由卷积神经网络去做,其他的和传统模型类似,也是先生成所有可能的框,之后对每个大小形状不同的子图缩放到同样的尺寸,最后对每个框由SVM来判定是不是待识别的物体。但就是这个创新,在不改变分类器的情况下,就能够比之前最好的模型提升任务的准确度50%,下图是13年RCNN文章中给出的结果,其中红色的31.4%的准确率相比之前最好的22.6%进步很大。

物体识别技术发展状况


从这里看出深度学习的最大优点,就是其能够比之前的方法更好的提取图像的特征,这是卷积神经网络的结构决定的,局部的信息提取以及通过pooling来实现信息的汇总。然而RCNN的分类器依旧是线性的二分类SVM,因此分类的效果不好,而且RCNN要暴力的从一幅图中生成2000张大小不同的被裁剪的图片,再根据要识别的物体种类对每一幅子图片通过SVM进行01分类,判定这幅图片是每一个待识别物体的概念,因此运行时速度很慢。


推荐阅读