Intel 最新的神经元计算棒Movidius Neural Compute Stick能干啥( 二 )


第二层好办,直接不要了,第一层得到的候选窗口,直接给第三层精确计算,慢一点就慢一点吧,反正窗口也不多,省下一个计算棒。
第一层不好办,理论上,图片压缩成不同大小之后,每个图片里的每个 12 * 12 像素子图之间的计算是相互独立的。这样我可以把每个 12 * 12 子图都算一遍,把结果拼起来,就不受图片大小限制了。
但是这样做,矩阵复制和计算棒吞吐时间就不能接受了。因此只能简化步骤,对精度做个妥协,于是直接规定了一个输入大小:28 * 38。这样第一层就被简化为,压缩成单一的 28 * 38 大小的图片,然后交给神经元计算棒计算。(是的!这个图片在一开始就被压缩成28 * 38 大小的,就是在这样艰苦的条件下,它选出了原始的候选窗口!)

综上,最后我将这个网络简化成了两个flow:
proposal net: 28 * 38 固定大小的图片输入,用于生成候选窗口output net:48 * 48 固定大小的图片输入,用于计算精确的人脸位置。
以上就是我在研究过程中遇到的一些问题和解决方法。┑( ̄Д  ̄)┍

■网友
Intel 最新的神经元计算棒Movidius Neural Compute Stick能干啥

已经使用Movidius神经计算棒做了一段时间开发。
Movidius 神经计算棒(ncs)可以辅助人工智能应用开发者分析、调试、验证神经网络,并为深度学习推理做加速。ncs提供的SDK包含了Tool和API。Tool部分有Profiler、Checker、Compiler三个工具。Profiler工具可以分析的网络模型,并报告网络每一层的运行效率等,辅助开发者优化网络结构。Checker工具可以在开发者开始部署网络之前进行测试,查看网络执行的结果和性能。Compiler工具则是将深度网络模型(caffe模型或TensorFlow模型)转化为NCS能够识别的graph文件。 SDK中的API部分就是为深度学习开发者提供的NCS硬件调用接口。通过训练得到的网络模型可以使用compiler工具编译为能被计算棒使用的模型格式,通过调用API,可以方便的在主机(NCS所连接的计算机)与NCS之间通信。NCS利用训练好的网络模型计算出图像分析的结果,并传输到主机上,完成推理工作。
ncs 目前支持 Caffe,TensorFlow。NCS已经集成了一些网络,例如GoogLeNet,AlexNet,SqueezeNet等。开发者也可以使用自己训练的网络模型,只要这些网络模型与NCS支持的网络层匹配。具体要求可以查看官网: caffe , TensorFlow 。


■网友
树莓派+intel NCS 简直是天作之合。
业余学习嵌入式AI多年,jetson TX1/TX2 都试过。官方给出的计算能力参数分别是1T/1.5T FLOPS,而NCS只有0.1T。TX/TX2的优势在于可以用于训练和测试,NCS只能进行测试。然而,在大多数情况下,我们是不会去使用他们的GPU去训练的,毕竟还是太弱鸡。
如 @椰蓉 所说。官方的examples repo提供了很多模型。既有分类的模型,也有检测的模型。截止到2018.5.8,我测试过所有模型,大部分识别帧率能够达到10fps。
以Mobilenet-SSD为例,tx1上可以达到17fps, 使用ncs可能达到8fps.可见,实际计算能力没有想象中的那么大。
我依然看好在PC上训练,嵌入端布署的方案。树莓派+NCS可以打造你自己的AI王国。


■网友
刚看到。
本国的资讯网站还是想象的一样,参考价值低。
533元的U盘!Intel开卖深度学习计算棒:PC鸡血神器-Intel,深度学习,U盘-驱动之家
Intel 最新的神经元计算棒Movidius Neural Compute Stick能干啥


相较2016款,2017款的NCS计算棒将集成的运行内存提高到1GB,支持加速模式和多USB同工,SoC为MA2455,加入了安全启动,台积电28nm HPC工艺。深度学习框架方面,仅支持Caffe,放弃了谷歌大脑TensorFlow。


推荐阅读