技术爱奇艺“能动的海报”刷爆全网!我们距离裸眼3D还有多远?( 三 )


技术爱奇艺“能动的海报”刷爆全网!我们距离裸眼3D还有多远?
图片

Meng-Li Shih团队的3D转换成果
相关链接:
https://shihmengli.github.io/3D-Photo-Inpainting/
那爱奇艺的这次3D变换在技术上与CVPR2020这篇论文中提到的技术有什么区别吗?
爱奇艺团队称 , 他们对这篇文章也有所关注 , 其本质是基于已知深度的图像修复 , 其作用与他们后处理中引入的Gated-conv结构类似 , 实际测试发现 , 前者在单帧的情况下某些场景空洞修补的效果较好 , 但是连续帧测试会出现修补部分帧间不连续问题 , 体现为视频抖动 。
爱奇艺团队认为Gated-conv结构较为轻量 , 可实现连续帧的end-to-end训练 , 帧间连续修补效果好一些 。
随着AI领域的发展 , 3D内容将迎来更多可能
不知道大家是否像文摘菌一样好奇 , 他们是怎么想到这个idea的呢?
爱奇艺称 , 他们团队主要的研究方向是计算机视觉 , 而且团队里有资深的算法成员具备丰富的3D视觉经验 , 同时结合爱奇艺自身的业务 , 他们便开始了2D转3D这一创新研究 。
尽管项目初期非常艰难 , 视频内容的2D转3D少有研究可以借鉴 , 他们尝试了非常多的方案都很不理想 。 好不容易可以在技术上实现2D转3D , 又发现还有帧间抖动、物体空洞、物体边缘和背景存在模糊流动区域等非常影响观众体验的问题 。
为了解决以上问题 , 他们采用BicycleGAN的“双轮训练”结构来解决不同数据集相机参数不同带来的问题 , video2video的结构来解决帧间预测不连续的问题 , 用图像修复中的Gated-conv结构作为后处理网络以解决插值空洞的问题 。
技术爱奇艺“能动的海报”刷爆全网!我们距离裸眼3D还有多远?
图片

技术爱奇艺“能动的海报”刷爆全网!我们距离裸眼3D还有多远?
图片

AI模型生成的3D红蓝视差图(3D红蓝视差图是能够表现出静态视差的图 , 带上常见的红蓝眼镜即可看到有3D效果的画面)
现在看来 , 能有如此效果已经非常棒了 。 爱奇艺团队也表示 , 这项技术目前已经申请了一些专利 , 更多专利申请在进行中 。
未来 , 一方面他们还会继续继续优化模型 , 将模型应用拓展到更多的应用方向;另一方面 , 还会继续结合目标检测、抠图、图像修补等技术来完成对特定场景下的景深修正 , 来更逼真的还原那些特效场景 。
在这漫长的研发过程中 , 他们也会遇到挫折 , 甚至陷入了瓶颈期 。
团队中多是刚毕业没多久的的年轻人 , 很多人第一次接触3D视觉这个方向 , 在初期有一大段时间陷入研发瓶颈期 , 大家的情绪上都难免有所懈怠气馁 。
怎么解决?
在他们眼中 , 没什么是一顿火锅解决不了的!如果不行 , 那就两顿!
2D转3D对视频/影视行业的价值思考
在过去3D技术应用创造商业价值 , 受制于两个方面:在硬件层面 , 拿前两年火热的3D电视举例 , 限制3D技术应用发展的其实是内容 。 一部昂贵的3D电视 , 结果花不了多少时间就把所有能看的3D内容全看完了 , 之后就沦为一台普通的电视 。
而VR设备除了3D内容的缺乏因素 , 还有笨重、眩晕、清晰度等硬件技术上的问题 , 不过近两年VR设备都在快速进行产品迭代优化 , 相信未来几年VR设备能够更轻更强大 , 带给用户更好的体验 。 甚至是类似Google Glass之类的轻量级VR眼镜也不是没有可能出现 。
软件和技术层面 , 2D转3D技术其实近年来也不乏有相关研究 , 但是更多的是在2D图片转成有3D立体感的图片(类似3D海报应用)上 , 而能够将影片转制成3D并且保留良好观影体验 , 甚至从效果上很难区分是原生3D还是AI模型转制的3D , 这个是比较难做到的 , 爱奇艺在这个领域的研究具备一些优势 。
但有挑战也就充满机遇:
在影视行业每一部3D电影的后期制作 , 动辄几千万起步的资金成本 , 上百人团队长达几个月时间和人力成本 , 都是阻碍3D内容丰富发展的痛点 。 但成熟的AI模型也许能够快速、批量、全自动的把2D转制成3D内容 , 能极大的减少电影公司的制作成本 , 同时以很快的速度丰富公司的3D内容生态 , 同时研发过程中积累的技术和内容 , 能够为之后几年的5G、VR、AR的发展提供一些积累 。


推荐阅读