云存储的相似多文件差异分析现在在工程界是啥进展( 二 )


■网友
1. 相似多文件差异分析的动机?a. 降低成本(存储和带宽);b. 提升用户体验(通过传输更少的数据,让用户感受到更快的传输速度)。2. 实现方案?问题里提到一个需要两倍存储的方案,其实是没有必要的。那怎么实现呢?坚果云的回答回答比较全面了。事实上,基本上传统存储领域里的数据重删技术应用到了云存储,具体原理可以参考这篇文章。(数据去重技术原理分析)数据重删技术应用到云存储上有一些特别的问题要考虑。a. 服务开销要增大,这值不值?b. 云存储的数据量比较大,支持重删的存储方案能不能很好的扩展?c. 云存储除了关注吞吐量,也关注响应延时,这跟数据重删通用应用到的备份领域不同。贝尔实验室给出了一个demo方案,可以参考一下http://lib-arxiv-008.serverfarm.cornell.edu/pdf/1508.01182.pdf。3. Dropbox的方案?Dropbox一开始是做了跨文件的数据去重的,后来因为side channels的问题取消了。改成了只支持单个文件历史版本的数据去重。
■网友
我同意@Sofring的观点。其实一般可编辑的文档除了.txt以外,编码方式都不是严格顺序的方式,修改的位置并不能完全映射为文件本身的存储布局。采用滑动窗口不定长的切分策略也许能够在理论上提高去重率,但是却可能导致更多计算负载和元数据管理的问题,后端服务器架构会为此而变得复杂,文件过于碎片化带来的代价也很高。
■网友
多文件交叉检测会给后台实现带来很大的挑战,尤其是重新组装文件的时候。一般而言,差异分析是在客户端做的。Dropbox和坚果云都是,他们有个目录存储相关信息的。
■网友
“很像”这个怎么衡量?我可以说十万个文件里都有一部分字节很像。所有相同格式的文件的文件头都一样。到最后可能是省了时间在上传上,但是费了时间在比对上。你必须对服务器上所有文件都切块比对,搬运来很像的那一部分再拼接。这真的能省时间吗。另外,米国带宽可是比中国大很多,上传时间可以接受,那dropbox就不需要费cpu的时间来运算了。


推荐阅读