云存储的相似多文件差异分析现在在工程界是啥进展( 二 )
■网友
1. 相似多文件差异分析的动机?a. 降低成本(存储和带宽);b. 提升用户体验(通过传输更少的数据,让用户感受到更快的传输速度)。2. 实现方案?问题里提到一个需要两倍存储的方案,其实是没有必要的。那怎么实现呢?坚果云的回答回答比较全面了。事实上,基本上传统存储领域里的数据重删技术应用到了云存储,具体原理可以参考这篇文章。(数据去重技术原理分析)数据重删技术应用到云存储上有一些特别的问题要考虑。a. 服务开销要增大,这值不值?b. 云存储的数据量比较大,支持重删的存储方案能不能很好的扩展?c. 云存储除了关注吞吐量,也关注响应延时,这跟数据重删通用应用到的备份领域不同。贝尔实验室给出了一个demo方案,可以参考一下http://lib-arxiv-008.serverfarm.cornell.edu/pdf/1508.01182.pdf。3. Dropbox的方案?Dropbox一开始是做了跨文件的数据去重的,后来因为side channels的问题取消了。改成了只支持单个文件历史版本的数据去重。
■网友
我同意@Sofring的观点。其实一般可编辑的文档除了.txt以外,编码方式都不是严格顺序的方式,修改的位置并不能完全映射为文件本身的存储布局。采用滑动窗口不定长的切分策略也许能够在理论上提高去重率,但是却可能导致更多计算负载和元数据管理的问题,后端服务器架构会为此而变得复杂,文件过于碎片化带来的代价也很高。
■网友
多文件交叉检测会给后台实现带来很大的挑战,尤其是重新组装文件的时候。一般而言,差异分析是在客户端做的。Dropbox和坚果云都是,他们有个目录存储相关信息的。
■网友
“很像”这个怎么衡量?我可以说十万个文件里都有一部分字节很像。所有相同格式的文件的文件头都一样。到最后可能是省了时间在上传上,但是费了时间在比对上。你必须对服务器上所有文件都切块比对,搬运来很像的那一部分再拼接。这真的能省时间吗。另外,米国带宽可是比中国大很多,上传时间可以接受,那dropbox就不需要费cpu的时间来运算了。
推荐阅读
- dart这编程语言现在发展怎么样了,语法与Java,c#很相似,甚至更简洁
- 安岳石窟发现明代龙王像,与《西游记》中东海龙王惊人相似
- 微博目前已经支持文本,图片,位置分享,为啥没有语音和视频呢微博的pm肯定想过这两种微博形态,但迟迟不做的原因到底是啥。是语音和视频不符合产
- 白皮书一般是政府发布的正式报告或文件,那么现在物联网、智慧城市等热门领域这么多企业发布的白皮书算咋回事呢
- 电商会怎样存储和保护客户的信用卡信息不被泄漏
- hadoop中的mapreduce链接(mapreduce chaining)怎样避免中间文件的产生
- 怎样防止U盘内的文件被复制
- 可不可能利用网盘的秒传功能使用伪造的MD5(或其他信息)值进行文件分享
- windows资源管理器无法浏览部分安卓手机内文件
- 贾静雯|与妈妈长相神相似,贾静雯女儿咘咘被称“最美星二代”
