如果完全断网了,怎样访问Stackoverflow?

早就有人干过这事了,不知道有人举报过没有:
广瓜网- 开发者交流平台见此帖:
A site (or scraper) is copying content from Stack Exchange. What do I do?

■网友
别写爬虫了,你可以直接下载 Stack Overflow 的。

Stack Exchange 是我看过社区做的极其出色的了,无论从 meta 论坛的创建,还是 QA 的管理,以及 Moderator 等权限 review 机制,都堪称典范,很值得去学习。

而数据的开放更是令人敬佩,他们从 2009 年开始就公开数据了,现在应该托管在 Internet Archive ,可以从他们的 blog 看到 Stack Exchange Creative Commons data now hosted by the Internet Archive - Stack Overflow Blog,你可以直接到 https://archive.org/details/stackexchange 去下载 Stack Exchange 论坛的数据,敏感的个人信息肯定是被清洗的,但是优秀的回答你肯定是可以看到的。

(我没记错的话,他们甚至把 Stack Exchange 问答引擎开源了)

你甚至可以在 Stack Exchange Data Explorer 上访问数据库的数据,也可以在 Stack Exchange API 直接调用 API,比如你要做一个 Alfred 的插件,轻而易举:
如果完全断网了,怎样访问Stackoverflow?


他们真正做到了 『取之于民,用之于民』。

■网友
不需要使用爬虫,stackoverflow官方是提供离线内容的,他们也很好奇用户能拿他们的数据再次创造些什么价值。
离线数据包地址(每月更新):https://archive.org/details/stackexchange
注意使用时需要遵守知识共享之by-sa条款。
明确注明内容来自stackoverflow,给出问题和答案的链接地址,注明作者和回答者的名字,给出用户资料页的链接地址。
【如果完全断网了,怎样访问Stackoverflow?】 离线内容下载下来是xml格式,需要你自己做数据解析或导入数据库。


    推荐阅读