达观数据咋样( 四 )

互联网的出现为AI建立起一个庞大的内容网络,通过这个网络,AI几乎可以掌握人类有文明史以来所有的内容。同样一个人物或事件,人类能关联的信息如果是10的话,计算机可能是10万。
『文史资料无论是采集还是存储的成本都非常廉价,存储200万册红楼梦这样的书籍大概需要2-3T的空间,一年的存储成本大概只要1000-2000元,这就意味着我们一年只需要花2000元就可以把一座大学的图书馆藏书都给存下来。』
陈运文说,海量的素材资料为人工智能提供了足够的『运算食粮』,通过阅读这些内容,AI可以快速学习,像人类一样理解文本语义。
不要小看『读懂文本』的能力,实际上今天社会上很多工作都和『阅读理解』相关,今天达观的AI系统已经可以『自动写文章摘要』,能够『像秘书一样提炼文章的核心观点,并且可以分析出文章观点的正向和负向。』
理科生正在改变文科世界
AI的文本阅读理解能力为达观数据在商业社会中找到了盈利的方向。
2016年上半年的某天,陈运文同事接到一个陌生电话,对方自称是国内知名电信企业某技术部门负责人,对达观的技术很感兴趣,希望能面谈。
『我同事当时吓一跳,以为是骗子。』陈运文说。
但随后的对话让他打消了这个疑虑,对方称他们在网上看到达观发布的一篇技术文章,和他们当前遇到的一些技术困境相关,希望邀请达观的技术团队到深圳做当面交流。
当时,该企业希望提高「用户搜索」的准确性,作为知名的手机品牌,他们希望快速了解用户的搜索需求,比如用户在搜索「XX手机好不好?」的时候,他们可以匹配对应内容。
但汉语的表达方式并不唯一,有时候同样一个意思可能有多个语句表达,例如上述这句话还可以用「XX手机怎么样?」「XX手机好用不?」等句式替代,类似这样的语义搜寻问题让实力雄厚的大企业也感到困惑。
『不同地区、不同文化程度的人,他们搜索的句子很可能完全不同,我们很难穷尽这种表达方式。
所以在文本阅读处理时,需要让计算机灵活适配各种不同的表达。』陈运文说他们后来帮助该企业设计了一个『非常精妙的算法』解决了这个问题。
现在这家公司已经成为达观长期的合作客户,而他们的合作也不再局限于「搜索分析」,而已经进入到「信息反馈」领域。
消费者每天会在中文网络上发布超过100万条关于企业产品的评价信息。如果让人来阅读这些信息,十个人的团队可能需要一天时间来完成,但人工智能只需要几分钟。
『AI系统可以为这些信息去归档整理,甚至是贴标签。』
如AI会判断每一条评论的属性,是「积极正向的还是消极负面的」,并为之贴上标签,同时会抓去关键词来告诉管理者,消费者的评价主要集中在哪些方面。这就方便了品牌方了解用户需求,了解舆情环境,并做出应对。
『此前这些工作都需要专门的人工处理,而现在计算机都可以完成。』陈运文说。
人工智能的这种『阅读理解』能力正在逐步改变那些文字工作者的职业环境,很多此前需要人工阅读审核的工作,今天都交由人工智能来完成,金融机构就是其中之一。
『我们帮助某金融机构设计的系统可以自动识别招股书里面的数据和含义,他们给我们列出来大约3000个审核点,我们让系统学会识别和判断,提高人工审核的效率。』
陈运文解释说,普通企业送审的招股说明书厚达500页,『常人看一遍就需要一个月』而现在他们用计算机来做初审,可以快速的发现说明书中的『数字错误或者重大风险』。
『公司上市往往需要一年得时间过会,其中很重要的原因就是阅读时间漫长,就算人工分头来阅读招股书也需要花费很长时间。』
某全球著名的会计师事务所也是达观数据的客户,他们正试图用AI替代人来来做审计。审计工作中大量的时间都花在「阅读」上,一旦审计一个公司,这些审计师需要阅读大量的公司合同进而将数据摘录到审计底稿中。
推荐阅读
- “一部手机读云南”上线力争建成国家方志大数据中心西南中心
- 联合国大数据全球平台中国区域中心在杭州成立
- 银行的数据中心可以跳槽去互联网公司吗
- |大数据赋力 半个多月前拉客的“黑车”精准落网
- 数据采集终端|
- 关于用phpfsocket 写Post, 模拟http 报文怎样写入要传输的处理数据
- 电商网站支付流程的流失率是怎么样的从用户点击充值/支付按钮,到支付完成,其中每一步的流失比率都是咋样的
- 假如把中国电信监测到的3亿人一个月每天上网的所有行为打个包,哪些数据应该被提出从这些数据能得到啥
- 联想g50-80咋样大概4000元左右,性价比怎样求大神指点!
- 华威大学计算机本科咋样
