达观数据咋样

咳咳。。φ(≧ω≦*)?非常感谢热心知友给我这个机会来为大家介绍达观数据。
下面我来简单为大家解答一下,达观数据是做什么的、公司发展情况这两大问题。

一、达观数据主要是做什么的?作为一家To B公司,达观数据就是利用人工智能技术,为各行业企业提供文本智能处理服务的。
我们专注于人工智能领域的文本挖掘处理,利用NLP(自然语言处理)、机器学习、深度学习等技术,为企业开发出文字数据处理、企业知识管理的解决方案,提升企业数据化运营能力和经营业绩。目前行业内很多挖掘还是人工来用手工的规则和脚本实现,而我们希望能够减轻此类重复繁琐劳动的负担,让各行各业的企业都能够享受到人工智能所带来的红利。

1.1 达观数据为什么专注于文本数据的挖掘?我们说语言是构建人类认知体系的基础,而文字是语言的主要载体。所以,对文字的理解和运用是机器通向认知智能的必由之路。我们来看看文字数据的主要特点:
表达非常抽象而精炼的概念。文字可以表达非常抽象而精炼的概念,比如智能、高尚、美好、唯心主义等词语。人类的智慧就是基于对概念的层次抽象向前演进的。蕴含丰富的背景知识。文字背后蕴含丰富的背景知识,比如“万事俱备只欠东风”的背景知识是三国赤壁之战的火烧赤壁, 再比如”to be, or not to be”的背后是莎士比亚的哈姆雷特式的艰难抉择。极为灵活、庞杂。文字还极为灵活、庞杂,尤其中文存在大量的歧义、隐喻、反讽、双关、转义、多义等特点。比如乒乓球拍卖了(球拍存在语义切分的问题),比如五个公司的工程师(五个修饰的对象),比如做手术的是他的父亲(做的具体含义有歧义),比如咬死了猎人的狗(是否省略了咬死的动作主语),比如他的仪表不好(仪表是器材还是外貌)等。从以上这些主要特点来看,文字数据本身就非常复杂,若用计算机来进行处理,更是需要独特的核心技术以及丰富的垂直行业经验,能够直面行业场景及其痛点,来解决文字处理工作的难题。

1.2 企业场景下通常有什么样的文本数据?和我们熟悉的结构化数据不同,当提到企业场景下的文本数据时,常有以下几种显著特点:
文本数据的非结构化。文档格式多样化,通常以PDF、Word、Excel,PPT、TXT,HTML等多种格式存在。文件类型多样化。以企业为例,不同行业的文件类型不同,如法律/人事/证券等行业的各类文书, 企业内部的公文和办公资料、VOC客户评论意见、客服FAQ问答语料,各种合同标书文件,以及各类新闻媒体资讯等。这些都需要有针对性地进行数据处理。多语言。中英文、乃至其它语种的语料。如果说上述各类复杂多样的文本数据是我们的原始的矿产资源,那么文本语义引擎就是挖掘机,这台挖掘机能从原始文本数据中挖掘提炼出有价值的知识信息。

1.3 达观数据如何进行文本数据的智能化处理?达观数据咋样

企业架构图我们把用人工智能对文本的智能处理的基本过程概括为四个词语,分别是对文本的抽取、划分、匹配和生成。
抽取:从无结构化到结构化的关键信息抽取,具体来说就是从大量的文本中自动抽取出指定类型的关键信息,比如对合同、商务票据、人事简历、法律文书等文档中的核心内容的自动识别和提取。
划分:划分其实就是分类,比如对各类文档内容的自动审阅和审核。更具体的场景比如对合同各条款的潜在风险识别,不一致性检测,自动纠正文档中错别字(目前很多文档来自对纸质文件的OCR扫描,存在大量形近字错误)、涉黄涉政内容识别、垃圾评论识别、广告内容识别等。还有VOC客户意见分析,自动从用户的评论数据中识别提炼出用户的观点、情感、意见,以此指导产品设计和运营。
匹配: 利用语义分析技术提供的功能极为强大的搜索引擎服务,支持各类模糊匹配、语义联想、正文各个段落精确定位查找等功能,具体产品如HR人岗精准匹配系统,司法领域的案件智能匹配系统等。再比如,根据用户阅读行为自动生成用户画像模型,并从用户的兴趣偏好出发,提供个性化的千人千面的信息推荐引擎。


推荐阅读