■2020年大数据与AI结合的发展方向解读

InfoQ
The following article comes from 全球人工智能与机器学习技术大会 Author 张彭善
■2020年大数据与AI结合的发展方向解读
文章图片

文章图片

全球人工智能与机器学习技术大会
AICon全球人工智能与机器学习技术大会是由极客邦科技旗下 InfoQ 中国主办的技术盛会,大会聚焦AI前沿技术、产业化和商业化的动态 , 将重点关注人工智能的落地实践 , 关注人工智能技术领域的行业变革与技术创新 , 与企业一起探寻AI的边界 。
作者 | 张彭善
【■2020年大数据与AI结合的发展方向解读】策划 | 孟夕
从 2003 年谷歌大数据“三驾马车”论文的发表到现在 , 大数据技术历经 10 余年 , 经历了风口到落地再到大规模的普及应用 , 目前已经成为各大企业尤其是互联网企业的基础设施 。十几年中 , 早期 Hadoop 的大力发展、中期 Kafka、Spark 的异军突起以及现在 Flink 的强势突围 , 不仅推动大数据成为了企业应用的关键组件 , 同时为机器学习 AI 技术的发展提供了强有力的保障 。本文尝试着分析和总结大数据技术与 AI 技术结合的现状和发展方向 。
■2020年大数据与AI结合的发展方向解读
文章图片

文章图片

1实时大数据技术、实时机器学习技术和应用持续发展
早期 Hadoop、Spark 等大数据技术主要解决批处理计算的问题 , 通过分布式可扩展容错的架构 , 对于数据规模的问题 , 大数据技术解决方案已经非常成熟 , 尤其云计算容器技术的发展更好地提供了资源的弹性扩展 , 使得数据规模问题的解决更加容易 。然而 , 企业在应用好此类批处理、离线计算之后 , 对于数据和计算的实时性有了更迫切的要求 , 离线数据和批处理系统的高延时已经不能满足业务发展的需求 。实时性不仅是对于数据的要求 , 也是对于计算以及机器学习应用等系统组件的一致要求 , 这也更多反应在从数据的生成到产生价值反哺生产系统的时间延迟要求更短 。
Kafka 作为异步消息系统的事实标准 , 基本垄断了大数据实时系统数据传递与转换的通道 。Flink 在实时大数据计算领域异军突起 , 目前越来越多的实时应用以 Flink 为解决方案或是迁移到 Flink 上来 。同时一个有趣的现象是 , Kafka 和 Flink 在自己的优势场景之外 , 也在日益向外拓展边界 , Kafka 从消息系统到实时处理拓展 , Flink 从实时处理到实时机器学习拓展 , 此外基于这些主流的实时系统组件 , 构建起实时特征计算、实时机器学习系统也越来越容易 , 未来会有更成熟的一体化的实时端到端的解决方案和产品出现 。
2大数据底层技术基本格局已定 , 未来主要是大数据上层应用的发展
早期 Hadoop 占据批处理计算的统治地位 , 目前主流已经是 Spark 的批处理应用 , Hadoop 已经下沉到底层 HDFS 以及为基于其上的 HBase、Spark、Flink 等提供服务 。Kafka 在异步消息系统的统治地位短期也难以被撼动 , 基本上主流的实时计算框架或者快速数据流转都是基于 Kafka 去构建 。Flink 在实时计算领域异军突起 , 有一统此领域的趋势 。可以看到整体大数据技术基本格局已定 , 整个技术栈丰富且日趋成熟 。基本上很难形成与这些组件的竞争 , 目前主要是随着业务的需求与发展 , 大数据上层的应用会是一个趋势 。之前的大数据组件需要更多的是专家级的大数据工程师才能使用和构建 , 这也产生了很多问题 , 比如使用和排错都存在门槛 。可以预见到 , 大数据的用户会从工程师向前更多地扩展到分析师、数据科学家甚至是非数据相关的产品、设计等等角色 。基于这样的需求 , 大数据上层的应用会越来越多 。可以预见会有更多的高效的数据分析平台、可视化数据产品、端到端的可视化 AI 构建产品等上层应用出现 。


推荐阅读