『读芯术』完胜四名专业级德州扑克玩家?AI软件Libratus何以称雄?( 二 )
负责发现和测试游戏中所有可能的手法的首要元素称为强化学习 。 在当今的人工智能世界中 , 获得广泛好评的流行软件称为深神经网络 。 神经网络允许机器模仿所有的人类动作和手势 , 甚至在某个时刻超越它们 。
然而 , Libratus没有使用深层神经网络进行操作 。 它是基于另一种被称为强化学习的人工智能 。 从根本上说 , 这个软件一次又一次地对自己下手 , 最终完善了它的知识库 。
但与其他类似平台(比如谷歌的AlphaGo)的一个不同之处在于 , Libratus并非出于获得基本技能然后出于完善自身的目的与人类竞争 。 而是 , 它被赋予了基本的游戏规则 , 然后必须从零开始学习一切 。
在此过程中 , 最突出的因素是以惊人的频率随机打牌 。 经过数万亿次的练习和数月的高强度训练 , Libratus达到了熟练水平 。 它不仅可以击败职业玩家 , 而且还可以发挥职业玩家无法猜到的最多随机手牌 。
选择最佳动作
这个过程中的第二个元素是一个叫做“最终游戏求解器”的软件 。 当Libratus自身掌握了所有可能的动作和手法的时候 , 便创建了一个庞大的假设场景数据库 。 不过 , 在这部戏中 , 人工智能不必逐一检查 , 也不必测试最合适的版本 。
在最终游戏求解器的帮助下 , Libratus设法将注意力集中在游戏上 , 并在此过程中学习 。 这样 , 随着游戏的进行 , 可能采取的策略数量成倍减少 , 只剩下那些适合对手的场景 。
因此 , 一个人工智能软件的两个独立部分相当复杂 , 从而能够对熟练的扑克玩家构成挑战 。 然而 , 它们仍然没有足够的效力来从事Kim和其他类似之人所从事的工作 。 他们可以找到Libratus每项动作的根本模式 , 并利用它们为自己谋利 。
消除范式
为了避免这种情况 , Libratus背后的两位创造者设计了第三个平台 , 消除了所有可识别的模式和相似之处 。 它的工作原理如下:比赛结束后 , 每天晚上 , Brown和Sandholm都会运行他们自己的算法来检测这些模式并消除它们 。 通常 , 这个过程耗时一整夜 , 之后这些模式就不复存在了 。
因此 , 正如你所看到的 , Libratus不仅涉及人工软件和机械化 , 而且如前所述 , 还涉及人为因素 。 人工智能就是这样:虽然许多人认为它是一个可以自我运行并完全独立于人类干预的自给自足的实体 , 但现实情况却不同 。 在现实生活中 , 人类和人工智能是并肩工作的 , 对彼此的行为做出一定的调整 。 在这种情况下 , 人类将人工智能置于起点 , 而人工智能克服了缺陷到达了终点 。
人工智能的未来就在于此
本文插图
来源:Pexels
自动化世界的未来已经跃然于眼前 。 人类和机器正在打破彼此之间的僵局 , 迈出了为彼此活动做贡献的第一步 。
当十九世纪初的技术革命开始时 , 机器慢慢地开始接管我们的工作 , 并也擅长于此 。 现在 , 人工智能不仅接管了我们正在做的事情 , 而且可以自己完成 。 而Libratus案例就是这种发展的最好示范 。
当这款AI软件在无限注德州扑克中击败四名职业扑克玩家时 , Libratus证明了它比任何职业玩家都能更熟练地虚张声势 , 使其动作几乎无法被预测 。
谁也不知道未来会怎样 , 哪个行业会出现下一个Libratus 。
本文插图
留言 点赞
我们一起分享AI学习与发展的干货如转载 , 请后台留言 , 遵守转载规范
本文为***作者原创 , 未经授权不得转载
推荐阅读
- 「小蜜疯汽车」年销22万,油耗不足3毛钱,完胜帕萨特,“大号思域”
- 「体育知道分子」1大优势完胜安家杰,郎平最佳接班人出炉!3大名帅都得甘拜下风
- 十三姨侃车记▲长5米+航空座椅+冰箱,完胜GL8,却败在加价上,被忽视的良心MPV
- 球场十二人@曼联准备花三亿多英镑引进这四名球员,令球迷震惊,为了夺冠
- 「腾讯科技」SpaceX载人飞船首次运营任务将运送四名宇航员 比原计划翻倍
- 买车家▲完胜不带运动部门的同级别BBA,A级车市场最期待的一款车
- 『NBA官网』篮网官方:四名新冠感染球员已经完全恢复
- 「隔壁说车老王」A+级宽适轿车,轴距2米7完胜朗逸,油耗5.9L,或不足7w,明日上市
- 小蜜疯汽车■从36万一路降至27万,方方面面完胜奥迪Q5L,被严重低估的豪华SUV
- 元气宅玩家:威力完胜激光鱼,你的显卡正在燃烧,元气骑士:超燃岩浆特性来袭
