对话智能新高度:百度发布超大规模开放域对话生成网络PLATO-2
机器之心发布
机器之心编辑部
近日 , 百度发布对话生成网络 PLATO-2 , 宣布在开放域对话生成模型上迎来重要进展 。 PLATO-2 承袭 PLATO 隐变量进行回复多样化生成特性 , 模型参数高达 16 亿 , 涵盖中英文版本 , 可就开放域话题深度畅聊 。 实验结果显示 , PLATO-2 中英文对话效果已超越谷歌 Meena、微软小冰和 Facebook Blender 等先进模型 。
百度 NLP 于去年 10 月预公布了通用领域的对话生成预训练模型 PLATO , 近期在 ACL 2020 上展示 。 最近 , 百度又新发布了超大规模模型 PLATO-2 。 PLATO-2 承袭了 PLATO 隐变量进行回复多样化生成的特性 , 模型参数规模上升到了 16 亿 。 PLATO-2 包括中英文版本 , 能够就开放域话题进行流畅深入的聊天 。 据公开数据 , 其效果超越了 Google 于今年 2 月份发布的 Meena (26 亿参数)和 Facebook AI Research 于今年 4 月份发布的 Blender (27 亿 , 最高 94 亿参数)的效果 。 在中文上更是达到了全新高度 。
论文名称 PLATO-2:Towards Building an Open-Domain Chatbot via Curriculum Learning
【对话智能新高度:百度发布超大规模开放域对话生成网络PLATO-2】论文地址:https://arxiv.org/abs/2006.16779
GitHub地址:https://github.com/PaddlePaddle/Knover
PLATO-2中文对话效果演示
1. 引言
传统对话系统需求大量的人工编码 , 通常只能解决领域内的问题 。 随着深度学习的普及和不断发展 , 端到端的开放域对话系统效果也在稳步提升 。 基于大量语料和超大规模模型的预训练开放域对话生成技术近些年取得了非常多的进展 。 如微软发布的 DialoGPT , Google 发布的 Meena , Facebook 发布的 Blender 等 , 依托数亿到数十亿级级别参数的 Transformer 模型 , 以及数亿到数十亿的语料训练模型 , 模型能模拟人产生和人类非常相近的对话 。
对话中存在 “一对多” 问题 , 也就是同样的对话语境下 , 可以有多种不同的回复 。 这些不同的回复 , 除了与上下文相关 , 也和背景知识相关 。 这些背景知识包括个人属性(性别年龄 , 画像等等)、生活常识、相关知识、价值观和态度(如认同 / 不认同一个观念)、对话发生的场景信息 , 对话人情绪状态意图等等 (图 1) 。 然而这些背景知识往往非常难获取 , 这就给对话系统训练带来非常大的噪音 。 一般的 Encoder-Decoder 神经网络不管有多么复杂 , 仍然是一个 “一对一” 的函数 , 如果直接使用 , 就很容易产生诸如 “哈哈” , “不知道” 之类的安全回复 。
本文插图
图 1 对话系统难点:对话语料下面的丰富隐藏信息
在百度去年发布的 PLATO 模型 , 和微软近期发布的 OPTIMUS 模型中 , 都提到了利用隐变量(Latent Space)来建模这种不可见的多样性的方法 。 而百度 PLATO 模型更是独特采用了离散隐变量的方式来建模 , 且采用了多样化生成 + 合适度判断的方式 , 其中合适度判断用于回复筛选(Response Selection) 。 PLATO 在 Persona-Chat, Daily Dialogue 和 DSTC7-AVSD 三个不同类型的公开数据集上获得了 SOTA 的效果 。
2. PLATO-2 介绍
这次公布的 PLATO-2, 是在 PLATO 工作基础上的进一步扩展 。 PLATO 使用了 12 层 Transformer 作为基础 , 参数为 1.1 亿 。 PLATO-2 通过扩展网络 , 增加训练数据集 , 将网络扩展到 16 亿参数 。 考虑到精细化的引入隐变量的网络训练 , 计算消耗很大 , PLATO-2 采取了课程学习的方法 , 逐步优化参数 , 加快训练效率 。
2.1 PLATO-2 模型结构
和 DialoGPT 单向网络 , 以及 Meena 和 Blender 使用的 Encoder-Decoder 结构不同 , PLATO-2 使用了 Unified Network 结构 , 针对上文部分使用双向 Attention , 回复部分使用单向 Attention , 两者共享网络参数 , 只是 Attention Mask 进行了灵活设计 。 这种设定经过各项任务的反复验证 , 发现在同等规模参数量的情况下具有最佳的性价比 。 同时 , PLATO-2 采用了 GPT-2 的前置正则化层的方式 , 以更好适应大规模训练的需求 。
推荐阅读
- 小红猪带你看科技|七夕节送女朋友必备左点小艾智能艾灸器X8,3天众筹500万
- 字母哥|强强对话,字母哥狂砍36+18不敌红队5人得分上双,哈登威少55分
- 车驰夜幕|详解智慧城市全新方程,开启城市智能非凡时代
- 36氪利用无人驾驶技术切入水域智慧环卫与维护,“欧卡智能”获千万元级融资
- 穿搭|基础款走出酷帅风,简约又时尚的风格太吸引人,轻松美出新高度
- 不得投递智能快递柜 两部门严格要求高校录取通知书寄送
- 热源智能商务 “找万物”引爆直播找好物新模式!,突围传统家博会
- 环球网军事|中美最后“安全阀”,朱锋:重启军事对话
- 数字展示在线|更高追求更显专业——明基智能投影E592新品上市
- 北京日报客户端|互动动感单车、智能健身仓……西二环边新增运动休闲好去处
