首页 > 动态 > 关键词 > 创新工场最新资讯 > 正文

创新工场两篇论文入选ACL2020 中文分词和词性标注新模型性能创新高

2020-07-08 20:53 · 稿源:TechWeb.com.cn

【TechWeb】7月8日消息,全球自然语言处理领域(NLP)顶级学术会议 ACL 2020 今年在线举办,来自创新工场大湾区人工智能研究院的2篇论文入选,这两篇论文均聚焦中文分词领域。

这两篇论文分别是《Improving Chinese Word Segmentation with Wordhood Memory Networks》和《Joint Chinese Word Segmentation and Part-of-speech Tagging via Two-way Attentions of Auto-analyzed Knowledge》,由华盛顿大学博士研究生、创新工场实习生田元贺,创新工场大湾区人工智能研究院执行院长宋彦,创新工场科研合伙人张潼,创新工场CTO兼人工智能工程院执行院长王咏刚等人创作。

这两篇论文各自提出了“键-值记忆神经网络的中文分词模型”和“基于双通道注意力机制的分词及词性标注模型”,将外部知识(信息)创造性融入分词及词性标注模型,有效剔除了分词“噪音”误导,大幅度提升了分词及词性标注效果,将该领域近年来广泛使用的数据集上的分数全部刷至新高。

今天,创新工场大湾区人工智能研究院执行院长宋彦向媒体分享了这两篇入选论文的研究内容。宋彦本人有超过15年的NLP领域的科研经验。

据宋彦介绍,中文分词和词性标注是中文自然语言处理的两个基本任务。近年来,随着预训练模型的提出,有一些人提出质疑是否还有必要进行中文分词的处理,对此我们提出了不同的意见,尤其考虑到词汇级别的信息依然是中文信息处理最重要的基础。一个例子就是,虽然BERT大行其道,但是在中文上基于全词覆盖 (whole word masking)的预训练模型比直接使用单字编码的效果更好。

而创新工场的这两篇文章用记忆神经网络的方式记录对分词结果有影响的 n元组,并引入对词性标注有影响的句法知识,将分词结果和自动获得的知识衔接起来,既发挥了神经网络的优势,也把知识的优势用上,实现了分词技术上小而有效的改进和突破。

“键-值记忆神经网络的中文分词模型” 刷新中文分词历史性能

宋彦介绍,通常而言,中文语言因其特殊性,在分词时面临着两个主要难点。

一是歧义问题,由于中文存在大量歧义,一般的分词工具在切分句子时可能会出错。例如,“部分居民生活水平”,其正确的切分应为“部分/居民/生活/水平”,但存在“分居”、“民生”等歧义词。“他从小学电脑技术”,正确的分词是:他/从小/学/电脑技术,但也存在“小学”这种歧义词。

二是未登录词问题。未登录词指的是不在词表,或者是模型在训练的过程中没有遇见过的词。例如经济、医疗、科技等科学领域的专业术语或者社交媒体上的新词,或者是人名。这类问题在跨领域分词任务中尤其明显。

对此,《Improving Chinese Word Segmentation with Wordhood Memory Networks》论文提出了基于键-值记忆神经网络的中文分词模型。

该模型利用n元组(即一个由连续n个字组成的序列,比如“居民”是一个2元组,“生活水平”是一个4元组)提供的每个字的构词能力,通过加(降)权重实现特定语境下的歧义消解。并通过非监督方法构建词表,实现对特定领域的未标注文本的利用,进而提升对未登录词的识别。

例如,在“部分居民生活水平”这句话中,到底有多少可能成为词的组块?单字可成词,如“民”;每两个字的组合可能成词,如“居民”;甚至四个字的组合也可能成词,例如“居民生活”。

把这些可能成词的组合全部找到以后,加入到该分词模型中。通过神经网络,学习哪些词对于最后完整表达句意的帮助更大,进而分配不同的权重。像“部分”、“居民”、“生活”、“水平”这些词都会被突出出来,但“分居”、“民生”这些词就会被降权处理,从而预测出正确的结果。

键-值记忆神经网络分词模型

在“他从小学电脑技术” 这句话中,对于有歧义的部分“从小学”(有“从/小学”和“从小/学”两种分法),该模型能够对“从小”和“学”分配更高的权重,而对错误的n元组——“小学”分配较低的权重。

为了检验该模型的分词效果,论文进行了严格的标准实验和跨领域实验。

实验结果显示,该模型在5个数据集(MSR、PKU、AS、CityU、CTB6)上的表现,刷新最好成绩(F值越高,性能越好)。

宋彦表示,与前人的模型进行比较发现,该模型在所有数据集上的表现均超过了之前的工作,“把中文分词领域广泛使用的标准数据集上的性能全部刷到了新高。”

和前人工作的比较

在跨领域实验中,论文使用网络博客数据集(CTB7)测试。实验结果显示,在整体F值以及未登陆词的召回率上都有比较大提升。

基于双通道注意力机制的分词及词性标注模型“有效剔除噪音误导

第二篇论文《Joint Chinese Word Segmentation and Part-of-speech Tagging via Two-way Attentions of Auto-analyzed Knowledge》提供了一种基于双通道注意力机制的分词及词性标注模型。

宋彦介绍,中文分词和词性标注是两个不同的任务。词性标注是在已经切分好的文本中,给每一个词标注其所属的词类,例如动词、名词、代词、形容词。词性标注对后续的句子理解有重要的作用。

在词性标注中,歧义仍然是个老大难的问题。例如,对于“他要向全班同学报告书上的内容”中,“报告书”的正确的切分和标注应为“报告_VV/书_N”。但由于“报告书”本身也是一个常见词,一般的工具可能会将其标注为“报告书_NN”。

利用句法知识进行正确的词性标注

句法标注本身需要大量的时间和人力成本。在以往的标注工作中,使用外部自动工具获取句法知识是主流方法。在这种情况下,如果模型不能识别并正确处理带有杂音的句法知识,很可能会被不准确的句法知识误导,做出错误的预测。

例如,在句子“他马上功夫很好”中,“马”和“上”应该分开(正确的标注应为“马_NN/上_NN”)。但按照一般的句法知识,却可能得到不准确的切分及句法关系,如“马上”。

斯坦福大学的自动句法分析工具结果,分成了“马上”

针对这一问题,创新工场的论文提出了一个基于双通道注意力机制的分词及词性标注模型。

该模型将中文分词和词性标注视作联合任务,可一体化完成。模型分别对自动获取的上下文特征和句法知识加权,预测每个字的分词和词性标签,不同的上下文特征和句法知识在各自所属的注意力通道内进行比较、加权,从而识别特定语境下不同上下文特征和句法知识的贡献。

这样一来,那些不准确的,对模型预测贡献小的上下文特征和句法知识就能被识别出来,并被分配小的权重,从而避免模型被这些有噪音的信息误导。

基于“双通道注意力机制”的分词及词性标注

即便在自动获取的句法知识不准确的时候,该模型仍能有效识别并利用这种知识。例如,将前文有歧义、句法知识不准确的句子(“他马上功夫很好”),输入该双通道注意力模型后,便得到了正确的分词和词性标注结果。

分词及词性标注实例

为了测试该模型的性能,论文在一般领域和跨领域分别进行了实验。

一般领域实验结果显示,该模型在5个数据集(CTB5,CTB6,CTB7,CTB9,Universal Dependencies)的表现(F值)均超过前人的工作,也大幅度超过了斯坦福大学的 CoreNLP 工具,和伯克利大学的句法分析器。

即使是在与CTB词性标注规范不同的UD数据集中,该模型依然能吸收不同标注带来的知识,并使用这种知识,得到更好的效果。

该模型在所有数据集上均超过了之前的工作

CTB5(CTB5是使用最多的中文分词和词性标注的数据集)结果

而在跨领域的实验中,和斯坦福大学的 CoreNLP 工具相比,该模型也有近10个百分点的提升。

跨领域分词实验(对话测试集)的结果

宋彦总结道,“从技术创新的角度,我们的贡献主要有两点。一是在现有技术的基础上,建立了一个一体化的模型框架,使用非监督方法构建词表,并把知识(信息)融入进来,使用更高层次的句法知识,来帮助词性标注,起到'他山之石,可以攻玉’的效果。二是主动吸收和分辨不同的外部知识(信息)。通过键-值记忆神经网络和双通道注意力机制,进行动态权重的分配,能够有效分辨知识,区分哪些是有效的,哪些是无效的。虽然这些知识是自动获取的、不准确的,但‘三个臭皮匠,顶个诸葛亮’,经过有效利用,总能凑出一些有用的信息。如何实现模型的主动吸收和分辨,就变得更加重要。”

一直以来,创新工场致力于衔接科技创新和行业赋能,做嫁接科研和产业应用的桥梁,为行业改造业务流程、提升业务效率。对中文分词技术的研究也是如此。

在宋彦看来,中文分词和词性标注是最底层的应用,对于接下来的应用和任务处理非常重要。例如对于文本分类、情感分析,文本摘要、机器翻译等,分词都是不可或缺的基本“元件”。

“在工业场景使用的时候,跨领域的模型能力是一个非常直接的诉求。”宋彦强调。

宋彦以搜索引擎的广告系统为例向TechWeb介绍,论文提及的新模型可以有效地实现广告在不同领域进行内容匹配的冷启动。“以现有模型,比方说在新闻领域学到的模型,如果碰到一个体育领域的广告,那么这个时候其中很多词会没办法正确切分出来。但是在使用我们的模型时候,在新领域进行广告内容推荐,可以讲新领域的知识和事先准备的关键词等,加入我们的模型,从而把目标文本中一些比较有效的关键词,通过更好的分词结果呈现出来,而这些关键词,可能会匹配到用户输入的一些词,或者说用户在特定的网页浏览背景下面他所碰到的一些内容。所以如果分词结果正确,就能够有效的把这两部分内的内容衔接,使得用户在搜索的时候,得到的广告内容跟搜索结果是匹配的。”

目前,这两篇论文的工具都已经开源。

分词工具: https://github.com/SVAIGBA/WMSeg

分词及词性标注工具: https://github.com/SVAIGBA/TwASP

  • 相关推荐
  • 大家在看
  • 创新工场李开复:美国对TikTok控诉没有任何证据

    近日,特朗普公开称在 9 月 15 日前TikTok必须要卖给美国公司,否则将关门大吉。对此,创新工场董事长兼首席执行官李开复对此发文表态。

  • 创新工场提出中文分词和词性标注新模型 可提升工业应用效率

    记者从创新工场获悉,其最新提出了中文分词和词性标注模型,可将外部知识(信息)融入分词及词性标注模型,剔除了分词“噪音”误导,提升了分词及词性标注效果。在NLP中,中文分词和词性标注是中文自然语言处理的两个基本任务,尤其在工业场景对分词有非常直接的诉求,但当前没有比较好的一体化解决方案,而且中文分词普遍存在歧义和未登录词的难题。创新工场方面解释,中文语言因其特殊性?

  • 少样本学习新突破!创新奇智入选ECCV 2020 Oral论文

    近日,创新奇智有关少样本学习(Few-shotLearning)的研究论文《Prototype Rectification for Few-Shot Learning》被全球计算机视觉顶会ECCV2020接收为Oral论文,入选率仅2%。ECCV全称为European Conference on Computer Vision(欧洲计算机视觉国际会议),与ICCV和CVPR合称为全球计算机视觉三大顶级会议,每两年举办一次。据大会官方介绍,本届会议共收到5025份有效投稿,共接收1361篇,录取率为27%,其中1361篇接收论文里面,?

  • 2020ChinaJoy直播地址入口 2020ChinaJoy直播在哪看

    7月31日,2020年的Chinajoy正式的开启了,很多朋友虽然去不了现场但是还可以观看直播,一些小伙伴还不清楚直播的地址,下面就来为大家详细的介绍一下2020ChinaJoy直播地址。

  • 2020抖音创业自救指南(上)

    2019 年抖音创业道路上的小伙伴们,积压的矛盾和问题在 2020 上半年集中爆发,在此期间无数个中小公司倒闭,无数个工会垮台,奔着短视频风口而去的人后来硬生生被拽走上带货风口。

  • 2020,谁能打败抖音和快手?

    老罗抖音首秀直播带货,辛巴快手全线狙击,薇娅卖火箭创造无限可能,电商直播成为短视频平台商业化的长矛。另一边微信视频号持续开放内测,被内容创业者视为“短视频最后的上车机会”,也开展的如火如荼。

  • 2020游戏发行大困局

    2020 年,游戏发行可真是太难了。找产品:难最近一段时间,几乎所有发行商都把「找产品」当成了最重要的事情。

  • 2020互联网大会-物耀安全聚力创新 共赢未来

    据悉,中国互联网协会主办的2020(第十九届)中国互联网大会将于 2020 年 7 月 23 日至 7 月 25 日,首次在云端举行。中国互联网大会是我国互联网业界极具知名度的年度行业大会。从 2002 年开始,至今已经成功举办了 18 届,是中国互联网协会的重要品牌活动之一,也被互联网行业喻为中国互联网行业的风向标。本届大会以”共迎网络新时代,共创产业新未来”为主题,据时,讲联合多家相关单位,联合展望新时代互联网科技的协同创新未来

  • 2020高考成绩开始放榜

    今天起,全国各地将陆续进入高考“放榜”时间。据官方已公布的信息,查分时间主要集中在23至26日。今天,广东、重庆、四川、湖南、广西、湖北、江西、云南、甘肃、内蒙古、宁夏、上海、安徽等10余省份的考生可以正式查询自己的高考成绩。

  • 2020胡润中国10强电商

    今日,胡润研究院发布《 2020 胡润中国 10 强电商》,列出了中国 10 强本土电商企业,按照企业市值或估值进行排名。上市公司市值按照 2020 年 6 月 30 日的收盘价计算,非上市公司估值参考已公开的、最新一轮融资估值。

  • 2020高考成绩开始放榜 2020高考成绩支付宝、微信查分方法教程

    2020高考成绩开始放榜。今天起,全国各地将陆续进入高考「放榜」时间。将近两周的等待后,考生们终于盼到了成绩出炉。目前 2020 年高考已经进入高考成绩公布阶段,今天河北、湖北、安徽、上海、甘肃、四川、江西、云南、宁夏、广东、广西、内蒙古等省份可高考查分。

  • 坚持,陪伴,成长,2020年高考的三个关键词 | 作业帮2020高考故事

    2020 年 7 月 7 日, 1071 万高考考生将走上考场。这是时隔 17 年后,高考时间再次拨回 7 月。疫情之下,学校无法如期开课,高考被迫延期,常规的学习秩序被打破,这个被称为“史上最难”的 2020 年高考季,注定让每个身在其中的人无法忘怀。作为中国最大的K12 在线教育平台,作业帮有幸陪伴了其中 805 万考生,见证了他们的努力和成长。 2020 年 5 月 28 日,作业帮发起“ 2020 高考故事,‘帮’你记录”征集活动,面向全国考生、

  • AI如何推动城市治理创新升级?云天励飞在WAIC2020上这样说

    7月9日-11日,2020世界人工智能大会(WAIC2020)在上海召开。云天励飞副总裁郑文先受邀参加于10日举行的“未来城市”论坛,并发表主题演讲。世界人工智能大会是中国AI行业的最顶级盛会,由国家发展改革委、科技部、工业和信息化部、国家互联网信息办公室、中国科学院、中国工程院和上海市人民政府共同主办。今年,突如其来的疫情打乱了人们工作和生活的节奏,如何科学抗疫成了大家共同的话题。在演讲中,郑文先也分享了云天励飞如何运用人?

  • 博博猪童装2020秋冬发布会盛大召开

    2020年7月27号,博博猪八周年庆典暨秋冬发布会于莫干山森泊酒店盛大举行,众多供应商、经销商及行业好友作为此次特邀嘉宾郑重出席,共同分享博博猪八周年成长与收获的快乐。下午两点,博博猪秋冬发布会准时开场。此次秋冬发布会主题为《我就是我》,将为来宾展出60套精心挑选的博博猪秋冬新品款式。在一场震撼的灯光秀之后,走秀正式开始。小模特们踩着音乐的节拍,步履从容,将博博猪的秋冬新款向众多嘉宾作了全方位的展示。博博?

  • 2020中国IPO大年:大江大河,有大鱼

    2019 年,蚂蚁集团实现营业收入 1200 亿元人民币,净利润为 170 亿元人民币。目前,官方尚未就最终估值对市场明确表态,但市场猜测蚂蚁集团寻求至少 2000 亿美元(约1. 4 万亿元人民币)的IPO估值。可谓二级市场的新晋“巨无霸”。

  • 2020广州国际自动售货机商业展盛大召开—创新精工,引领未来

    2020年8月3日-5日,第八届中国(广州)国际自助售货系统与设施博览交易会,在广州广交会展馆A区盛大开幕。本届展会为期三天,以“占领先机,引领未来”为主题,展会规模达80000平方米,预计参展人数将达到80000多名。今年由于疫情影响,展会延迟,国外客户相对较少,但是国内客户热情空前高涨,“无人新零售”也因为疫情的影响,更加的深入人心,自动售货机行业也进行了更加科学化的细分,往届展会以弹簧机、蛇形货道饮料机、生鲜、?

  • 都2020了,你真懂抖音营销了吗?

    一直以来,很多朋友,尤其是企业的朋友,都会问我们“抖音怎么做?”这是一个很大的问题,就像问互联网营销应该怎么做一样。通常在听到这个问题时,我的第一个反应是帮他做诉求的拆解:你做抖音的目的是什么?

  • 在快手,看见不一样的2020年高考

    在北京人大附中考点门口,除了口罩,红白相间的校服最为显眼。“加油啊!”“不要紧张!”“好好考!”伴随着阵阵加油声和殷切的目光,200 多名高三考生陆续进入考点。无需提供核酸检测,考生提供身份证和准考证便可进入考场,进场后红外线测温,37. 3 度以下即可正常参加考试。 (快手昵称:人民画报;ID:renminhuabao) 身着红色T恤,手举“乘风破浪”的加油牌,八一学校高三班主任一大早,就到人大附中考点前为自己的学生送考

  • 2020上半年盘点:创新“区块链+” 火币中国交出满意答卷

    2020 年下半场已经开局,“区块链+”将走向何方呢?火币中国CEO袁煜明表示,“产业区块链已经爆发, 2020 年下半场行业将会发生质的变化,火币中国将加快在更多领域中探索引领区块链创新应用的步伐。” 作为“区块链+”一站式服务平台,盘点 2020 年上半年,火币中国积极探索区块链赋能实体经济的路径,对“区块链+”典型场景做了重点布局并卓有成效;在不断完善区块链生态建设的同时,逐步开创了“区块链+政务”、“区块链+教育”?

  • 充电宝哪个牌子好,2020质量最好的充电宝

    最怕空气突然安静,最怕手机突然的关机...没有一个好的充电宝,怎么敢出门呢?手机玩着玩着电量就低于10%,想刷个知乎都不敢了。大家想买到质量和性能好的充电宝,主要看这三点:①充电宝的容量(一般10000毫安最佳,太大就太重了)②看充电宝的电芯(聚合物机芯和锂机芯)③充电支不支持快充(快充的充电会快哟)接下来就推荐几款质量和性能都比较好的充电宝吧,可以参考下!1、Nank南卡无线充电宝POW2充电:支持10W无线+18W有线?

  • 参与评论
文明上网理性发言,请遵守新闻评论服务协议
  • 热门标签