创新工场两篇论文入选ACL2020 中文分词和词性标注新模型性能创新高

2020-07-08 22:00 · 稿源： TechWeb.com.cn

【TechWeb】7月8日消息，全球自然语言处理领域（NLP）顶级学术会议 ACL 2020 今年在线举办，来自创新工场大湾区人工智能研究院的2篇论文入选，这两篇论文均聚焦中文分词领域。

这两篇论文分别是《Improving Chinese Word Segmentation with Wordhood Memory Networks》和《Joint Chinese Word Segmentation and Part-of-speech Tagging via Two-way Attentions of Auto-analyzed Knowledge》，由华盛顿大学博士研究生、创新工场实习生田元贺，创新工场大湾区人工智能研究院执行院长宋彦，创新工场科研合伙人张潼，创新工场CTO兼人工智能工程院执行院长王咏刚等人创作。

这两篇论文各自提出了“键-值记忆神经网络的中文分词模型”和“基于双通道注意力机制的分词及词性标注模型”，将外部知识（信息）创造性融入分词及词性标注模型，有效剔除了分词“噪音”误导，大幅度提升了分词及词性标注效果，将该领域近年来广泛使用的数据集上的分数全部刷至新高。

今天，创新工场大湾区人工智能研究院执行院长宋彦向媒体分享了这两篇入选论文的研究内容。宋彦本人有超过15年的NLP领域的科研经验。

据宋彦介绍，中文分词和词性标注是中文自然语言处理的两个基本任务。近年来，随着预训练模型的提出，有一些人提出质疑是否还有必要进行中文分词的处理，对此我们提出了不同的意见，尤其考虑到词汇级别的信息依然是中文信息处理最重要的基础。一个例子就是，虽然BERT大行其道，但是在中文上基于全词覆盖（whole word masking）的预训练模型比直接使用单字编码的效果更好。

而创新工场的这两篇文章用记忆神经网络的方式记录对分词结果有影响的 n元组，并引入对词性标注有影响的句法知识，将分词结果和自动获得的知识衔接起来，既发挥了神经网络的优势，也把知识的优势用上，实现了分词技术上小而有效的改进和突破。

“键-值记忆神经网络的中文分词模型” 刷新中文分词历史性能

宋彦介绍，通常而言，中文语言因其特殊性，在分词时面临着两个主要难点。

一是歧义问题，由于中文存在大量歧义，一般的分词工具在切分句子时可能会出错。例如，“部分居民生活水平”，其正确的切分应为“部分/居民/生活/水平”，但存在“分居”、“民生”等歧义词。“他从小学电脑技术”，正确的分词是：他/从小/学/电脑技术，但也存在“小学”这种歧义词。

二是未登录词问题。未登录词指的是不在词表，或者是模型在训练的过程中没有遇见过的词。例如经济、医疗、科技等科学领域的专业术语或者社交媒体上的新词，或者是人名。这类问题在跨领域分词任务中尤其明显。

对此，《Improving Chinese Word Segmentation with Wordhood Memory Networks》论文提出了基于键-值记忆神经网络的中文分词模型。

该模型利用n元组（即一个由连续n个字组成的序列，比如“居民”是一个2元组，“生活水平”是一个4元组）提供的每个字的构词能力，通过加（降）权重实现特定语境下的歧义消解。并通过非监督方法构建词表，实现对特定领域的未标注文本的利用，进而提升对未登录词的识别。

例如，在“部分居民生活水平”这句话中，到底有多少可能成为词的组块？单字可成词，如“民”；每两个字的组合可能成词，如“居民”；甚至四个字的组合也可能成词，例如“居民生活”。

把这些可能成词的组合全部找到以后，加入到该分词模型中。通过神经网络，学习哪些词对于最后完整表达句意的帮助更大，进而分配不同的权重。像“部分”、“居民”、“生活”、“水平”这些词都会被突出出来，但“分居”、“民生”这些词就会被降权处理，从而预测出正确的结果。

键-值记忆神经网络分词模型

在“他从小学电脑技术” 这句话中，对于有歧义的部分“从小学”（有“从/小学”和“从小/学”两种分法），该模型能够对“从小”和“学”分配更高的权重，而对错误的n元组——“小学”分配较低的权重。

为了检验该模型的分词效果，论文进行了严格的标准实验和跨领域实验。

实验结果显示，该模型在5个数据集（MSR、PKU、AS、CityU、CTB6）上的表现，刷新最好成绩（F值越高，性能越好）。

宋彦表示，与前人的模型进行比较发现，该模型在所有数据集上的表现均超过了之前的工作，“把中文分词领域广泛使用的标准数据集上的性能全部刷到了新高。”

和前人工作的比较

在跨领域实验中，论文使用网络博客数据集（CTB7）测试。实验结果显示，在整体F值以及未登陆词的召回率上都有比较大提升。

”基于双通道注意力机制的分词及词性标注模型“有效剔除噪音误导

第二篇论文《Joint Chinese Word Segmentation and Part-of-speech Tagging via Two-way Attentions of Auto-analyzed Knowledge》提供了一种基于双通道注意力机制的分词及词性标注模型。

宋彦介绍，中文分词和词性标注是两个不同的任务。词性标注是在已经切分好的文本中，给每一个词标注其所属的词类，例如动词、名词、代词、形容词。词性标注对后续的句子理解有重要的作用。

在词性标注中，歧义仍然是个老大难的问题。例如，对于“他要向全班同学报告书上的内容”中，“报告书”的正确的切分和标注应为“报告_VV/书_N”。但由于“报告书”本身也是一个常见词，一般的工具可能会将其标注为“报告书_NN”。

利用句法知识进行正确的词性标注

句法标注本身需要大量的时间和人力成本。在以往的标注工作中，使用外部自动工具获取句法知识是主流方法。在这种情况下，如果模型不能识别并正确处理带有杂音的句法知识，很可能会被不准确的句法知识误导，做出错误的预测。

例如，在句子“他马上功夫很好”中，“马”和“上”应该分开（正确的标注应为“马_NN/上_NN”）。但按照一般的句法知识，却可能得到不准确的切分及句法关系，如“马上”。

斯坦福大学的自动句法分析工具结果，分成了“马上”

针对这一问题，创新工场的论文提出了一个基于双通道注意力机制的分词及词性标注模型。

该模型将中文分词和词性标注视作联合任务，可一体化完成。模型分别对自动获取的上下文特征和句法知识加权，预测每个字的分词和词性标签，不同的上下文特征和句法知识在各自所属的注意力通道内进行比较、加权，从而识别特定语境下不同上下文特征和句法知识的贡献。

这样一来，那些不准确的，对模型预测贡献小的上下文特征和句法知识就能被识别出来，并被分配小的权重，从而避免模型被这些有噪音的信息误导。

基于“双通道注意力机制”的分词及词性标注

即便在自动获取的句法知识不准确的时候，该模型仍能有效识别并利用这种知识。例如，将前文有歧义、句法知识不准确的句子（“他马上功夫很好”），输入该双通道注意力模型后，便得到了正确的分词和词性标注结果。

分词及词性标注实例

为了测试该模型的性能，论文在一般领域和跨领域分别进行了实验。

一般领域实验结果显示，该模型在5个数据集（CTB5，CTB6，CTB7，CTB9，Universal Dependencies）的表现（F值）均超过前人的工作，也大幅度超过了斯坦福大学的 CoreNLP 工具，和伯克利大学的句法分析器。

即使是在与CTB词性标注规范不同的UD数据集中，该模型依然能吸收不同标注带来的知识，并使用这种知识，得到更好的效果。

该模型在所有数据集上均超过了之前的工作

CTB5（CTB5是使用最多的中文分词和词性标注的数据集）结果

而在跨领域的实验中，和斯坦福大学的 CoreNLP 工具相比，该模型也有近10个百分点的提升。

跨领域分词实验（对话测试集）的结果

宋彦总结道，“从技术创新的角度，我们的贡献主要有两点。一是在现有技术的基础上，建立了一个一体化的模型框架，使用非监督方法构建词表，并把知识（信息）融入进来，使用更高层次的句法知识，来帮助词性标注，起到'他山之石，可以攻玉’的效果。二是主动吸收和分辨不同的外部知识（信息）。通过键-值记忆神经网络和双通道注意力机制，进行动态权重的分配，能够有效分辨知识，区分哪些是有效的，哪些是无效的。虽然这些知识是自动获取的、不准确的，但‘三个臭皮匠，顶个诸葛亮’，经过有效利用，总能凑出一些有用的信息。如何实现模型的主动吸收和分辨，就变得更加重要。”

一直以来，创新工场致力于衔接科技创新和行业赋能，做嫁接科研和产业应用的桥梁，为行业改造业务流程、提升业务效率。对中文分词技术的研究也是如此。

在宋彦看来，中文分词和词性标注是最底层的应用，对于接下来的应用和任务处理非常重要。例如对于文本分类、情感分析，文本摘要、机器翻译等，分词都是不可或缺的基本“元件”。

“在工业场景使用的时候，跨领域的模型能力是一个非常直接的诉求。”宋彦强调。

宋彦以搜索引擎的广告系统为例向TechWeb介绍，论文提及的新模型可以有效地实现广告在不同领域进行内容匹配的冷启动。“以现有模型，比方说在新闻领域学到的模型，如果碰到一个体育领域的广告，那么这个时候其中很多词会没办法正确切分出来。但是在使用我们的模型时候，在新领域进行广告内容推荐，可以讲新领域的知识和事先准备的关键词等，加入我们的模型，从而把目标文本中一些比较有效的关键词，通过更好的分词结果呈现出来，而这些关键词，可能会匹配到用户输入的一些词，或者说用户在特定的网页浏览背景下面他所碰到的一些内容。所以如果分词结果正确，就能够有效的把这两部分内的内容衔接，使得用户在搜索的时候，得到的广告内容跟搜索结果是匹配的。”

目前，这两篇论文的工具都已经开源。

分词工具： https://github.com/SVAIGBA/WMSeg

分词及词性标注工具： https://github.com/SVAIGBA/TwASP

（举报）

相关推荐
大家在看

关键词：

【腾讯云】11.11云上盛惠！云服务器首年1.8折起，买1年送3个月！

11.11云上盛惠！海量产品 · 轻松上云！云服务器首年1.8折起，买1年送3个月！超值优惠，性能稳定，让您的云端之旅更加畅享。快来腾讯云选购吧！

Docker容器镜像
去看看

Docker容器镜像 60元/15天

爆款产品组合购
去看看

爆款产品组合购低至1元

腾讯云x NVIDIA加速计划
去看看

腾讯云x NVIDIA加速计划最高获赠10万元扶持基金

2核2G云服务器
去看看

2核2G云服务器 112元/1年

查看更多相关信息>>

腾讯云 12-20

广告
AI自学超越人工标注训练，蚂蚁数科2篇自监督学习论文入选国际顶会

蚂蚁数科2项研究成果分别入选“欧洲计算机视觉会议”和“国际机器学习大会”，可实现无需人工打标数据的情况下，通过自监督学习、强化学习等方法训练模型输出可信结果。两项成果将被应用于视频版权保护和智能问答领域。自监督学习在为模型训练降本提效的同时，具备更好的知识泛化能力和持续学习能力，研究对推动AI发展有着深远意义。
营收暴增33%创新高：苹果在印度面临被调查

苹果在截至今年3月份的一年里，销售额较上年同期增长了约33%创下近80亿美元历史新高。还有知情人士透露称，iPhone占据了苹果在印度销售额的一半以上。若最终被确定违法，苹果可能面临罚款，并需要调整其商业行为。
领峰贵金属直击黄金创新高：降息封印或已解除？金价或直逼2500

要问今年地表谁最“旺”?可能非黄金莫属!7月17日，黄金价格势如破竹突破2480关口，最高至2483美元/盎司附近，再刷新历史记录!领峰贵金属观察发现，美联储“降息”封印或逐渐解除，市场资金疯狂涌入黄金，今年涨幅已达20%!且市场认为，价格涨势未完待续，突破2500或指日可待。领峰贵金属APP:金价创新高突破2480关口!鲍威尔讲话“震惊”市场黄金扶摇直上早前，美联储主席�
2024 SaaS+AI创新大赛，成功举办

2024SaaS遇见AI大模型创新大赛全国20强总决赛，以“发现AI的力量”为主题，于7月12日在苏州太美香谷里酒店成功举办。本次大赛由崔牛会主办，苏州太湖国家旅游度假区管委会指导，以及钻石合作伙伴火山引擎大力支持。玄武云·陈列指挥官，可以分析终端门店照片数据，自动生成门店评分及门店报告，帮助品牌商打造完美门店。

SaaS AI 大赛
“2024数字化转型标杆成果及创新成果”榜单正式揭晓

6月27日，“2024数字化转型标杆成果及创新成果”榜单正式发布。本次征集活动由行业媒体联合相关机构以及著名行业专家共同制定数字化转型领域高级别、权威性的竞争力评价指标体系。此次借助“2024数字化转型标杆成果及创新成果”推优榜单的发布，希望加强典型示范引领，破解适应新时代发展的关键要素，为我国企业的持续创新和转型升级提供有效路径。

数字化转型创新成果榜单智能化提升
中培政智教育集团与两大品牌联合举行2024中国国际金融品牌创新峰会

2024年7月12日，“2024第二十届中国国际金融品牌创新峰会暨第五届未来交易银行国际峰会”在中国·上海圆满落下帷幕。本次盛会由亚洲财金联合会、中培政智教育集团、上海士研咨询联合主办。亚洲财金联合会是非盈利性组织，作为中培政智教育集团旗下的重要智库平台，极具影响力和行业地位，承载着推动金融行业健康发展的重要使命;以高度的社会责任感，汇聚各方智慧与

金融国际峰会亚洲财金联合会
iPhone17或将移除Plus机型：Slim将专注于创新工业设计

根据分析师郭明錤的最新信息，苹果公司可能在iPhone17系列中取消Plus机型，转推出一款全新设计的iPhone17Slim。iPhone17Slim将不会是Plus机型的简单更名是一款专注于创新工业设计的超薄型iPhone，这标志着苹果正在探索一条新的产品线。尽管台积电的2nm工艺预计将在2025年底实现量产，但iPhone17系列可能无法赶上这一最新工艺。

iPhone17Slim 苹果新品创新设计
AI论文学术模型升级，有效解决了AI生成的论文AI率过高问题

传统的AI写论文工具往往存在一个问题，那就是生成的论文中AI生成内的比例过高，导致论文的原创性和学术价值受到质疑。我们非常荣幸地宣布，我们的AI写论文网站【论文智匠】已经完成了重大更新，增加了超低AIGC率生成通道，为广大学术研究者提供了更加高效、准确的论文写作支持。通过【论文智匠】的超低AIGC率生成通道，用户可以在短时间内生成高质量的论文草稿，从节省了大量的时间和精力。

AI写论文 AIGC 论文智匠
2024中国义乌日用百货科技创新博览会圆满闭幕！

7月26日，为期三天的2024中国义乌日用百货科技创新博览会圆满落下帷幕!日用百货行业是义乌小商品市场中发展历史较为悠久，产业链、供应链体系比较完善的行业，为义乌市场的经济发展和贸易出海作出了很大贡献。本届展会不局限于日用百货的传统领域，更汇集了许多科技赋能日用百货的创新成果，为展商打开国际市场销路。本届展会参展企业200多家，设国际标准展位500个

日用百货科技创新义乌市场
责任与创新并行，理光中国2023年可持续发展报告首发

理光中国正式发布其2023年可持续发展报告，深入解读理光在环境、社会与治理领域所取得的创新举措和卓越成果，生动诠释了理光对可持续发展的长期承诺和对全球环境责任的积极贡献。理光中国2023年可持续发展报告今年3月，理光修订了集团脱碳目标，旨在加快气候变化应对步伐，将温室气体需排放的范围1和范围2的目标从2050年提至2040年，力争使用100%可再生电力，并加强范围3的减排措施。通过技术创新与社会责任的双重驱动，能够克服挑战，引领行业迈向一个更加绿色、可持续的明天。

知了zKnown:致力于信息降噪 / 阅读提效的个人知识助手

知了 zKnown 是一款 AI-Native 构建的个人知识助手，专注于信息降噪和阅读提效。它通过多端同步、多渠道总结、长文本支持等功能，帮助用户高效地管理和整理信息。产品的主要优点包括：- 多端同步：用户可以在移动app、桌面客户端、网页版、小程序等多个平台同步使用。- 多渠道总结：支持微信公众号、知乎、简书、36Kr、少数派等多个渠道的文章总结。- 长文本支持：最长支持总结3万字的文章内容。- 摘要导出：用户可以将摘要保存到 Notion、Flomo 等平台。- 产品背景：知了 zKnown 致力于通过 AI 技术提升用户的阅读和信息管理效率，适合需要高效处理大量信息的用户。

信息管理阅读提效 AI助手

MBox AI Meet:实时转录与会议总结的谷歌会议扩展

MBox AI Meet是一款免费Chrome扩展，专为Google Meet设计，提供实时转录和自动生成会议总结的功能。它利用AI技术帮助用户在会议中专注于讨论，而无需担心记笔记。该工具通过实时转录捕捉会议的每一个细节，并在会议结束后自动生成总结，确保用户不会错过任何重要信息。MBox AI Meet的隐私优先策略确保会议安全，不存储任何音频或视频内容。此外，该扩展还计划在未来更新中增加更多AI功能，如发言人识别、实时AI助手等。

AI 会议管理实时转录

Klee:本地安全AI，保障数据隐私。

Klee是一款macOS原生的AI助手应用程序，专注于本地处理数据，确保数据安全和隐私。它使用先进的AI技术，如RAG（检索增强生成）和开源大型语言模型，如Llama 3和Mistral，为用户提供高效、智能的笔记、搜索和知识管理功能。Klee的主要优点包括本地运行以保护隐私、支持团队协作、免费使用以及优化的macOS体验。

AI助手 macOS原生数据隐私

Kipps.AI:快速构建AI助手，提升业务效率

Kipps.AI 是一个在线平台，允许用户在短短两分钟内构建自己的AI助手，并将其集成到业务中。该平台支持多种数据源，如PDF、Notion、网站链接和文本，用户只需提供这些数据，Kipps.AI 会处理其余部分。它还与常用的工具如GoDaddy、Wordpress、Drupal、Squarespace、Magento和Wix等进行集成，使得用户可以轻松地将AI助手集成到现有的业务流程中。

AI助手自动化数据处理

CrossPrism for MacOS:图像识别、标注和关键词生成工具

CrossPrism for MacOS 是一款专为摄影师设计的图像识别、标注和关键词生成工具。它利用多核 CPU、GPU 和神经引擎，能够识别物种、生成标题和描述，并支持模型训练的可定制性。用户可以在本地自动标注无限量的原始照片，确保所有照片安全地存储在 Mac 上，无需担心云服务中断、数据锁定或文件传输问题。其20多个专家模型可以对从鸟类到地标的各种内容进行分类，并提供新的视角来整理目录和重新发现旧照片。此外，它还支持视频处理、Lightroom 插件、图像质量评估等功能，使其成为一个强大的筛选工具。

创新工场两篇论文入选ACL2020 中文分词和词性标注新模型性能创新高

今日大家都在搜的词：

热文

站长商机