NLP-实体消歧/实体统一
目录
一、实体消歧
二、实体统一
1.编辑距离
2.基于规则
3.监督学习方法
4.基于图的实体统一
一、实体消歧
当个实体有多个解释的时候,可以通过计算相似度的方式,消除歧义。
比如下面的例子,我们找到 “苹果”的所有解释的描述,转成向量,再将文本中包含“苹果”的句子,转成向量,将这个向量和所有的解释的向量进行相似度计算,选择相似度最高的。
二、实体统一
实体统一是把包含不同的字段的实体,映射到同一个原型上。比如“百度公司”、“百度有限公司”等,全部映射为“百度”。
1.编辑距离
得到两个实体之后,直接计算字符串(代表的就是实体)之间的编辑距离。效果可能一般,但是可以作为baseline使用。
2.基于规则
例如:百度有限公司、百度科技有限公司、百度广州分公司
我们指定几条规则,比如:
第一条:包含“有限公司、分公司、科技有限公司”之类的字眼,就删去
第二条:包含“广州、深圳”等地名的字眼,也删去
这样最后也可以得到一个映射。
3.监督学习方法
该方法和其他监督学习方法基本一致,先准备好训练数据,也就是所有标记为“百度”的实体,对这些实体提取特征,然后进行训练。
提取特征依旧是最重要的一步,以前的文章提到过的方法都可以用,也可以人工添加新特征。
4.基于图的实体统一
如果有些关系可以用图来表示,那么就可以基于图,来寻找相关特征,一方面是实体本身的特征,另一方面是基于图的特征,比如距离等。然后设定一个相似度阈值,超过就合并为一个,否则就保持不变。
NLP-实体消歧/实体统一相关推荐
- 信息抽取之实体消歧,统一
1.前言 信息抽取相关内容可以参考信息抽取简介 和关系抽取详解 2.实体消歧的本质 如小米,它是一个实体,在有些句子中表示"小米公司",但在某些语句下它表示一种谷物 又比如: 怎么 ...
- nlp(贪心学院)——实体消歧、实体统一、指代消解、句法分析
任务212:Entity Disambiguation (实体消歧)介绍 小米是公司还是吃的? 苹果是公司还是吃的? 根据左边的上下文找出左边的James Craig到底是右边(1)(2)(3)哪个J ...
- 知识图谱(五)——实体消歧
一.任务概述 多样性--同一实体在文本中会有不同的指称.eg:飞人.帮主.老大和MJ都指美国篮球运动员迈克尔·乔丹 歧义性--相同的实体指称在不同的上下文中可以指不同的实体.eg:迈克尔·乔丹指美国篮 ...
- 【创新实训】BERT4EL,基于文本相似度的实体消歧实现
任务描述 现有douban.mtime.maoyan三个来源的电影,包含名称.简介.导演.演员.类型等等属性. 需要相同的电影融合为一个电影条目,其中maoyan数量很少,可以合并到mtime中. 参 ...
- 【工程处理技巧一篇】基于半规则数据的命名实体消歧识别【未完】
作者:finallyly 出处:博客园(转载请注明作者和出处) 看到这篇文章的标题,您一定会以为此篇博客要讲解一个何等高深的算法.其实不然,本篇博客旨在分享笔者在处理那些繁杂.冗踏.低端甚至于极其TM ...
- 实体统一,实体消歧, 指代消解
指代消解:比较难,目前还没有得到很好的结果.
- 命名实体如何进行概念消歧?
1 引言 命名实体概念消歧是命名实体消歧(英语:Named Entity Disambiguation)的一个重要研究子领域(命名实体概念可见本文3.1章).什么叫概念消歧了?在这里举一个简单例子进行 ...
- 文献阅读课10-Neural Relation Extraction for Knowledge Base Enrichment(提取+嵌入+消歧+规范化联合模型,实体已知,仅关系抽取,多词实体)
文章目录 Abstract 1.Introduction 2. 相关工作 2.2 Entity-aware Relation Extraction 3.提出的模型 3.1 Solution Frame ...
- 【极简】实体识别和消歧
文章目录 命名实体识别 消除歧义 TF-IDF句向量(有监督) 词周边特征 TF-IDF特征(有监督) 词向量(无监督) 基于规则的内联修改权重方法 变种:地名消歧 正则表达式 命名实体识别 impo ...
- 【NLP】NLP中的消歧
作者 | Nesrine Sfar 编译 | VK 来源 | Towards Data Science 如果你点开这篇文章,这意味着你有足够的好奇心去学习关于NLP/NLU中解决歧义的不同方法. 背景 ...
最新文章
- 二次元控、视宠如命,95后占主力的女程序员原来这么飒
- python excelwriter保存路径_python管理文件神器 os.walk
- 计算机模拟虫洞,Canvas 3D虫洞模拟
- 无法连接 MKS: Login(username/password)incorrect
- how to find element's document section
- 电子设计竞赛电源题(2)-检波与采样
- docker安装mysql8,Docker安装Mysql8.0,并配置忽略大小写
- 图解算法学习笔记(四):快速排序
- 计算机学术英语常见词汇短语总结
- 计算机接口技术 实验箱,微机原理及接口技术实验箱.doc
- 【PS CS6】替换证件照背景色
- Chloe and the sequence
- vs2013 c++項目轉 vs2008
- OptaPlanner的新约束表达方式 Constraint Streams
- MAC盗版软件下载网站黑名单
- 语言与区域设置ID (Language ID、Locales ID / LCID)
- 2015数据库年度盘点
- arcgis字段取最大值 公式_一蹴而就 丨 借用ArcGIS快速计算地块容积率
- OpenWrt下SSR与XWare迅雷远程冲突问题
- 【计算机系统和网络安全技术】第九章:防火墙与入侵防御系统
热门文章
- 如何手动启动消防广播_消防应急广播应如何规范设置?
- Visual Studio 2019专业版密匙
- 固定效应or随机效应?如何用matlab进行豪斯曼检验
- SSM整合尚硅谷Spring
- NVIDIA-SMI
- geoserver中sld设置
- 在微型计算机中svga的含义是什么,在微机中,VGA的含义是什么?
- Android系统 固定住CPU频率
- java 杨辉三角_JAVA实现杨辉三角的三种方式
- 从全面了解高级计量经济学体系+stata实操+实证研究前沿+论文+大数据机器学习+空间计量......._Stata高级计量经济学 陈强