目录

一、实体消歧

二、实体统一

1.编辑距离

2.基于规则

3.监督学习方法

4.基于图的实体统一


一、实体消歧

当个实体有多个解释的时候,可以通过计算相似度的方式,消除歧义。

比如下面的例子,我们找到 “苹果”的所有解释的描述,转成向量,再将文本中包含“苹果”的句子,转成向量,将这个向量和所有的解释的向量进行相似度计算,选择相似度最高的。

二、实体统一

实体统一是把包含不同的字段的实体,映射到同一个原型上。比如“百度公司”、“百度有限公司”等,全部映射为“百度”。

1.编辑距离

得到两个实体之后,直接计算字符串(代表的就是实体)之间的编辑距离。效果可能一般,但是可以作为baseline使用。

2.基于规则

例如:百度有限公司、百度科技有限公司、百度广州分公司

我们指定几条规则,比如:

第一条:包含“有限公司、分公司、科技有限公司”之类的字眼,就删去

第二条:包含“广州、深圳”等地名的字眼,也删去

这样最后也可以得到一个映射。

3.监督学习方法

该方法和其他监督学习方法基本一致,先准备好训练数据,也就是所有标记为“百度”的实体,对这些实体提取特征,然后进行训练。

提取特征依旧是最重要的一步,以前的文章提到过的方法都可以用,也可以人工添加新特征。

4.基于图的实体统一

如果有些关系可以用图来表示,那么就可以基于图,来寻找相关特征,一方面是实体本身的特征,另一方面是基于图的特征,比如距离等。然后设定一个相似度阈值,超过就合并为一个,否则就保持不变。

NLP-实体消歧/实体统一相关推荐

  1. 信息抽取之实体消歧,统一

    1.前言 信息抽取相关内容可以参考信息抽取简介 和关系抽取详解 2.实体消歧的本质 如小米,它是一个实体,在有些句子中表示"小米公司",但在某些语句下它表示一种谷物 又比如: 怎么 ...

  2. nlp(贪心学院)——实体消歧、实体统一、指代消解、句法分析

    任务212:Entity Disambiguation (实体消歧)介绍 小米是公司还是吃的? 苹果是公司还是吃的? 根据左边的上下文找出左边的James Craig到底是右边(1)(2)(3)哪个J ...

  3. 知识图谱(五)——实体消歧

    一.任务概述 多样性--同一实体在文本中会有不同的指称.eg:飞人.帮主.老大和MJ都指美国篮球运动员迈克尔·乔丹 歧义性--相同的实体指称在不同的上下文中可以指不同的实体.eg:迈克尔·乔丹指美国篮 ...

  4. 【创新实训】BERT4EL,基于文本相似度的实体消歧实现

    任务描述 现有douban.mtime.maoyan三个来源的电影,包含名称.简介.导演.演员.类型等等属性. 需要相同的电影融合为一个电影条目,其中maoyan数量很少,可以合并到mtime中. 参 ...

  5. 【工程处理技巧一篇】基于半规则数据的命名实体消歧识别【未完】

    作者:finallyly 出处:博客园(转载请注明作者和出处) 看到这篇文章的标题,您一定会以为此篇博客要讲解一个何等高深的算法.其实不然,本篇博客旨在分享笔者在处理那些繁杂.冗踏.低端甚至于极其TM ...

  6. 实体统一,实体消歧, 指代消解

    指代消解:比较难,目前还没有得到很好的结果.

  7. 命名实体如何进行概念消歧?

    1 引言 命名实体概念消歧是命名实体消歧(英语:Named Entity Disambiguation)的一个重要研究子领域(命名实体概念可见本文3.1章).什么叫概念消歧了?在这里举一个简单例子进行 ...

  8. 文献阅读课10-Neural Relation Extraction for Knowledge Base Enrichment(提取+嵌入+消歧+规范化联合模型,实体已知,仅关系抽取,多词实体)

    文章目录 Abstract 1.Introduction 2. 相关工作 2.2 Entity-aware Relation Extraction 3.提出的模型 3.1 Solution Frame ...

  9. 【极简】实体识别和消歧

    文章目录 命名实体识别 消除歧义 TF-IDF句向量(有监督) 词周边特征 TF-IDF特征(有监督) 词向量(无监督) 基于规则的内联修改权重方法 变种:地名消歧 正则表达式 命名实体识别 impo ...

  10. 【NLP】NLP中的消歧

    作者 | Nesrine Sfar 编译 | VK 来源 | Towards Data Science 如果你点开这篇文章,这意味着你有足够的好奇心去学习关于NLP/NLU中解决歧义的不同方法. 背景 ...

最新文章

  1. 二次元控、视宠如命,95后占主力的女程序员原来这么飒
  2. python excelwriter保存路径_python管理文件神器 os.walk
  3. 计算机模拟虫洞,Canvas 3D虫洞模拟
  4. 无法连接 MKS: Login(username/password)incorrect
  5. how to find element's document section
  6. 电子设计竞赛电源题(2)-检波与采样
  7. docker安装mysql8,Docker安装Mysql8.0,并配置忽略大小写
  8. 图解算法学习笔记(四):快速排序
  9. 计算机学术英语常见词汇短语总结
  10. 计算机接口技术 实验箱,微机原理及接口技术实验箱.doc
  11. 【PS CS6】替换证件照背景色
  12. Chloe and the sequence
  13. vs2013 c++項目轉 vs2008
  14. OptaPlanner的新约束表达方式 Constraint Streams
  15. MAC盗版软件下载网站黑名单
  16. 语言与区域设置ID (Language ID、Locales ID / LCID)
  17. 2015数据库年度盘点
  18. arcgis字段取最大值 公式_一蹴而就 丨 借用ArcGIS快速计算地块容积率
  19. OpenWrt下SSR与XWare迅雷远程冲突问题
  20. 【计算机系统和网络安全技术】第九章:防火墙与入侵防御系统

热门文章

  1. 如何手动启动消防广播_消防应急广播应如何规范设置?
  2. Visual Studio 2019专业版密匙
  3. 固定效应or随机效应?如何用matlab进行豪斯曼检验
  4. SSM整合尚硅谷Spring
  5. NVIDIA-SMI
  6. geoserver中sld设置
  7. 在微型计算机中svga的含义是什么,在微机中,VGA的含义是什么?
  8. Android系统 固定住CPU频率
  9. java 杨辉三角_JAVA实现杨辉三角的三种方式
  10. 从全面了解高级计量经济学体系+stata实操+实证研究前沿+论文+大数据机器学习+空间计量......._Stata高级计量经济学 陈强