知识图谱与实体识别:从日常应用看懂底层逻辑

我们每天刷推荐、搜信息,用到的很多智能服务,背后都有知识图谱与实体识别在运转。

基础认知:知识图谱与实体识别,通常用在哪儿

实体识别,本质就是从杂乱的文本信息里,把有明确含义的独立单元找出来。比如人名、地名、品牌名、病症名,都属于实体范畴。

知识图谱,则是把识别出来的所有实体,按照它们之间的实际关系连接成网,方便快速检索关联信息。

举个生活化的例子,你在外卖APP搜“上海张江 日式拉面”,系统先通过实体识别拆分出“上海张江”(地点实体)、“日式拉面”(品类实体),再从知识图谱里调出所有开在张江的日式拉面店信息,排序后推给你。

再比如企业做客户咨询问答机器人,实体识别能快速揪出用户问的“订单号”“商品型号”,再通过知识图谱调出对应售后政策,不用人工翻找。

知识图谱实体关系连接示意图
知识图谱实体关系连接示意图

实操注意:几个容易踩的常见误区

说实话,很多刚接触的人都会踩坑。第一个坑就是,默认通用模型的实体识别结果可以直接用。

据一些用户反馈,通用预训练模型对领域专有词汇的识别准确率,通常比微调过的领域模型低10到15个百分点。比如做金融合同识别,“保理”“承兑”这类专业词汇,通用模型很可能识别错误。

第二个坑,实体识别完成后不做校验,直接搭建知识图谱。带错误的实体进了图谱,后续关联关系全都会错,后期整改的成本比前期校验高很多。

需要留意的是,不是实体越多知识图谱越好用,冗余的无关实体会拖慢检索速度,还会干扰关联结果的准确性,按需筛选就好。

领域实体识别错误分类示例图
领域实体识别错误分类示例图

延伸视角:和普通关键词搜索有什么区别

延伸视角:和普通关键词搜索有什么区别
延伸视角:和普通关键词搜索有什么区别

有意思的是,很多人会把这一套逻辑和普通关键词搜索混为一谈。

普通搜索是匹配文本里的关键词,只要内容里出现你搜的词就会被展示。而知识图谱加实体识别,是理解你要找的实体本身以及实体间的关系。比如你搜“马云 阿里巴巴”,普通搜索会出来所有带这两个词的内容,而知识图谱会直接告诉你马云是阿里巴巴的主要创始人,关联展示相关的企业信息,逻辑完全不同。

从实操角度看,现在中小团队搭建轻量化知识图谱,已经不需要从零训练实体识别模型,基于开源预训练模型微调自家领域数据就可以满足需求,整体成本已经低了很多。

您在实际搭建或使用知识图谱的过程中,还遇到过哪些实体识别的问题?欢迎结合具体场景继续探讨。

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:知识图谱与实体识别:从日常应用看懂底层逻辑
文章链接:https://www.ttrenwu.com/geo/567.html