基础认知:两个配合干活的核心模块
实体识别是第一步,简单说就是从杂乱的文本、语音信息里,把有明确意义的独立单元摘出来。大到地名、人名,小到产品名、疾病名,都是常见的实体类型。
知识图谱则是把摘出来的实体,按照实际关系连起来,织成一张可以查询的关系网。
比如你搜“杭州诞生的新消费品牌”,实体识别先拆分出“杭州”“新消费品牌”两个核心实体,知识图谱再从已有的关系网里匹配出符合条件的结果,直接给到你。

实操里容易踩的常见误区
说实话,很多刚入门的团队都会踩第一个坑:觉得实体拆分得越细越好。
做电商商品知识图谱,你没必要把“包装盒的淡蓝色”拆成独立实体,完全是徒增计算量,对结果没什么帮助。
据一些用户反馈,不少小项目刚开始就设了二三十种实体类型,最后跑起来准确率很低,还要回头返工重新梳理,平白浪费时间。
第二个误区是建好图谱就不管了。实体和关系都是动态变化的,比如新出圈的网红品牌、新上任的企业负责人,长期不更新,图谱就会变成没用的旧信息。

普通人能接触到的应用场景

除了搜索引擎,现在智能客服、内容推荐都在用这个组合。
比如奶茶品牌的线上智能点单,你说“我要一杯少糖的四季春”,实体识别会拆分出“少糖”“四季春”,知识图谱对应到对应的产品、规格,直接就能下单,不用一步步点选项。
有意思的是,现在很多文献检索平台也在用,能自动把论文里的研究对象、核心结论拆成实体,关联到同领域的其他研究,找相关文献比以前快很多。
不过话说回来,目前技术还是有局限,遇到一词多义的场景,还是容易认错实体,比如“小米”到底是谷物还是数码品牌,还需要结合上下文做二次判断。
您在实际使用中还遇到过哪些和知识图谱与实体识别相关的场景?欢迎一起探讨。