基础认知:二者到底在做什么
知识图谱是把各类零散信息按关联连接起来的网状知识库,实体识别则是从杂乱文本里提取关键实体的技术。
举个例子,你在搜索引擎输入“黄渤主演的青岛籍导演作品”,系统能快速从中拆分出“黄渤”(人物实体)、“青岛”(地名实体)、“导演”(身份实体),这就是实体识别的作用,再通过知识图谱里存储的关联关系,直接给你列出对应作品,不用你逐个筛选网页。
电商平台的个性化推荐,也常用这套逻辑:识别你浏览过的品牌、品类实体,再从知识图谱里找到关联商品推给你。

实际应用里要注意的常见误区
说实话,很多刚接触的人都会觉得实体识别准确率已经足够高,其实不然。
据一些用户反馈,遇到同词异义或者模糊指代的时候,很容易出错误。比如单独出现的“小米”,到底是农作物还是科技品牌?不结合上下文,模型很容易识别错。
搭建应用的时候,一定要给实体识别模型加入足够的上下文特征,不然实体错了,整个知识图谱的关联逻辑都会混乱。
另外,知识图谱不是建完就可以扔在一边,新的实体不断出现,比如新上线的产品、新走红的公众人物,通常需要定期做增量更新,这个步骤很多团队会漏掉。

小疑问:二者为什么总是绑定出现

有意思的是,很多资料都会把两者放在一起讲,其实有必然逻辑。
实体识别是知识图谱的“入口”,没有实体识别从公开文本、用户数据里提取出新的实体,知识图谱就没法添加新的节点和关联。反过来,知识图谱积累的关联数据,又能反过来帮实体识别提高准确率,比如上下文里出现“手机”“发布会”,就能确定这里的“小米”是品牌实体。
不过话说回来,也有单独使用实体识别的场景,比如做新闻稿的关键词标注,不一定需要搭建完整的知识图谱,一切看实际需求。
您在实际使用中还遇到过哪些情况?欢迎结合具体场景继续探讨。