基础认知:拆分实体,织成知识网
实体识别,说穿了就是帮机器从一大段文字里,把具体的「人、事、物」给挑出来,打上分类标签。
比如你发了一条朋友圈:“周末去故宫看了《清明上河图》特展”,实体识别会自动把「故宫」标成景点,「清明上河图」标成古画,特展标成活动。
知识图谱呢,就是把这些识别出来的实体,按相互关系连起来。比如故宫在北京,清明上河图现藏于故宫,作者是张择端,这些关系连在一起,就是一张小型知识图谱。

实操中容易踩的误区
说实话,很多刚上手做小项目的朋友,很容易栽在实体歧义这个坑里。
比如你做电商知识图谱,搜“小米”,机器要是没做好上下文判断,会把谷物小米和小米手机混在一起,出来的结果完全不对。
据一些用户反馈,十个体积不大的知识图谱项目,有六七个都在初期遇到过歧义识别的问题。解决这个问题,通常要给模型加入上下文关联判断,再结合行业的实体词典,就能大幅降低出错概率。

需要留意的是,不同行业对要识别的实体要求完全不同。医疗场景要识别病症、药品,金融场景要识别企业、标的,没有通用模型能适配所有需求。
它给日常找信息带来了什么变化

有意思的是,和早年全关键词匹配的搜索比,这套技术把找信息的逻辑从“匹配文字”改成了“理解语义”。
以前你搜“广州有哪些孙中山相关的景点”,搜索引擎会把所有带“广州”“孙中山”“景点”的网页堆给你,你得自己翻。现在用知识图谱加实体识别,直接会把各个景点按关系整理出来,连开放时间、位置都给你聚合好。
从实操角度看,现在很多企业整理内部知识库,都会用这套技术,把存量文档里的客户、项目、产品实体抽出来搭网,找相关资料的效率提升不少。
您在实际接触知识图谱与实体识别的过程中,还遇到过哪些问题?欢迎结合具体场景继续探讨。