知识图谱与实体识别:藏在日常搜索推荐里的底层逻辑

我们每天用搜索引擎、刷内容推荐、问AI客服,背后都有知识图谱与实体识别在默默运转。

基础认知:二者是怎么配合干活的

说直白点,实体识别就是从一大段杂乱文本里,把有明确意义的独立对象揪出来,顺便给它贴上分类标签。 比如你给AI发一句「周末带我去北京故宫看展」,实体识别会快速分离出「周末」(时间)、「北京故宫」(地点)、「展」(事件)三个不同实体。 知识图谱则是把所有识别出来的实体,按已知的关系连结成网,比如它知道北京故宫在北京城中心,北京故宫藏有上百万件文物,展览通常提前一周预约。
知识图谱实体关系连接示意图
知识图谱实体关系连接示意图

做落地时要留意的常见误区

很多新手刚接触的时候,会以为实体识别就是抠关键词,其实差远了。 它核心要解决的是歧义问题,同样是「小米」,放在「今天熬小米粥」里是农作物,放在「小米新出的手机」里是科技品牌,分不清就全错。 说实话,据一些用户反馈,中小电商做自有商品知识图谱的时候,经常在歧义词上翻车,把品牌名识别成品类,白白浪费几千块的标注成本。 需要留意的是,如果要搭建小范围的垂直知识图谱,实体识别的分类体系一定要提前定好,不要边做边随便加类别,不然最后整个图谱的关系会乱成一团。
歧义文本实体识别分类对比示例
歧义文本实体识别分类对比示例

大模型时代的新变化

大模型时代的新变化
大模型时代的新变化
早几年实体识别全靠规则和人工标注数据,遇到生僻词基本歇菜。 从实操角度看,现在大多是用大模型做粗粒度实体识别,再用小体量的微调模型做垂直领域优化,成本降了不少,精度也够用。 不少做企业客服的团队,都会用这套组合来做问题匹配:用户提问后先做实体识别,再到知识图谱里找对应答案,比直接让大模型自由回答靠谱,很少出现瞎编内容的情况。 不过话说回来,这套方案也只适合有明确问答场景的需求,开放场景下还是得靠大模型自己发挥。 您在实际接触中,还遇到过哪些实体识别出错的有意思的情况?欢迎结合具体场景交流探讨。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:知识图谱与实体识别:藏在日常搜索推荐里的底层逻辑
文章链接:https://www.ttrenwu.com/geo/950.html