聊聊日常随处可见的多模态内容检索

现在你刷内容找资料的时候,其实早就用上了多模态内容检索,只是很多人没注意到。

多模态内容检索到底是什么

简单说,就是能同时处理不同格式的内容信息的检索方式。 不像早年的检索,要么只能搜文字,要么只能搜图片。它能把文字、图像、音频、视频这些不同类型的信息,融合起来找你要的内容。 举个例子,你去郊外玩看到一株没见过的野花,拍了照片,又记得它春天开、花是淡紫色的,把照片和文字描述一起输进去搜,很快就能出结果。 这个过程,就是典型的多模态内容检索。
拍照搜花多模态内容检索应用场景
拍照搜花多模态内容检索应用场景

用的时候要避开这些常见误区

从实操角度看,很多人用不好是踩了坑。 第一个坑,主体不清晰,拍照的时候带了太多无关背景。据一些用户反馈,拍产品搜型号的时候,把桌面的水杯、书本都拍进去,系统检索的时候很容易认错主体,结果出一堆不相关的内容。 第二个坑,不同模态的信息互相冲突。比如你上传了一张橘子的图,又搜“红色的带核水果”,系统融合特征的时候就会混乱,给出的结果偏差很大。 需要留意的是,我们通常可以调整一下使用习惯:拍照的时候把目标放在画面中心,文字只补充图像说不清楚的特征,就够了。
多模态内容检索正确错误结果对比图
多模态内容检索正确错误结果对比图

它和普通单模态检索有什么不一样

它和普通单模态检索有什么不一样
它和普通单模态检索有什么不一样
有意思的是,不少人会把搜图功能直接等同于多模态检索,其实不对。 普通搜图是单模态,你传图就只比对图像特征,你打字就只匹配文字内容。多模态检索是融合多种模态的特征一起计算结果,能还原更复杂的用户需求。 比如你找一部记不清名字的老电影,只记得某个镜头是雨天公交站,女主穿红大衣,说过一句“明天地铁站见”。你截个模糊的镜头,再把这句台词输进去,很快就能锁定目标。 换做单模态检索,要么搜台词出来几十部带同名台词的电影,要么搜图片因为画面模糊匹配不对,效率差很多。 说实话,现在主流的搜索引擎、内容社区都在用这个技术,只是它藏在后台,用户感受不到而已。 您在实际使用多模态内容检索的时候,还遇到过哪些有意思的问题?欢迎结合具体场景继续探讨。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:聊聊日常随处可见的多模态内容检索
文章链接:https://www.ttrenwu.com/geo/1940.html