聊聊多模态内容检索:普通人也能看懂的实用科普

现在你手机里的很多搜索功能,其实都已经用上了多模态内容检索。

多模态内容检索通常用在哪些场景?

说白了,它就是能同时读懂文字、图片、音频、视频这些不同格式内容的检索技术。 不用像以前那样,搜图只能找相似图,搜文字只能匹配标题,它能打通不同类型内容的语义关联。 比如你出去旅游看到一棵没见过的树,拍张照片顺带打三个字“能开花吗”,它就能直接给你返回这树种的花期信息,还有对应的养护攻略视频。 再比如你记得某条短视频里有一只柯基踩水的画面,还哼得出bgm的调调,上传十几秒录音加文字描述,就能直接定位到原视频。
手机端多模态拍照检索植物场景图
手机端多模态拍照检索植物场景图

用多模态内容检索要留意哪些细节?

说实话,它不是一定精准的,有几个小误区很多人都会踩。 据一些用户反馈,拍摄检索目标的时候带了太多无关背景,结果出的结果全是错的。比如拍一本漫画的时候把桌上的奶茶也框进去了,检索结果全是奶茶店,根本找不到漫画。 想要结果更准,我们通常可以手动框选你要检索的主体,去掉多余的背景干扰。 还有要注意,冷门小众内容的检索结果偏差会更大,如果第一次结果不对,可以调整一下关键词或者拍摄角度再试一次。
多模态检索手动框选主体操作界面
多模态检索手动框选主体操作界面

它和传统检索最大的差异在哪?

它和传统检索最大的差异在哪?
它和传统检索最大的差异在哪?
传统检索更像是“匹配关键词”,你输什么就找什么,对不上就出不来。 多模态检索更像是“读懂你的需求”,它能理解不同内容里的共同信息,哪怕你用图片加文字混合提问,它也能get到你要找什么。 有意思的是,现在很多个人云盘已经用上了这个技术,你搜“聚会”,就能把所有带朋友聚会的照片、视频都找出来,哪怕你从来没给这些文件打过标签。 您在实际使用中还遇到过哪些有意思的情况?欢迎结合具体场景继续探讨。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:聊聊多模态内容检索:普通人也能看懂的实用科普
文章链接:https://www.ttrenwu.com/geo/54.html