FEATURED · 精选文章

借助 AI 从 0 到 1 搭建图像对比服务(五):VLM 看图说话——让大模型亲眼看图,说出它看见了什么

发布时间 / 2026/9/1 23:44:45
来源 / 创域科博编辑部
栏目 / 资讯中心
借助 AI 从 0 到 1 搭建图像对比服务(五):VLM 看图说话——让大模型亲眼看图,说出它看见了什么 借助 AI 从 0 到 1 搭建图像对比服务五VLM 看图说话——让大模型亲眼看图说出它看见了什么一、场景CLIP 和 EXIF 都没解决的那个问题前两只眼睛装好了。CLIP 能比内容像不像EXIF 能查出生证。但做着做着我发现有个场景它俩都搞不定巡检牌上那行字。举个例子。巡检现场每台设备都挂一块牌子写着设备编号、上次保养日期、责任人。工人正常巡检拍的照片上这块牌子清清楚楚有人偷懒拿一张长得差不多的图来顶牌子上那行字其实不一样。CLIP 看这两张图都是厂房的牌子构图一样相似度 0.9——它觉得像。可实际上牌子上的字都对不上这就是该出问题的巡检记录。CLIP 不懂文字EXIF 又只管元数据。要看出字不一样得有人真的把图看一遍读出里面的字。这就是第三只眼睛VLM——视觉大模型让 AI 亲眼看图。二、VLM 是啥先让 AI 讲人话老规矩先问VLM 是啥它跟 CLIP 有啥区别我在巡检场景里能让它帮我看出什么来AI 的回答我翻译一下CLIP 是瞄一眼说像不像VLM 是盯着看半天把看到的说给你听。区别在于输出。CLIP 忙活半天最后只给你一个数相似度 0.9是个哑巴。而 VLM 是个话痨——你给它一张图它能张口说出一大段图里有什么字OCR、有什么东西物体、是个什么场景描述。我要的就是这个——不是让它打个分是让它把图读出来读到字、读到物体我再去比两张图读出来的内容像不像。通过AI匹配硬件资源我用了 Qwen 系的视觉模型Qwen2.5-VL一个开源的视觉多模态大模型本地跑不依赖外部 API。三、给 AI 的指令让它一次说全模型选好了接下来是设计它怎么个说法。AI一开始的想法很简单OCR 是一个任务、认物体是一个任务、描述场景又是一个任务那就分三次调。请分析这张图片返回 JSON 格式 {ocr_text: 识别到的所有文字, objects: [物体1, 物体2], description: 图片描述} 只输出 JSON不要输出其他内容。我想了一下分三次调等于每次都要把整张图再发一遍给模型网络开销三倍、推理三倍、时间三倍。而视觉模型本来就支持看图答多题一次给一张图让它一口气把文字、物体、描述都吐出来用 JSON 包好最划算。我把任务固化成一个叫all的预设OCR 物体 描述三合一以后要单测某一项也留着独立的入口但默认就走这个一次说全。四、落地跟一个话痨打交道的三件麻烦事模型开始返回内容后我发现跟VLM打交道真不是把结果拿来就用有三件麻烦事。麻烦一它说话不老实爱带包装明明让它只输出 JSON它偏要画蛇添足。有时候前面加句好的我来分析有时候把 JSON 包在 markdown 的代码块里json {ocr_text: ...}我拿 json.loads 一看根本无法解析——因为带了代码块标记和废话。 AI 给的解法是**容错解析**先把输出里的 json 代码块剥掉再从第一个 { 到最后一个 } 截取硬抠出 JSON 对象万一 JSON 也有问题再退一步找第一个 [ 到 ]。一层层兜底总有一层能救回来。 这个细节很能说明问题**模型输出是人话不是程序返回值。** 你不能指望它严格守规矩得在客户端做好容错解析。 ### 麻烦二超时了怎么办 视觉模型看图比纯文本慢多了。图片一复杂可能几秒到几十秒都等不到回答。要是请求挂在那整个接口就堵死了。 AI 的处理是**给每次调用设超时超时就标记为失败但绝不让它卡死整个流程。** 而且专门加了个健康检查——在正式干活前先探一下 VLM 服务还活着没GET 一下 /v1/models挂了就直接跳过不白等。 这背后是工程里常说的**快速失败**宁可这次分析失败也不让一个慢服务拖垮全局。 ### 麻烦三VLM 挂了我怎么办 最核心的一个设计问题**VLM 如果不可用了整个服务是不是就得宕掉** AI 的处理很果断VLM 是**可选增强**不是必需。代码里用 enable_vlm 控制默认关。为什么默认关因为它是四只眼睛里**最贵的**——每次都要下载/传图、跑一次大模型推理CLIP 是毫秒级VLM 是秒级成本差一个量级。 于是定下规矩 - **VLM 没启用 / 不可用 → 不影响主流程**其他维度照常打分 - **VLM 可用 → 权重给足**CLIP 权重从 0.5 自动降到 0.9把 VLM 那份让出来总权重始终守恒。 一句话**VLM 是锦上添花不是雪中送炭。它坏了服务照样跑只是少了一双眼睛。** ## 五、怎么比读出来的内容 VLM 把两张图都读出来了怎么比读得像不像这里又有两个维度我逐个验收。 ### 维度一文字像不像OCR 相似度 模型读出了两串文字比如牌子上那行字怎么比AI 用了 Python 内置的 difflib 里的 SequenceMatcher算两段文本的相似度0~1。 原因很简单**它比的是文本序列有多像不是完全一样。** 巡检牌上如果有个字被树挡了一点OCR 可能读错一个字SequenceMatcher 照样能给出 0.9 的高分——比死板的全等判断实用得多。 ### 维度二物体像不像物体重叠度 模型还读出了两串物体列表比如图一是 [管道, 阀门, 仪表]图二是 [管道, 阀门, 仪表, 工人]。怎么比 AI 用了**Jaccard 重叠度**公式就一句大白话 text 重叠度 两串物体都有的数量 ÷ 两串物体加起来的所有数量图一 3 个、图二 4 个共有的是管道、阀门、仪表3 个并集是管道、阀门、仪表、工人4 个重叠度 3/4 0.75。想了想合理性它惩罚多出来的东西——图二多了一个工人说明场景里多了个人重叠度就降了这正好符合我防作弊要抠细节的需求。合起来打分最后AI 把两个维度加权合成一个 VLM 内容分VLM 内容分 OCR 相似度 × 0.6 物体重叠度 × 0.4OCR 占六成因为对巡检防作弊来说文字设备编号、日期是最硬的信息物体只是辅助判断场景。哪个维度没数据就只算有的那个。这个权重倾向我也认同——字对不上比场景里多个东西严重得多。六、小结AI 在整合复杂能力上的价值第三只眼睛装完了。这只跟前两只都不一样——CLIP 和 EXIF 是算一个数VLM 是把一个会说话的大模型调教成合身的看图助手。我在这章最有收获的三点它帮我克制了想当然我以为 OCR、认物、描述要分三次调它一句话点醒——一次调用全包了省三倍成本。AI 会给出我没想到的优化路径。它把VLM返回的自然语言变成了标准动作容错解析、超时、健康检查、快速失败这些跟AI 打交道才特有的坑它全都提前铺好了路。跟 VLM 沟通跟调普通 API 完全是两回事。它始终坚持主流程不被拖垮VLM 再强也是可选项默认关、挂了不影响大局、权重自动守恒。贵的眼睛永远是辅助。四只眼睛装好三只了。剩最后一只也是防作弊最对症的一只——防翻拍检测专门对付那种拿屏幕/照片再拍一遍的作弊手法。下一篇进第四只眼睛也是最有工业味的一只。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻