工业质检 · 开放词汇实测
3 模型 · 9 张图 · RTX 5060 Ti · conf≥0.10 · 2026.07
前两篇把视觉几何跑通了:匹配、深度、点云。这一篇换方向——工业质检最朴素的第一步:用文本提示把目标框出来。
听起来很美:不用标注,写一句 metal bar,模型就该找到金属条。我们在同一块消费卡上,用 YOLO-Worldv2-S/M 和 OWL-v2-Base 实测了一组金属件 + 真实场景图。

结论:开放词汇检测在自然场景上已经很好用;但在光秃秃的工业金属件上,三个主流模型全部 0 命中。瓶颈不是显卡,是领域鸿沟。
工业视觉里,「定位」往往先于「判缺陷」。开放词汇(open-vocabulary)承诺:写文本提示就能出框,无需为每个零件重训检测头。
写对提示词,能不能稳定框住金属条?
项 | 配置 |
|---|---|
GPU | RTX 5060 Ti 16GB |
模型 | YOLO-Worldv2-S / M · OWL-v2-Base |
金属件 | 5 张(template / 平移 / 暗光 / 遮挡 / 组合) |
场景图 | 4 张(bike / building / fire / toronto) |
金属提示 | metal bar / metal rod / steel bar … |
命中定义 | 存在任意检测 conf≥0.10 |

图 1 · 三模型推理耗时与峰值显存
模型 | ms ↓ | GB ↓ | metal | scene |
|---|---|---|---|---|
YOLO-World-S | 234 | 0.70 | 0% | 100% |
YOLO-World-M | 229 | 0.77 | 0% | 100% |
OWL-v2-Base | 224 | 0.79 | 0% | 100% |
三个模型都在 230ms 上下、不到 1GB 显存。消费卡完全不是限制——真正的鸿沟在数据域。

图 2 · 金属件 vs 场景 hit rate(conf≥0.10)
这张图几乎不需要解释:绿色全满,红色全空。不是某一个模型的偶然失手,而是三类开放词汇检测器的系统性行为。
5.1 场景:模型是好的

图 3 · bike · YOLO-World-M:person / bicycle / hand 都能出框

图 4 · building · YOLO-World-M:人物、长椅等可检出(雕像被当成 person 是开放词汇的典型误检)

图 5 · fire_academy · YOLO-World-M
5.2 金属件:三个模型都是空白

图 6 · metal template · YOLO-World-M:提示 metal bar / steel bar,框数为 0

图 7 · metal 遮挡 · YOLO-World-M

图 8 · metal template · OWL-v2:同样失败(最高分约 0.01,远低于阈值)

图 9 · 检测总览
预训练域不匹配
开放词汇主粮是网络图 / COCO 语义;光秃金属件、均匀背景、工业纹理很少进语料。
提示词不等于零件本体
metal bar 在互联网里多是工地圆钢、健身杠;你的零件是带槽孔铭牌式条料,视觉原型不对齐。
不是阈值调太高
我们从 0.01 起收,金属上峰值置信度经常 <0.05;场景上 0.6–0.8 很常见。
场景类目标:可以直接用
人、车、工具、箱体、标识牌等——开放词汇已经够做第一版定位。
专用金属件:不要裸奔开放词汇
需要小样本微调、模板匹配、或几何线(你已有的 RoMa/UFM 定位)做 primaries。
更合理的产线架构
开放词汇做「粗分类/场景元素」→ 专用检测或匹配做「零件本体」→ 深度/点云做「三维量测」。
这篇测评的价值,不在于「又跑通了三个模型」,而在于用负结果钉死一件事:
开放词汇 ≠ 开箱即用的工业定位。
场景元素可以靠 YOLO-World / OWL 快速起盘;专用金属件仍要回到模板、小样本微调,或你已经掌握的几何匹配链路。
算力在 2026 年的消费卡上已经过剩;缺的是领域对齐。
INDUSTRIAL INSPECTION · OPEN VOCAB
场景能用 · 金属件不能裸奔
数据与图片均为实测