首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >当多模态Agent学会“思考”与“动手”,视觉感知将如何进化?

当多模态Agent学会“思考”与“动手”,视觉感知将如何进化?

作者头像
唐国梁Tommy
发布2026-06-25 21:15:02
发布2026-06-25 21:15:02
2190
举报

近年来,多模态大模型(如GPT-4V、Gemini等)的能力令人惊叹。它们能“看懂”图片,描述内容,甚至进行一些简单的推理。但如果你让它们处理一些真正考验“眼力”的精细活,比如精确判断物体的空间前后关系、在杂乱背景中识别并计数特定物体,它们往往会暴露出“看得见,但看不清”的窘境。

一个极具吸引力的方向是:给模型一套“专业工具”。就像人类工程师会使用卡尺、显微镜一样,如果AI能学会使用物体检测、深度估计、图像放大等视觉工具,它的感知精度和推理能力无疑将迎来质的飞跃。

然而,“给工具”容易,“教会用”却很难。当前主流的教学方法——监督微调(SFT),更像是一种死记硬背式的模仿,存在三大瓶颈:

  • 成本高昂:需要依赖更强大的模型(如GPT-4)生成海量的“教科书”数据。
  • 费时费力:生成的“教科书”质量参差不齐,需要进行繁琐的手动筛选和过滤。
  • 泛化性差:模型只是在模仿,无法真正理解何时、为何要用某个工具,遇到新问题时容易束手无策。

今天,我们要深入解读的这篇论文——《Reinforced Visual Perception with Tools》(REVPT),就为我们展示了一条截然不同的、更接近“自主学习”的道路。它抛弃了纯粹的模仿,引入强化学习(Reinforcement Learning, RL),让模型在“实践出真知”的过程中,真正学会了如何思考使用工具。这不仅仅是一次技术升级,更可能是一场关于AI视觉感知的范式革命。

从“模仿者”到“实践家”的蜕变

REVPT的核心创新,在于它提出了一套全新的训练框架,成功地将强化学习应用于多模态模型的视觉工具使用上。其本质,是从“照本宣科的模仿”转变为“从结果中学习”。

我们可以用一个“学徒学艺”的生动比喻来理解这个过程:

  • 传统SFT方法:就像让一个学徒把师傅的所有操作手册背得滚瓜烂熟。他能复现手册里的所有操作,但遇到手册上没有的新情况,就可能不知所措。他知其然,但不知其所以然。
  • REVPT框架:则更像是一套现代化的学徒培养体系。它分为两个阶段:1. “冷启动”阶段:先让学徒观摩师傅(更强大的模型)的几次标准操作,学习工具的基本用法和流程。这相当于打下一个坚实的基础。 2. “强化学习”阶段:让学徒独立上手,面对各种问题,自己尝试用工具解决。做得好,就给予“奖励”;做得不好,就给予“惩罚”。通过不断的试错和复盘,学徒最终不仅掌握了工具,更形成了自己的一套最优解题策略,甚至能解决师傅没遇到过的新问题。

通过这个框架,REVPT模型不再是一个被动的模仿者,而是一个主动的实践家。它在与工具的互动中,逐渐形成了对视觉任务的深刻理解,学会了在恰当的时机,选择最恰当的工具,来解决最棘手的问题。

REVPT 的“两步走”训练法

REVPT的精髓在于其设计的两阶段训练流程。下面,我们来详细拆解每一步的技术细节。

第一阶段:“冷启动” (Cold Start) — 打下坚实的基础

目标:凭空让一个模型开始“自由探索”(强化学习)是非常困难的。模型会有一种天然的“惰性”,倾向于用自己已有的知识去直接回答问题,而不是费力地去调用一个不熟悉的外部工具。因此,“冷启动”阶段的核心任务,就是通过高质量的示范,强制为模型注入初始的工具使用知识。

这个过程主要分为三步,我们可以参考论文中的 图 4 来理解:

1. 筛选“有价值的难题”:首先,为了让学习更高效,我们需要找到那些模型单凭自身能力难以解决,最需要工具辅助的问题。REVPT的做法是,先用基础模型(Qwen2.5-VL-7B)去解答数据集(SAT和TACO)中的问题,然后筛选出所有回答错误的样本。这些就是值得学习的“错题集”。

2. 聘请“宗师级”导师进行示范:对于这些难题,REVPT请来了一位更强大的导师——GPT-4.1,来生成完美的、带有工具使用的解题步骤。

3. 模仿学习 (SFT):模型在这些由GPT-4.1生成的“标准答案”上进行监督微调。让我们来看一个具体的示范案例,假设问题是判断图像中的桌子和电视哪个更近(参考论文 图 12):

GPT-4.1的示范轨迹会是这样

代码语言:javascript
复制
<think>
要判断远近,最可靠的方法是分析深度信息。我应该使用深度估计工具来生成一张深度图,通过颜色冷暖来判断。
</think>
<tool_call>
{"name": "depth_estimation", ...}
</tool_call>
<result>
[系统返回一张彩色的深度图]
</result>
<think>
深度图显示,桌子区域是暖色调(红色),电视区域是冷色调(蓝色)。根据规则,暖色代表近,冷色代表远。因此桌子更近。
</think>
<answer>
桌子离相机更近。
</answer>

通过学习成千上万条这样的轨迹,REVPT模型初步掌握了:遇到什么问题应该用什么工具,以及工具调用的标准格式。

第二阶段:强化学习 (RL) — 在实践中自我进化

当模型具备了基础的工具使用能力后,真正的重头戏才刚刚开始。强化学习将把它从一个“合格的学徒”锤炼成“独立的工匠”。

目标:超越模仿的局限,让模型通过自主探索和结果反馈,发现更优、更鲁棒的工具使用策略。

这个阶段的核心是 GRPO (Group Relative Policy Optimization) 算法,一种高效的强化学习策略。其运作流程可以分解为以下几个核心要素:

1️⃣ 智能体 (Agent):我们的REVPT模型。

2️⃣ 环境 (Environment):视觉问题以及可供使用的工具箱(包含物体检测、深度估计、边缘检测、图像放大四个工具)。

3️⃣ 行动 (Action):模型在每一步的输出,可能是一个直接的答案,也可能是一次工具调用。

4️⃣ 奖励 (Reward):这是整个强化学习的指挥棒。REVPT的设计极为简洁而有效:

  • 如果最终答案正确,且思考和回答的格式规范,则获得 +1 的奖励。
  • 否则,一律获得 -1 的惩罚。 这种清晰的奖惩机制,迫使模型朝着唯一的目标优化:以任何有效的方式,正确地解决问题

实验结果与分析:数据证明一切

空谈理论不如看实际效果。REVPT的表现究竟如何?论文通过详尽的实验给出了答案。

  • 实验设置
  • 基础模型:Qwen2.5-VL (3B和7B版本)。
  • 核心基准:CV-Bench, BLINK, MMVP等,这些都是专门为测试模型精细视觉感知能力而设计的“考场”。
  • 对比选手:包括基础的Qwen模型、仅使用SFT训练的模型、纯文本RL模型,甚至还有GPT-4.1Gemini-2.0-Flash这样的顶级商业模型。
  • 惊艳的性能提升
  • 从论文的表 2 我们可以看到,REVPT的表现堪称全面碾压。在核心的CV-Bench基准上,REVPT-3B和REVPT-7B的性能,相较于它们未经训练的指令微调版本,分别实现了高达9.03%和9.44%的巨幅提升!
  • 在更具挑战性的BLINK-HARD基准上,提升更为惊人。这充分说明,强化学习解锁了模型深层次的潜力,使其能够攻克传统方法难以解决的复杂感知任务。
  • 更令人振奋的是,在某些特定的感知子任务上,开源的REVPT模型甚至超越了GPT-4.1和Gemini,这无疑证明了该技术路线的巨大潜力。
  • 工具的价值:消融实验的启示 为了证明性能提升确实来源于工具,而非其他因素,研究者们进行了一项“釜底抽薪”式的实验——消融研究(Ablation Study)。他们尝试在训练和测试中拿掉某个关键工具,看会发生什么。
  • 结果(见表 4):当移除物体检测工具后,模型在多个基准上的性能应声下跌,例如,在MMVP上的得分暴跌了超过12个百分点。
  • 这无可辩驳地证明了:是工具以及模型学会使用工具的能力,构成了REVPT成功的基石
  • 一个有趣的发现:从“多用”到“善用” 论文中的 图 5 和图 6 揭示了一个非常深刻的现象:经过强化学习后,模型使用工具的总频率在某些任务上反而下降了。然而,其解题的正确率却显著上升

这说明了什么?RL并没有把模型变成一个“工具滥用者”,而是教会了它策略性的审慎。模型学会了判断何时需要工具,何时不需要,实现了从“盲目多用”到“精准善用”的智慧进化。

总结:通往更强视觉智能的未来之路

REVPT的研究为我们描绘了一幅激动人心的蓝图,也指明了未来的探索方向:

  • 更丰富的工具生态:目前的工具箱还很有限。未来,我们可以为模型集成更多、更强大的视觉工具,甚至允许模型动态调用API或生成代码来创建临时工具。
  • 克服工具的局限性:工具本身并非完美,也可能出错。未来的研究可以探索如何让模型学会“批判性地”使用工具,例如,当工具输出与自身判断矛盾时,能够进行交叉验证或选择不信任。
  • 摆脱“导师依赖”:尽管REVPT已经大大减少了对SFT的依赖,但冷启动阶段仍需要一个强大的“导师”。探索完全无需导师的、从零开始的强化学习方法,将是通往更通用人工智能的关键一步。

总而言之,REVPT不仅仅是一个模型或一个算法,它代表了一种思想的转变——即AI的强大,不仅在于其自身的庞大知识,更在于它与外部世界和工具进行交互、并从中学习的能力

代码语言:javascript
复制
论文名称:Reinforced Visual Perception with Tools
第一作者:华中科技大学
论文链接:https://arxiv.org/pdf/2509.01656
最新日期:2025年9月1日
github:https://github.com/ls-kelvin/REVPT.git

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-09-11,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 从“模仿者”到“实践家”的蜕变
  • REVPT 的“两步走”训练法
    • 第一阶段:“冷启动” (Cold Start) — 打下坚实的基础
    • 第二阶段:强化学习 (RL) — 在实践中自我进化
  • 实验结果与分析:数据证明一切
  • 总结:通往更强视觉智能的未来之路
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档