始智AI wisemodel.cn社区是源自中国的中立开放的AI开源社区。正在,欢迎加入共同成长。wisemodel推出邀请注册奖励活动,最高可得算力券+token包380元奖励,欢迎参与和支持!

视觉语言模型(VLM)的性能会随视觉令牌数量增加而显著提升,但多数实际场景无需这么多视觉令牌。研究发现,通用视觉问答任务中,即便图像分辨率降至原有的四分之一,模型性能也仅出现轻微下滑;而在涉及细粒度文字识别的任务中,性能下降则十分明显。

针对这一问题,CUHK、HKU和HKUST等机构提出一种全新视觉令牌压缩范式 VisionThink。该范式先对低分辨率图像进行处理,再智能判断这类图像是否足以完成当前任务。若判断结果为不足,模型则会输出特殊的令牌,以此请求高分辨率图像。

相较于传统固定压缩比例的方法,VisionThink 能依据样本内容动态决定是否压缩令牌,既在文字识别任务中维持了出色性能,又在简单任务中大幅降低了计算量。采用强化学习方法,设计 “大型语言模型作为评判者” 的策略,有效优化了模型在通用视觉问答任务中的表现。同时,借助精心构建的奖励函数与惩罚机制,VisionThink 成功实现了稳定且合理的图像调整大小调用比例,广泛的实验表明了本方法的优越性、效率和有效性。模型已更新上线始智AI-wisemodel开源社区,欢迎大家前去体验。

模型地址

https://wisemodel.cn/models/Senqiao/VisionThink-General

01.

瓶颈分析

强化学习是提升大型语言模型推理能力的有效方法,本研究采用组相对策略优化(GRPO)方法,通过组评分估计基线降低计算成本并提高训练稳定性,训练中模型将依据问题构建一组输出,在以 KL 散度约束避免偏离参考模型的同时优化策略以最大化奖励。

而视觉语言模型的计算复杂度主要来自自注意力机制和前馈神经网络,总计算量与 Transformer 层数、序列长度、隐藏层维度及前馈网络中间层大小相关,序列长度由系统提示、图像令牌和问题令牌组成且图像令牌占比最大,因此控制图像令牌数量是提升模型效率的关键,两者形成 “痛点定位 - 技术落地” 的呼应,共同服务于提升视觉语言模型性能与效率的目标。

02.

核心技术框架

VisionThink 旨在开发一种智能高效的视觉语言模型,能够自主判断低分辨率图像是否足以回答问题,其流程为首先处理低分辨率图像,若信息不足则输出特殊令牌请求高分辨率图像,进而降低计算成本并保持性能。

而实现这一目标需解决两个挑战,一是将强化学习有效应用于通用视觉问答,二是让模型准确判断何时需要高分辨率图像;通用视觉问答任务的多样性和复杂性使得传统基于规则的强化学习难以适用,为此提出“大型语言模型作为评判者” 策略,利用大型语言模型的语义理解能力评估模型输出的正确性,评估仅基于文本比较预测答案与真实答案以避免视觉内容干扰,并采用离散评分(0 或 1)减少误判,实验表明该策略显著提升了模型在通用视觉问答任务中的表现,且无需预训练阶段即可直接使用 130,000 个样本进行训练。

VisionThink 通过多轮交互实现动态分辨率处理,首先输入低分辨率图像和问题,若信息不足则模型输出特殊令牌请求高分辨率图像并生成新答案,扩展了 GRPO 算法以支持多轮交互,优化仅基于模型生成的输出令牌,同时采用 Qwen2.5-VL 推荐的代理提示,实验证明其在零样本场景下表现最佳,避免了训练初期因梯度缺失导致的优化失败。

奖励函数包括准确性奖励、格式奖励和惩罚机制,准确性奖励由 “大型语言模型作为评判者” 提供,正确答案得 1 分、错误得 0 分,格式奖励要求模型输出包含推理过程(标签)、最终答案(标签)及正确格式的工具调用(JSON 格式),满分 0.5 分,惩罚机制则防止模型总是请求高分辨率图像或总是直接回答,若低分辨率图像正确回答的概率低则对直接回答施加 0.1 分惩罚,若概率高则对高分辨率请求施加 0.1 分惩罚。

实验表明适当的惩罚阈值(如 0.2)能有效平衡两种行为;为训练模型判断何时需要高分辨率图像,我们收集了 20,000 个样本,包括 10,000 个需要高分辨率图像的样本和 10,000 个可用低分辨率图像回答的样本,使用基线模型 Qwen2.5VL-Instruct 进行多次推理,基于正确率分类样本,确保训练数据覆盖两种场景。

03.

实验结果

我们基于 Qwen2.5-VL-7B-Instruct 模型进行实验,采用 veRL 框架训练,设置批次大小为 512、学习率为 1e-6、生成 16 个候选响应,推理阶段使用 vLLM 框架且温度设为 0,评估覆盖 ChartQA、OCRBench、DocVQA、MME、MMVet、RealWorldQA、POPE、MMMU 和 MathVista 等多个通用视觉问答基准,其中 ChartQA 和 OCRBench 等涉及细粒度文字识别。

VisionThink 在这些基准上表现优异,与基线模型 Qwen2.5-VL-7B-Instruct 相比,其在 MathVerse 和 MMVet 上的得分分别提升 3.7% 和 8.9%,达到 48.0 和 67.1,在 MME 上得分 2400、超越所有闭源模型,在 MathVista 上得分 71.2、优于所有开源模型和部分闭源模型,而使用 130,000 个样本的 “大型语言模型作为评判者” 策略进一步验证了其在通用视觉问答任务中的有效性。

在效率方面,与使用全分辨率图像的 QwenRL 和四分之一分辨率的 QwenRL 1/4 相比,VisionThink 的推理时间接近 QwenRL 1/4、显著优于 QwenRL,在 DocVQA 上其推理速度是 QwenRL 的两倍以上,在 MME 和 POPE 上推理时间减少约三分之一,仅在需要文字识别的 ChartQA 上因请求高分辨率图像而耗时略多,但此类任务占比较少,整体效率仍保持较高水平。

与 FastV、SparseVLM 和 VisionZip 等传统高效视觉语言模型相比,VisionThink 的平均性能更优,尤其在 ChartQA 和 OCRBench 上分别提升 9.0% 和 8.3%,这得益于传统方法依赖固定压缩比例,而 VisionThink 能根据样本内容动态调整分辨率;同时,VisionThink 具备智能决策能力,可自主判断是否需要高分辨率图像,在 ChartQA 和 OCRBench 等需细粒度视觉理解的任务中,高分辨率图像请求比例分别达 79.1% 和 62.3%,而在 MME 和 DocVQA 等任务中,70% 以上样本可直接使用低分辨率图像回答,这种自适应策略符合直觉,日常问题通常无需高分辨率图像,而文字识别任务则依赖细节支撑。

04.

结论

本文介绍了VisionThink,一种用于通用视觉问答(General VQA)的新型范式,旨在提升效率和性能。通过首先处理下采样图像,并在需要时使用强化学习选择性地将其上采样到更高分辨率,VisionThink优化了计算资源,同时保持了准确性。

借助“将大语言模型作为裁判”的策略和定制的 Reward 函数,VisionThink在多种视觉问答基准测试中超越了现有的最先进模型,特别是在需要细粒度细节的任务(如OCR)中表现尤为突出。作者相信VisionThink展示了强化学习在视觉语言模型中的潜力,并鼓励开发更有效率和更高效的AI系统。

在本工作中,作者专注于2倍分辨率提升和最多两次对话的设置,并取得了令人满意的结果。然而,这一方法尚未扩展到灵活分辨率提升的设置。此外,结合更多视觉工具(如裁剪)将进一步提升效率和性能。再者,多轮(例如,超过5轮)图像工具调用在解决复杂视觉问题方面将获得更多收益。

----- END -----

wisemodel相关:

系列模型:

关于wisemodel更多

1

欢迎持续关注和支持

开源社区建设需要长期坚持和投入,更需要广大用户的积极参与、贡献和维护,欢迎大家加入wisemodel开源社区的志愿者计划和开源共创计划。期待更多开发者将开源成果,包括模型、数据集和代码等发布到 wisemodel.cn 社区,共建中立、开放的AI开源社区生态。欢迎扫码添加wisemodel微信,申请加入wisemodel社群,持续关注wisemodel.cn开源社区动态。

2

欢迎加盟wisemodel开源社区

始智AI wisemodel社区自2023年9月上线以来,逐渐成为影响力日益扩大的中立开放的AI开源社区,为了加快公司发展,我们长期需要技术、运营等人才加盟,技术侧重在AI infra、后端开发,熟悉K8S、模型训练和推理等技术, 以及熟悉开发者生态运营的成员,欢迎感兴趣的朋友加盟,可以通过添加wisemodel微信,或者将简历投递到邮箱:liudaoquan@wisemodel.cn

3

欢迎投稿优质内容

欢迎投稿分享人工智能领域相关的优秀研究成果,鼓励高校实验室、大企业研究团队、个人等,在wisemodel平台上分享各类优质内容,可以是AI领域最新论文解读、最新开源成果介绍,也可以是关于AI技术实践、应用和总结等。投稿可以发邮件到liudaoquan@wisemodel.cn,也可以扫码添加wisemodel微信。

4

关于wisemodel开源社区

始智AI wisemodel.cn开源社区由清华校友总会AI大数据专委会副秘书长刘道全创立,旨在打造和建设中立开放的AI开源创新社区,将打造成“HuggingFace”之外最活跃的AI开源社区,汇聚主要AI开源模型、数据集和代码等,欢迎高校科研院所、大型互联网公司、创新创业企业、广大个人开发者,以及政府部门、学会协会、联盟、基金会等,还有投资机构、科技媒体等,共同参与建设AI开源创新生态。

向上滑动查看