研究员 白岩

过去几年,视觉大模型经历了一轮洗牌。小模型时代靠定制化项目堆人头的模式越来越难,行业一度陷入“增收不增利”的商业模式焦虑。但在格灵深瞳近日的一场合作伙伴活动上,看到了不同景象:视觉大模型在公安、银行、交通甚至加油站等业务场景里,正在从“能用”走向“好用”。

格灵深瞳CEO吴一洲表示,公司正在从单点算法提供商,走向大模型原生的AI全栈产品与服务商。这个定位转变背后,是一个更具体的问题:当大模型的能力已经足够强,AI到底应该如何在真实业务场景中落地?

从“定制开发”到“搭乐高”:算法生产的逻辑变了

格灵深瞳AI Infra负责人闫梓祯在分享中把自身视觉模型分成了三层:L1是传统的CNN小模型,解决检测、跟踪等基础任务;L2是视觉基座模型,也就是他们自研的Glint-MVT,解决快速迁移和泛化;L3是多模态大模型,泛化能力更强,但对算力需求也更大。

而这样分层的意义在于,它对应了不同业务场景的性价比选择。L1模型成熟稳定但泛化差,L3效果好但太贵,真正难的是怎么把三者串联起来。

他们的解法是“视觉智能工坊”这套工具链。格灵深瞳政企事业部负责人陈平安在现场也提到,视觉智能工坊的核心,是把算法生产、运营和迭代连起来。如果做个形象比喻,它更像乐高:底层算子标准化后,懂业务的人自己拖拽就能拼出流程。以前的AI项目更像定制家具,每个客户都要重新量尺寸、重新打;现在是把模块化的能力摆在那里,需要什么都可以自己拼。

具体来说,用户可以把视频接进来,使用零样本启动——用一句话描述需求,比如以“拉车门盗窃事件识别”为例,系统会自动分析。初期准确率不够没关系,先标几百张图训练出一个小模型,一键发布到推理平台。推理过程中产生的误报继续标注,模型就会越用越准。整个过程不需要写代码,也不需要算法工程师介入。

这实际上是把AI项目的交付逻辑从“项目制”变成了“产品制”。过去一个定制化需求可能要两周开发,现在复杂的跨时空规则编排也能在半小时内上线。

银行、加油站、交通:AI落地要先算清一笔账

技术能力是一回事,但能不能在行业里跑通是另一回事。闫梓祯告诉第四波表示,AI拉平了大家之间的软件研发能力,真正的差异反而在行业know-how和软硬一体的成本控制上。

这一点在银行场景里体现得比较明显。银行运营场景的算法碎片化严重——现金交接、款箱管理、授权操作、客户身份证核验,每个环节的规则都不一样,而且不同银行对同一套监管政策的理解还有差异。过去用传统小模型做,长尾场景太多,训练成本根本覆盖不过来。现在用视觉基座模型加多模态大模型,少量数据就能快速适配一个新场景。

更关键的是误报率。传统安防厂商卖的是标准品,摄像头加算法盒子交付完就结束了,银行监控中心每天可能会收到上千条告警,根本处理不过来,系统很难用起来。格灵深瞳在某省分行做到的有效告警是每天26条,这样监控人员与AI就能真正协同起来,而不是被AI制造的工作量淹没。

加油站场景则展示了另一条思路。今年税务总局要求全国加油站实现交易与开票联动,格灵深瞳用视觉智能工坊做了一套方案:端侧识别加油动作,把视频变成结构化的“加油事件”,再和业务系统的流水、开票数据比对,发现异常就告警。整个方案从识别到核验再到迭代,全部在工坊里完成。

这些案例的共同点:是用大模型来解决传统方案解决不了或者解决起来太贵的问题。格灵深瞳灵感实验室负责人冯子勇在分享中也提到,银行场景里有些识别任务,过去小模型只能做到70%,通过大模型能力可以提升到95%。打斗场景也一样,先用小模型初筛,再用大模型复核,报警准确率能做到90%以上。

算力适配:藏在模型背后的工程硬仗

活动现场格灵深瞳展示了19款硬件形态和上百个SKU,覆盖从0.5T到300T的算力区间,适配了13家芯片厂商,其中12家是国产芯片。

这回应了AI落地的一个现实问题:客户预算在收紧,单纯软件很难有溢价,软硬一体又得把性价比做出来。异构协同就是降本的方案之一,比如在一体机中使用大小卡混合部署,推理集群使用不同国产卡做EPD分离,都能大幅降低算力成本。

闫梓祯提到,他们在千元级端侧芯片上做到30fps的全帧率实时视频理解,在同等算力和模型参数规模条件下,Qwen VL只能做到5fps左右,核心突破在于参考H.264/H.265的编码思路,用运动残差做token压缩,最大能做到八倍的token压缩。

这种工程优化听起来或许无感,但恰恰是AI从demo走向规模部署的关键。毕竟当前客户很难为“技术先进”买单,更愿意为“能解决问题且价格合理”付费。

视觉大模型到底该怎么落地?格灵深瞳给出的答案是把模型能力工具化、把交付流程产品化、把算力适配精细化。这条路能不能走通还需要时间验证,但方向是清晰的:AI的价值不在于模型有多大,而在于业务人员能不能自己用起来。

编辑 王晓