SAM 3 (Segment Anything Model 3)
SAM 3:用概念分割一切
https://arxiv.org/pdf/2511.16719
《SAM 3: Segment Anything with Concepts》主要解决的是现有分割模型缺乏对“概念”的泛化理解和跟踪能力的问题。
具体来说,它针对以下几个核心痛点:
现有模型的局限性:
之前的SAM系列(SAM 1和SAM 2)虽然支持“可提示分割”,但主要依赖点、框或掩码作为提示,每次只能分割单个物体。
它们无法处理更通用的任务:根据一个抽象的概念(如“黄色校车”或“条纹猫”),一次性找出并分割出图像或视频中所有匹配的实例,并在视频中持续跟踪它们。
引入新任务与新能力:
论文正式定义了可提示概念分割(PCS,Promptable Concept Segmentation)任务。即模型需要理解简短的名词短语或图像示例,并返回所有匹配对象的掩码和唯一身份标识。
数据与性能的瓶颈:
要实现上述能力,需要大规模、高质量且概念多样化的训练数据。现有的数据集在概念数量和标注质量上存在不足。
为了解决这个问题,论文构建了一个高效的人机协同数据引擎,生成了包含400万独特概念标签的高质量数据集,从而推动模型性能的跃升。
总结:该论文试图填补从“分割任意物体”到“分割任意概念”之间的空白,让模型不仅能“看到”形状,还能“理解”语义,并根据语义概念在图像和视频中全面、准确地定位、分割和跟踪目标。
我们提出了Segment Anything Model(SAM)3,这是一个统一的模型,能够基于概念提示(我们定义为简短名词短语,如"黄色校车"、图像示例或两者的组合)来检测、分割和跟踪图像与视频中的物体。可提示概念分割(PCS)接受此类提示,并为所有匹配的物体实例返回分割掩码和唯一标识。为推进PCS研究,我们构建了一个可扩展的数据引擎,生成了一个包含图像和视频中400万个独特概念标签(包括难负例)的高质量数据集。我们的模型由共享同一骨干网络的图像级检测器与基于记忆的视频跟踪器组成。通过引入解耦识别与定位的存在性检测头,显著提升了检测精度。SAM 3在图像和视频PCS任务上的准确率均达到现有系统的两倍,同时改进了先前SAM在视觉分割任务上的性能。我们开源了SAM 3以及为可提示概念分割新建立的"基于概念的通用分割基准"(SA-Co)。
引言
在视觉场景中定位并分割任意目标的能力是多模态AI的基础,支撑着机器人技术、内容创作、增强现实、数据标注及更广泛科学领域的应用。SAM系列(Kirillov等人,2023;Ravi等人,2024)提出了面向图像与视频的可提示分割任务,聚焦于通过点、框或掩码作为提示,针对每个提示分割单个目标的提示性视觉分割。尽管这些方法取得了突破性进展,但未能解决更为通用的任务:定位并分割输入中任意位置出现的某一概念的所有实例(例如视频中所有的"猫")。
为填补这一空白,我们提出了SAM 3,该模型在图像与视频的可提示分割领域实现了阶跃式进步,既提升了相较于SAM 2的提示性视觉分割性能,又为可提示概念分割(PCS)树立了新标准。我们将PCS任务(§2)形式化为:以文本和/或图像示例为输入,为每个匹配该概念的物体预测实例掩码与语义掩码,同时保持视频帧间的物体身份一致性(见图1)。为聚焦于原子视觉概念的识别,我们将文本约束为简单名词短语,如"红苹果"或"条纹猫"。尽管SAM 3并非为长指代表达或需推理的查询设计,但我们证明其可与多模态大语言模型直接结合,以处理更复杂的语言提示。与先前SAM版本一致,SAM 3具备完全交互性,允许用户通过添加细化提示来解决歧义,引导模型输出预期结果。
我们的模型(§3)由共享视觉编码器(Bolya等人,2025)的检测器与跟踪器构成。检测器是基于DETR(Carion等人,2020)的架构,以文本、几何信息及图像示例为条件输入。为应对开放词汇概念检测的挑战,我们引入独立的"存在性检测头"来解耦识别与定位,这在包含挑战性负例短语的训练中尤为有效。跟踪器继承了SAM 2的Transformer编码器-解码器架构,支持视频分割与交互式细化。这种检测与跟踪解耦的设计避免了任务冲突——检测器需保持身份无关性,而跟踪器的核心目标则是区分视频中的不同身份。
为实现性能突破,我们构建了人与模型协同的数据引擎(§4),用于标注大规模多样化训练数据集。我们在三个方面对先前数据引擎进行了创新:(i) 媒体筛选:相较于依赖同质化网络来源的传统方法,我们筛选了更多样化的媒体领域;(ii) 标签筛选:通过利用本体论和多模态大语言模型作为"AI标注器"生成名词短语与难负例,显著提升标签多样性与难度;(iii) 标签验证:通过微调多模态大语言模型成为接近人类准确率的"AI验证器",使标注效率翻倍。从含噪的媒体-短语-掩码伪标签出发,我们的数据引擎通过人类与AI验证器双重校验掩码质量与完整性,过滤出正确标注样本并识别困难错误案例。人类标注员随后专注于修正这些错误,手动校正掩码。这使我们能够标注包含400万独特短语与5200万掩码的高质量训练数据,以及含3800万短语与14亿掩码的合成数据集。我们还为PCS创建了"基于概念的通用分割基准"(SA-Co)(§5),包含12万图像与1700视频中20.7万独特概念的详尽掩码,概念数量超现有基准50倍以上。
实验(§6)表明,SAM 3在可提示分割领域树立了新标杆:在LVIS上零样本掩码AP达48.8(当前最佳为38.5),在SA-Co基准上以至少2倍优势超越基线(见图2示例),并在视觉提示任务上优于SAM 2。消融实验(§A)验证了骨干网络选择、新型存在性检测头及引入难负例的有效性,同时建立了PCS任务在高质量与合成数据集上的扩展律。我们开源了SA-Co基准,并发布SAM 3模型检查点与推理代码。在H200 GPU上,SAM 3对单张含百个检测物体的图像处理仅需30毫秒。视频推理延迟随物体数量线性增长,在约5个并发物体时可维持近实时性能。第§7节回顾相关研究;接下来,我们将深入探讨任务定义。
2 可提示概念分割(PCS)
我们将可提示概念分割任务定义如下:给定一张图像或一段短视频(≤30秒),检测、分割并跟踪由简短文本短语、图像示例或两者组合指定的视觉概念的所有实例。我们将概念限定为由名词及可选修饰词构成的简单名词短语所定义的内容。名词短语提示(若提供)对图像/视频的所有帧全局有效,而图像示例可在单帧上以正例或负例边界框的形式提供,以迭代优化目标掩码(见图3)。
所有提示的类别定义必须保持一致,否则模型行为将不可预测;例如,"鱼"的提示不能后续用仅包含鱼尾的示例提示进行细化,而应更新文本提示。当模型初始遗漏某些实例或概念较为罕见时,图像示例提示尤为有用。
我们的词汇表涵盖任何可在视觉场景中定位的简单名词短语,这使得任务具有内在歧义性。短语可能因多义词("鼠标"指设备还是动物)、主观描述词("舒适的"、"巨大的")、模糊或依赖上下文的短语(可能根本无法定位,如"品牌形象")、边界模糊性("镜子"是否包含镜框)以及遮挡、模糊等掩盖物体范围的成像因素而产生多重解释。虽然类似问题也出现在大型封闭词汇语料库(如LVIS(Gupta等人,2019))中,但通过精心筛选词汇表并为所有目标类别设定明确定义可缓解这些问题。我们通过以下方式解决歧义问题:由三位专家收集测试标注,调整评估协议以允许多种有效解释(§E.3),设计数据流程与标注指南以最小化标注歧义,并在模型中引入歧义处理模块(§C.2)。
3 模型
SAM 3是SAM 2的泛化版本,既支持新的PCS任务(§2),也支持PVS任务。它通过概念提示(简单名词短语、图像示例)或视觉提示(点、框、掩码)来定义需在时空维度上(单独)分割的物体。图像示例和视觉提示可在单帧上迭代添加以优化目标掩码——误报和漏报物体可分别通过图像示例移除或添加,单个掩码则可通过SAM 2风格的PVS进行细化。
我们的架构广泛基于SAM与(M)DETR(Carion等人,2020;Kamath等人,2021)系列。图4展示了SAM 3架构,其核心是一个双编码器-解码器Transformer——即用于图像级能力的检测器——并与跟踪器及记忆模块结合以处理视频。检测器和跟踪器从对齐的感知编码器(PE)骨干网络(Bolya等人,2025)中接收视觉-语言输入。下文为概述,详见§C。
检测器架构。检测器架构遵循通用DETR范式。图像和文本提示首先由PE编码,图像示例(若存在)则由示例编码器编码。我们将图像示例令牌与文本令牌统称为"提示令牌"。融合编码器接收来自图像编码器的无条件嵌入,并通过交叉注意力机制以提示令牌为条件进行调制。融合模块后接类DETR解码器,其中可学习物体查询与来自融合编码器的条件化图像嵌入进行交叉注意力计算。
每个解码器层会为每个物体查询预测一个分类logit(此处为二值标签,指示物体是否匹配提示),并根据前一层预测的边界框预测偏移量(遵循Zhu等人,2020)。我们采用边界框区域位置偏置(Lin等人,2023)来帮助聚焦每个物体的注意力,但与近期DETR模型不同,我们坚持使用标准注意力机制。训练期间,我们采用DAC-DETR(Hu等人,2023)的双重监督和Align损失(Cai等人,2024)。掩码头改编自MaskFormer(Cheng等人,2021)。此外,我们还设有一个语义分割头,为图像中的每个像素预测二值标签,指示其是否对应于提示。详见§C。
存在性令牌。让每个候选查询同时完成图像/帧中物体的识别(是什么)与定位(在哪里)可能较为困难。就识别组件而言,整个图像的上下文线索至关重要。然而,强制候选查询理解全局上下文可能适得其反,因为这与定位目标固有的局部特性相冲突。我们通过引入一个可学习的全局存在性令牌来解耦识别与定位步骤。该令牌唯一负责预测目标概念(以名词短语形式)是否存在于图像/帧中,即p(NP存在于输入中)。每个候选查询qi仅需解决条件定位问题p(qi是匹配项 | NP存在于输入中)。最终每个候选查询的得分为其自身得分与存在性得分的乘积。
图像示例与交互性。SAM 3支持图像示例,以边界框及其关联二值标签(正例或负例)的配对形式提供,可单独使用或补充文本提示。模型随后检测所有匹配提示的实例。例如,给定一个包含狗的正例边界框,模型将检测图像中所有的狗。这与SAM 1和SAM 2中的PVS任务不同——后者中一个视觉提示仅产生单个物体实例。每个图像示例由示例编码器单独编码,使用位置嵌入、标签嵌入以及基于ROI池化的视觉特征,经拼接后由一个小型Transformer处理。生成的提示与文本提示拼接,构成完整的提示令牌。图像示例可根据当前检测结果中的错误以交互方式提供,从而优化输出。
基于SAM 2风格传播的目标跟踪。每个在第一帧检测到的物体都会初始化一个掩码片段。随后,在每一后续帧中,跟踪器模块根据这些已跟踪物体在先前时刻的位置 M t − 1
,通过与SAM 2中视频目标分割任务类似的单帧传播步骤,预测其在当前帧的新掩码位置 。跟踪器与检测器共享相同的图像/帧编码器(PE骨干网络)。检测器训练完成后,我们冻结PE,并按照SAM 2的方式训练跟踪器,其组件包括:提示编码器、掩码解码器、记忆编码器以及一个记忆库——该记忆库利用过去帧和条件帧(即物体首次被检测到或被用户提示的帧)的特征来编码物体的外观信息。记忆编码器是一个Transformer,它在当前帧的视觉特征上进行自注意力计算,并从视觉特征对记忆库中的空间记忆特征进行交叉注意力计算。我们在§C.3中详细描述了视频处理方法的细节。
在推理阶段,我们仅保留物体在记忆库中被高置信度确认的帧。掩码解码器是一个在编码器隐藏状态与输出令牌之间进行双向交互的Transformer。为处理歧义性,我们在每一帧为每个被跟踪物体预测三个输出掩码及其置信度,并选择置信度最高的输出作为当前帧的预测掩码。
基于视觉提示的实例细化。在获得初始掩码(或掩码片段)后,SAM 3允许使用正负点击点对单个掩码(片段)进行细化。具体而言,给定用户点击点,我们应用提示编码器对其进行编码,并将编码后的提示输入掩码解码器以预测调整后的掩码。在视频中,该掩码随后会被传播至整个视频,从而获得细化的掩码片段。
训练阶段。我们分四个阶段训练SAM 3,逐步增加数据和能力:1)感知编码器(PE)预训练,2)检测器预训练,3)检测器微调,4)冻结骨干网络进行跟踪器训练。详见§C.4.1。
4 数据引擎
要在PCS任务上通过SAM 3实现阶跃式进步,需要在超越现有数据集的大规模、多样化概念与视觉领域上进行训练(见图12)。我们构建了一个高效的数据引擎,通过SAM 3、人类标注员与AI标注员之间的反馈循环迭代生成标注数据,主动挖掘当前版本SAM 3无法生成高质量训练数据的媒体-短语对,从而进一步改进模型。通过将特定任务委托给AI标注员——即达到或超越人类准确率的模型——我们相较于纯人工标注流程将效率提升了一倍以上。我们分四个阶段开发数据引擎,每个阶段都增加AI模型的使用,将人力引导至最具挑战性的错误案例,同时扩展视觉领域覆盖范围。阶段1-3聚焦于图像,阶段4扩展至视频。此处概述关键步骤;详细内容与指标见§D。
数据引擎组件(图5)。媒体输入(图像或视频)借助精心整理的本体论从大型数据池中挖掘。AI模型首先提出描述视觉概念的名词短语,随后由另一个模型(如SAM 3)为每个提出的名词短语生成候选实例掩码。提出的掩码通过两步流程验证:首先,在掩码验证(MV)环节,标注员基于掩码质量及其与名词短语的相关性进行接受或拒绝;其次,在穷尽性验证(EV)环节,标注员检查输入中该名词短语的所有实例是否均已被掩码覆盖。任何未通过穷尽性检查的媒体-名词短语对将被送至人工修正阶段,由人工添加、移除或编辑掩码(使用基于浏览器的工具中的SAM 1),或对细小难分物体采用"组"掩码。标注员可拒绝无法定位或存在歧义的短语。
阶段1:人工验证。我们首先使用简单描述生成器和解析器随机采样图像与名词短语提案。初始掩码提案模型采用SAM 2,并以现成开放词汇检测器的输出作为提示;初始验证员为人工。本阶段共收集430万图像-名词短语对,形成初始的SA-Co/HQ数据集。我们在此数据上训练SAM 3,并将其作为下一阶段的掩码提案模型。
阶段2:人工+AI验证。在此阶段,我们利用阶段1收集的人工MV与EV任务接受/拒绝标签微调Llama 3.2(Dubey等人,2024),创建自动执行MV与EV任务的AI验证器。这些模型接收图像-短语-掩码三元组,输出掩码质量或穷尽性的多项评分。这一新型自动验证流程使人力可集中于最具挑战性的案例。我们持续在新收集数据上重新训练SAM 3,并迭代更新6次。随着SAM 3与AI验证器的改进,自动生成的标签比例逐步提高,进一步加速数据采集。MV与EV环节引入AI验证器使数据引擎吞吐量相较于纯人工标注提升约一倍。关于AI验证器如何提升数据引擎吞吐量的详细分析见§A.4。我们还将名词短语提案步骤升级为基于Llama的流水线,该流水线能提出针对SAM 3的对抗性难负例名词短语。阶段2为SA-Co/HQ新增1.22亿图像-名词短语对。
阶段3:规模化与领域扩展。在第三阶段,我们利用AI模型挖掘日益具有挑战性的案例,并将SA-Co/HQ的领域覆盖范围扩展至15个数据集(图15)。领域指文本与视觉数据的独特分布。在新领域中,MV AI验证器在零样本下表现良好,但EV AI验证器需通过少量特定领域的人工监督进行改进。我们还通过从图像替代文本中提取名词短语,以及从基于维基数据的SA-Co本体论(§D.2,含17个顶级类别、72个子类别)中挖掘概念,扩展概念覆盖范围至长尾、细粒度概念。我们迭代训练SAM 3共7次、AI验证器共3次,为SA-Co/HQ新增1950万图像-名词短语对。
阶段4:视频标注。本阶段将数据引擎扩展至视频领域。我们利用成熟的图像SAM 3来收集针对性的高质量标注,以应对视频特有的挑战。数据挖掘流程应用了场景/运动过滤、内容均衡、排序及定向搜索等步骤。视频帧通过采样(随机或按物体密度)后送入图像标注流程(源自阶段3)。掩码片段(时空掩码)由(现已扩展至视频的)SAM 3生成,并通过去重及移除琐碎掩码进行后处理。鉴于视频标注难度更高,我们将人力集中于可能失败的高风险案例,优先处理包含大量拥挤物体及存在跟踪失败的视频片段。收集的视频数据SA-Co/VIDEO包含5.25万个视频片段及46.7万个掩码片段。详见§D.6。
5 基于概念的通用分割(SA-Co)数据集
训练数据。我们为PCS任务收集了三个图像数据集:(i) SA-Co/HQ,即通过数据引擎阶段1-4收集的高质量图像数据;(ii) SA-Co/SYN,由成熟数据引擎(阶段3)在无人工参与条件下标注的合成图像数据集;(iii) SA-Co/EXT,包含15个外部数据集,这些数据集具有实例掩码标注,并通过我们的本体论流程添加难负例进行增强。值得注意的是,SA-Co/HQ数据集标注了520万张图像和400万个独特名词短语,使其成为规模最大的高质量开放词汇分割数据集。我们还标注了一个视频数据集SA-Co/VIDEO,包含5.25万个视频片段和2.48万个独特名词短语,形成13.4万个视频-名词短语对。视频平均时长为84.1帧,帧率为6fps。详细统计信息、与现有数据集的对比及概念分布见§E.1。
SA-Co基准。SA-Co评估基准包含20.7万个独特短语、12.1万个图像与视频,以及超过300万个带有难负例标签的媒体-短语对,用于测试开放词汇识别能力。基准分为4个子集:SA-Co/Gold涵盖七个领域,每个图像-名词短语对由三名不同标注员标注(用于衡量人类表现);SA-Co/Silver涵盖十个领域,每个图像-名词短语对仅由一名标注员标注;SA-Co/Bronze与SA-Co/Bio包含九个现有数据集,这些数据集要么已有掩码标注,要么使用边界框作为SAM 2提示生成掩码。SA-Co/VEval基准涵盖三个领域,每个视频-名词短语对由一名标注员标注。数据集统计见表28,标注示例见图6。
评估指标。我们旨在衡量模型在下游应用中的实用性。平均精度(AP)等检测指标未考虑校准问题,这可能导致模型在实际应用中难以使用。为解决此问题,我们仅评估置信度高于0.5的预测,通过引入模拟下游用法的阈值来强制实现良好校准。PCS任务可自然分解为两个子任务:定位与分类。我们使用正例微观F1值(pmF₁)评估定位任务,该指标基于至少包含一个真实掩码的正例媒体-短语对计算。分类任务通过图像级马修斯相关系数(IL_MCC)衡量,其取值范围为[-1, 1],在图像级别评估二值预测("物体是否存在?"),而不考虑掩码质量。我们的主要指标分类门控F1值(cgF₁)结合了上述两者,计算方式如下:
处理歧义性。我们在SA-Co/Gold上为每个名词短语收集了三个标注。通过将每个预测与所有真实掩码进行比较并选择最佳得分,来衡量理想准确率。详见§E.3。
6 实验
我们在图像与视频分割、检测与计数基准的少样本适应,以及结合多模态大语言模型的复杂语言查询分割等多个维度评估SAM 3。本节展示部分消融实验结果,更多内容见§A。参考文献、详细结果与实验设置见§F。
基于文本的图像PCS任务。我们在外部基准与自建基准上评估实例分割、边界框检测及语义分割性能。SAM 3每次以单个名词短语为提示,预测实例掩码、边界框或语义掩码。作为基线,我们对比了OWLv2、GroundingDino(gDino)和LLMDet在边界框检测任务上的表现,并利用其检测框提示SAM 1进行分割评估。此外,我们还与APE、DINO-X及通用大语言模型Gemini 2.5 Flash进行对比。表1显示,在零样本设置下,SAM 3在封闭词汇数据集COCO、COCO-O以及LVIS边界框检测任务上均刷新了当前最优水平,并在LVIS掩码任务上显著超越现有方法。在开放词汇的SA-Co/Gold基准上,SAM 3的cgF1得分达到最强基线OWLv2⋆的两倍以上,并达到预估人类表现的74%。在其他SA-Co子集上的提升更为显著。在ADE-847、PascalConcept-59和Cityscapes上的开放词汇语义分割结果表明,SAM 3超越了强专项基线模型APE。详见§F.1。
少样本适应。我们在ODinW13和RF100-VL基准上评估SAM 3的零样本与少样本迁移能力,使用其原始标签作为提示。我们不进行任何提示调优。我们对SAM 3进行微调(不包含掩码损失),并在表2中报告平均边界框mAP。SAM 3在10-shot设置下达到当前最优水平,超越了Gemini的上下文提示能力及目标检测专家模型gDino;更多细节见§F.3。RF-100VL包含超出SAM 3当前能力范围的领域专用提示,但SAM 3通过微调适应的效率优于基线方法。
基于单示例的PCS任务。我们首先评估使用从真实掩码中随机采样的单个输入框进行图像示例提示的效果。此评估仅针对"正例"数据,即提示的每个物体均出现在图像中。我们在表3中报告了三种设置下的对应AP+指标:文本提示(T)、示例图像(I)、以及文本与图像结合(T+I)。结果显示,SAM 3在COCO(+18.3)、LVIS(+10.3)和ODinW(+20.5)上均显著超越此前最先进的T-Rex2模型。SA-Co/Gold上的更多结果与细节见§F.2。
基于K示例的PCS任务。接下来,我们在交互式场景中评估SAM 3,模拟与人类标注员的协作。从文本提示开始,我们每次迭代添加一个示例提示:被遗漏的真实掩码作为候选正例提示,误报检测作为候选负例提示。结果(图7)与一个完美的PVS基线进行对比——该基线模拟用户通过理想的框到掩码修正手动修复错误。SAM 3的PCS能力能更快提升cgF1,因其可从示例中进行泛化(例如,检测或抑制相似物体),而PVS仅能修正单个实例。经过3次点击后,交互式PCS相较于纯文本提示提升21.6个cgF1点,相较于PVS细化提升2.0个点。4次点击后性能趋于饱和,因示例无法修复低质量掩码。此时模拟切换至PVS混合模式可带来增益,显示两者具有互补性。
物体计数。我们在物体计数基准CountBench和PixMo-Count上评估SAM 3,通过准确率(%)和平均绝对误差(MAE)与多个多模态大语言模型进行对比,数据来源于既往技术报告及我们的自主评估。结果见表4,更多评估细节见§F.4。与多模态大语言模型相比,SAM 3不仅实现了优异的物体计数准确率,还能提供大多数多模态大语言模型无法生成的物体分割结果。
基于文本的视频PCS任务。我们在自建SA-Co/VEval基准及现有公开基准上评估基于文本提示的视频分割性能。对于SA-Co/VEval,我们报告其子集(SA-V、YT-Temporal-1B、SmartGlasses)上的cgF1与pHOTA指标(定义见§F.5)。对于公开基准,我们采用其官方指标。基线模型包括:开放词汇图像视频分割模型GLEE、"LLMDet + SAM 3跟踪器"(用LLMDet替换我们的检测器)、以及"SAM 3检测器 + T-by-D"(用基于检测跟踪范式的关联模块替换我们的跟踪器)。如表5所示,SAM 3大幅超越这些基线,尤其在名词短语数量庞大的基准上表现突出。在SA-Co/VEval上,其pHOTA指标达到人类表现的80%以上。详见§F.5。
提示性视觉分割。我们在包括视频目标分割(VOS)和交互式图像分割在内的一系列视觉提示任务上评估SAM 3。表6对比了SAM 3与近期最先进方法在VOS任务上的表现。SAM 3在大多数基准上较SAM 2实现显著提升,尤其在具有挑战性的MOSEv2数据集上,SAM 3以6.5个百分点的优势超越先前工作。针对交互式图像分割任务,我们在Ravi等人(2024)提出的37个数据集基准上评估SAM 3。如表7所示,SAM 3在平均mIoU上优于SAM 2。交互式视频分割结果见§F.6及图21。
SAM 3智能体。我们尝试将多模态大语言模型与SAM 3结合,使其作为工具来分割更复杂的文本查询(见图25)。多模态大语言模型提出名词短语查询以提示SAM 3,并分析返回的掩码结果,迭代直至掩码满足要求。表8显示,这种"SAM 3智能体"在ReasonSeg和OmniLabel上的零样本评估超越了先前工作,且未经过任何指代表达分割或推理分割数据的训练。SAM 3智能体在RefCOCO+和RefCOCOg上也优于以往的零样本结果。SAM 3可与多种多模态大语言模型结合,且对所有模型使用同一套系统提示,展现了SAM 3的鲁棒性。更多细节见§G。
关键消融实验。在表9中,我们报告了§A中更广泛消融实验的一个子集。需注意,这些消融模型来自与上述评估模型不同的、更短的训练过程。存在性检测头使cgF1提升1.5个百分点(9a),其中图像级识别指标IL_MCC提高了0.05。表9b显示,添加难负例显著提升模型性能,尤以图像级IL_MCC从0.44跃升至0.68最为突出。表9c表明,合成(SYN)训练数据相比外部(EXT)数据带来8.8个cgF1点的提升,而在此基线基础上,我们的高质量(HQ)标注进一步增加了14.6个cgF1点。我们在§A.2中展示了两种数据类型详细的扩展规律,证明其在领域内及领域外测试集上的有效性。表9d揭示了AI验证器如何改进伪标签质量:用穷尽性验证(EV)AI验证器的得分替换SAM 3的存在性得分,使cgF1提升7.2个百分点;再结合掩码验证(MV)AI验证器移除低质量掩码,额外增加1.1个百分点。总体而言,AI验证器缩小了SAM 3与人类表现之间一半的差距。
领域适应消融实验。通过使用由SAM 3结合AI验证器生成的领域特定合成数据,我们证明可以在无需任何人工标注的情况下显著提升模型在新领域的表现。我们将SA-Co中的一个领域"食品与饮料"从SAM 3和AI验证器的训练中完全剔除。随后,针对这个新出现的"食品与饮料"领域,我们采用三种训练数据变体:SA-Co/HQ中的人工+AI高质量标注(记为SA-Co/HQ-Food);SA-Co/SYN中仅使用AI(无人工)的合成标注(SA-Co/SYN-Food);以及跳过AI验证步骤直接生成的伪标签(即既无AI验证也无人工,记为PL-Food)。图8展示了随着每种类型训练数据规模的扩大,模型在SA-Co/Gold基准的"食品与饮料"测试集上的性能变化。我们将领域特定数据与高质量通用领域数据按1:1比例混合。PL-Food相比基线SAM 3(零样本)有所提升,但由于质量较低,远逊于其他变体。HQ-Food与SYN-Food表现出相似的扩展规律,其中SYN-Food初始略低但最终能追赶上来,且无需任何人工标注成本。这为在新数据分布上提升性能提供了一条可扩展的路径。更多细节见§A.3。
7 相关工作
可提示与交互式视觉分割。SAM(Kirillov等人,2023)引入了具备交互式细化能力的"可提示"图像分割。尽管原始任务定义中包含文本提示,但该功能并未完全实现。SAM 2(Ravi等人,2024)将可提示视觉分割任务扩展至视频领域,允许在任何帧上添加细化点。SAM 3继承了基于几何的分割能力,同时扩展支持文本与图像示例提示,以分割图像与视频中某一概念的所有实例。
图像中的开放词汇检测与分割。该任务旨在为开放词汇物体类别的每个实例提供粗糙边界框(检测)或精细像素级掩码(分割)。近期开放词汇检测(Gu等人,2021;Minderer等人,2022)与分割(Ding等人,2022;Liang等人,2023)方法利用大规模视觉-语言编码器(如CLIP(Radford等人,2021))处理任意文本描述的类别,甚至涵盖训练中未见过的类别。虽然DETR(Carion等人,2020)局限于训练中见过的封闭类别集合,但MDETR(Kamath等人,2021)将其发展为以原始文本查询为条件的范式。图像示例作为提示用于指定目标物体类别(如DINOv(Li等人,2023a)、T-Rex2(Jiang等人,2024))是一种实用的文本替代方案,但在传达物体的抽象概念方面不及文本提示有效。我们引入了一个新的开放词汇分割基准,其独特概念数量较先前工作高出两个数量级。
视觉定位。该任务旨在定位图像中与语言表达对应的区域,并以边界框或掩码形式呈现。Plummer等人(2020)提出了短语检测任务,既要判断短语是否与图像相关,又要对其进行定位。GLIP(Li等人,2022b)和GroundingDino(Liu等人,2023)将物体检测形式化为短语定位,在训练中统一了两项任务。MQ-GLIP(Xu等人,2023)在文本查询基础上增加了图像示例。基于这种向支持多任务与多模态模型发展的趋势,GLEE(Wu等人,2024a)支持文本短语、指代表达及视觉提示,用于图像与视频中的类别与实例定位。与SAM 3不同,GLEE不支持示例提示或交互式细化。LISA(Lai等人,2024)实现了需要推理的分割功能,而OMG-LLaVa(Zhang等人,2024a)和GLaMM(Rasheed等人,2024)则能生成与对应分割掩码交错呈现的自然语言响应,其中GLaMM同时接受文本和可选图像提示作为输入。部分通用多模态大语言模型可输出边界框与掩码(Gemini2.5(Comanici等人,2025))或点(Molmo(Deitke等人,2025))。SAM 3可作为"视觉工具"与多模态大语言模型结合使用(§6)。
多目标跟踪与分割。此类方法识别视频中的物体实例并进行跟踪,为每个实例分配唯一ID。在基于检测的跟踪方法中,每帧独立进行检测以生成边界框与置信度,随后通过基于运动和外观的匹配算法(如SORT(Bewley等人,2016;Wojke等人,2017)、Tracktor(Bergmann等人,2019)、ByteTrack(Zhang等人,2022c)、SAM2MOT(Jiang等人,2025)或OC-SORT(Cao等人,2023))进行边界框关联。另一种方案是采用端到端可训练架构,联合执行检测与关联,例如TrackFormer(Meinhardt等人,2022)、TransTrack(Sun等人,2020)或MOTR(Zeng等人,2022)。TrackFormer采用类DETR编码器-解码器,通过静态物体查询初始化新轨迹,并通过保持身份的轨迹查询自回归地延续现有轨迹。联合模型的挑战在于检测与跟踪之间的任务冲突(Feichtenhofer等人,2017;Yu等人,2023a):检测需聚焦语义,而跟踪需厘清身份,即使两者在空间位置上随时间重叠。SAM 3作为一个强大的图像检测器,与跟踪器紧密集成,实现了视频中概念的精准分割。
8 结论
我们提出了"基于概念的通用分割"(Segment Anything with Concepts),使得开放词汇的文本与图像示例可作为交互式分割的提示。我们的主要贡献包括:(i)引入PCS任务与SA-Co基准;(ii)提出解耦识别、定位与跟踪的架构,扩展SAM 2以解决概念分割问题,同时保留视觉分割能力;(iii)构建高质量、高效率的数据引擎,充分利用人类与AI标注员的互补优势。SAM 3实现了当前最优性能,在SA-Co图像与视频的PCS任务上较先前系统实现性能翻倍。
尽管如此,我们的模型仍存在若干局限性。例如,它在泛化至领域外术语时表现欠佳,这一问题可通过自动领域扩展缓解,但需额外训练。我们在§B中讨论此问题及其他模型局限性。我们相信,SAM 3与SA-Co基准将成为重要里程碑,为计算机视觉领域的未来研究与应用铺平道路。
原文链接:https://arxiv.org/pdf/2511.16719
热门跟贴