6 月 23 日,火山引擎在北京举行 2026 FORCE 原动力大会。字节 CEO 梁汝波通过视频演讲提到,AI 的影响不亚于 PC、Web 和 Mobile,企业关注的问题也从“要不要做 AI”转向“怎么做 AI”。字节今年会继续收缩业务宽度,把资源聚焦到 AI,火山引擎 MaaS 业务也已经从创新业务上升为基础业务。
豆包的调用量已经先涨起来了。截至今年 6 月,豆包大模型日均 Token 调用量突破 180 万亿,过去一年增长超过 10 倍;在中国公有云 MaaS 服务市场,火山引擎以 49.5% 的份额位居第一;目前已有超过 200 家企业在火山引擎上年度累计 Token 使用量超过 1 万亿,半年增长一倍。
这组数据背后,是企业 AI 使用方式的变化:模型承担的任务正在从问答和生成,延伸到代码、视频、Agent、权限和安全这些更重的流程。
▍豆包2.1 Pro跨过质变点
火山引擎总裁谭待把豆包 2.1 Pro ,并用了“质变点”来解释这次升级。按照他的说法,模型跨过这一点,才具备满足企业和个人生产需求的能力。视频生成领域此前是 Seedance 2.0,Coding 与 Agent 领域则是 Claude Opus 4.6。
豆包 2.1 Pro 这次被放到更长的任务链路里。研发场景要看代码生成后的验证和修复,Agent 场景要看连续工具调用,长视频场景要看模型理解内容后能不能继续生成脚本、配音和成片。
芯片设计里的 RTL 测试,是这条线里最重的材料。豆包 2.1 Pro 连续运行近 18 小时,完成 6 个核心模块、1303 行 RTL 代码,经历 9 轮迭代,并跑通仿真、测试、综合检查。RTL 是芯片设计里的硬件描述语言,写完之后还要进仿真、综合和验证。放到研发现场看,这类任务考验的不是代码行数,而是模型能不能在检查、报错和修复之间持续迭代。
这也解释了为什么 TRAE 会被放到同一条线上。过去一年,豆包的 Coding 能力持续进入 TRAE,Token 消耗量增长 50 倍,达到 5.6 万亿,用户也在从工程师扩展到更多非技术背景人群。火山引擎还提到,TRAE 后续会和企业版开发工具、IDE 能力继续打通。模型能力如果要进入研发流程,最后必须落到工程师每天使用的工具里。
同样的要求,也出现在更复杂的 Agent 和多模态任务中。豆包 2.1 Pro 可以调动 500 多个 Agent 协同作业,累计触发上千次工具调用,生成 100 多栋建筑,并完成多轮自我迭代;也可以一次解析两小时长视频,生成解说文案,匹配片段,合成配音和情绪 BGM,最后输出带字幕的成片。这些任务共同指向的,都是模型在长链路里的执行能力。
价格也被一起摊开。Doubao-Seed-2.1-Pro 每百万 Tokens 输入 6 元、输出 30 元,缓存命中价格 1.2 元,综合使用价格较 Claude Opus 4.6—4.8 降低近 80%;面向高频调用的 Doubao-Seed-2.1-Turbo,价格为 Pro 的一半。
火山引擎还推出 Doubao-Seed-Evolving,聚焦 Coding 和 Agent 场景,以每月 2 到 4 次的速度迭代。企业和开发者不需要更换 API 接入节点,就能继续使用更新后的模型。目前,豆包大模型 2.1 已在火山引擎开放 API 服务,火山方舟体验中心同步上线,并接入豆包、TRAE、扣子等产品。
▍多模态模型同步上新
多模态这一组更新,放到内容生产链条里更容易看清楚:视频往预演和可修改走,图像往可编辑走,音频往完整声音方案走。
Seedance 2.5 预计 7 月上线。它把单段原生视频时长拉到 30 秒,最多支持 50 个全模态素材联合输入,也支持在保持画面一致的前提下做局部编辑。对广告、电商、短剧和 IP 二创来说,这几项能力都指向同一个问题:AI 视频要进入生产流程,需要经得住反复修改。
白模预演也放在这一条线里。很多试错发生在成片之前,镜头怎么走、空间关系顺不顺、节奏对不对,都要先判断。白模预演把视频生成的位置往前推,从成片环节接到分镜和预演。
Seedance 2.0 也同步升级到原生 4K 直出,并支持 10-bit 高位深输出。这类升级服务后期制作:发丝、服装纹理、运动过程和色彩层次保留下来,后面才有调色和精修空间。
火山引擎还预览了 AI 版权商业化平台,并提到与周星驰旗下比高集团合作,获得三部影片的 AI 创作授权,相关模板单日创作量超过 10 万次。AI 视频进入 IP 二创后,版权授权、模板分发和二创管理会成为商业化的一部分。
图像模型的升级,重点落在可编辑。Seedream 5.0 Pro 支持交互式精准编辑、多图层分离、高密度信息表达和多语种文字生成。过去生成一张图已经不难,难的是改一块文字、换一个局部元素、拆出某个图层继续调整。科普信息图、电商页面、PPT 页面和多语种海报,都是这类能力更容易落地的场景。
音频模型则往完整作品走。Seed-Audio 1.0 把角色对白、情绪语气、方言口音、背景音乐和拟音特效放进一次生成里。豆包语音合成模型 2.0 也做了语种扩展,语音合成支持超过 15 种语言,声音复刻支持超过 20 种语言。它面向的是完整声音方案,员工培训、手机助手、智能车控和智能外呼都在这个范围里。
▍Agent开始接入企业系统
模型可以生成代码、视频和声音,企业还要把这些能力放进自己的系统里。
一个 Agent 不能只停在聊天框里。它要接工具、读数据、跑流程,也要在失败后能排查,多个 Agent 之间能分工,沉淀下来的 Skills 能被复用。企业关心的也会从“能不能回答”,转到“能不能接进现有系统”。
火山引擎智能算法负责人吴迪讲火山方舟时,把重点放在 Agent 的开发和部署上。火山方舟已有超过 110 万企业和个人使用。方舟 CLI 被拿出来单独讲,开发者可以用一行指令把火山方舟接入任意 Agent,同时做用量管理、自动诊断和报错修复。
AgentKit 处理的是更底层的开发和治理。它覆盖身份鉴权、运行时、沙箱、可观测、知识、评测等模块,这次新增 Policy 和 Registry。Policy 管 Agent 的行为边界,避免它超出身份、权限和策略范围执行任务;Registry 管企业内部的 Agent、Skills 和工具资产,让这些能力可以统一注册、发现和治理。
懂车帝、上汽、顺丰科技也被放在 AgentKit 的应用里。它们分属汽车内容、整车企业和物流科技,业务差异很大,但都绕不开同一类问题:Agent 一旦进入真实流程,就要接系统、调工具、管权限,也要能留下运行记录。
ArkClaw 企业版更靠近员工日常使用。它面向企业内部 Agent 工作台,负责接入企业应用、数据、工具和流程,并统一管理 Agents、Skills、MCP 等能力。企业内部一旦出现多个 Agent、多个工具和多套数据源,就需要一个统一入口把权限和使用方式收住。
HiAgent 3.0 管的是运行之后的事。它记录 Agent 的运行轨迹、业务反馈和成功做法,让验证过的执行链路沉淀成可复用的 Skill。数字员工也被放进一套生命周期管理里,从招聘、上岗前考核,到调度协同和交付评估。
中金财富的数字投顾 Agent,落在投顾服务规模化上。券商很难只靠增加人手扩大投顾服务,用户问题分散在行情、产品、账户和配置里,回答还要经过专业资料和合规边界。这个 Agent 先处理问题理解、资料调用和标准化回答;涉及强投资建议的内容,再交给人工投顾或合规流程。
▍AITrust处理安全审计
Agent 接进企业系统后,安全问题会变得更具体。它可能读取业务数据、调用内部工具、触发后续流程,风险也会从内容准确性扩展到数据、权限和审计。
最先需要处理的是模型调用中的数据安全。企业把数据送到云端模型,最担心的是数据传输、推理过程和访问记录失控。AICC 机密计算面向云端模型调用中的加密和审计,处理的是数据传输、云上计算和访问记录的安全问题。
Agent 开始调用工具后,身份、权限和调用记录会变成必须单独管理的部分。AI 助手安全平台要管的是它是谁、能看什么、能做什么,以及每一次动作能不能被记录。企业让 Agent 接工具之前,需要先把这些边界定义清楚。
到安全运营里,企业面对的是告警分析和处置效率。安全运营 Agent 面向告警分析和处置,把过去依赖人工值守的部分交给多智能体协同处理。会议材料里提到,相关方案的告警处置准确率可以达到 99% 以上。
中国移动的案例落在数据安全上。火山引擎与中国移动联合发布“移动引擎机密模型服务”专区,面向央国企和高敏感行业的数据不出域需求,把移动云安全能力和机密推理服务结合起来。企业使用云端模型时,数据传输、推理过程和访问记录都要留在可追溯、可审计的环境里。公开报道也提到,该专区在移动云上构建安全可信的机密执行环境,使豆包大模型推理过程保持端到端加密,并实现可追溯、可审计。
中国石油勘探与开发研究院的场景落在安全运营上。能源行业系统多、告警多,安全团队容易被重复告警和低价值告警占用。安全运营 Agent 要处理的是自动值守、告警分析和初步处置,把噪音先过滤掉,再把关键事件交给安全人员判断。
华勤和理想汽车则分别对应研发测试安全和 AI 助手防护。华勤在研发测试阶段基于豆包大模型搭建自动化检测体系,并采用 AICC 机密计算安全架构;理想汽车联合火山引擎构建 AI 助手纵深防御体系,把智能体的调用边界、身份权限和运行风险放到一起管。
✦精选内容✦
热门跟贴