本期AI日报集中释放了多条产品级更新:腾讯混元发布开源旗舰模型Hy4preview,Midjourney V8.2上线图像编辑模型,谷歌推出Gemini Omni 1.1 Flash视频模型。蚂蚁集团、阿里、小鹏和Anthropic也在同一周期内公布了各自的技术进展。
腾讯混元Hy4preview:770B参数与1M上下文
腾讯发布的开源旗舰模型Hy4preview,总参数为770B,上下文长度为1M。该模型定位真实生产力场景,覆盖软件工程、办公、游戏开发和科研等领域。根据原文信息,Hy4preview在内部盲测中评分优于GLM-5.3与Kimi K3,这一结果被用来证明其在生产力场景中的性能表现。
Midjourney V8.2:从生成走向编辑
Midjourney V8.2引入了图像编辑能力,包括指令微调、多图参考、局部重绘和画布扩展。其中指令编辑能力允许用户通过文本指令直接修改图像。对创作者来说,这意味着从单次生成转向对已有图像的灵活修改,视觉创作的控制精度有所提升。
谷歌Gemini Omni 1.1 Flash:高清长时视频生成
谷歌推出的Gemini Omni 1.1 Flash是一个多模态模型,专注于高清、长时的视频生成。它提供场景扩展、运镜控制和参考视频片段等功能。场景扩展允许用户在已有视频结尾处无缝衔接并继续生成后续画面,每次扩展步长为10秒。这一设计直接回应了视频生成中连续性和可控性的需求。
蚂蚁集团与阿里:金融模型与智能体工作台
蚂蚁集团推出金融增强大模型Ling-3.0-flash-Fin,该模型基于Gemma 4微调而成,专门用于金融分析。原文指出,它在信息检索、图表理解、数值计算和文本生成四大核心能力上表现突出,通用能力也得到提升,并计划开源。
阿里发布的智能体工作台Qoder,从一个AI编程工具升级为面向所有人的智能体工作台。新版本将工作对象从“代码工程”转向“智能体任务”,支持“读——改——验证——迭代”的自主闭环,并提供编程和通用两种模式。
小鹏VLA升级与Anthropic MHS标准
小鹏第二代VLA大模型进行了升级,重点提升对时间的理解能力,从3D扩展到4D。模型推理效率得到优化,并引入整车大脑Master Agent,将L4级体验下放至量产车型。升级还引入了Infini-VLA长时序架构,使模型能够理解和处理更长的时序数据,以应对动态驾驶环境。
Anthropic推出MHS硬件标准,这是一套统一的控制与通信标准,用于连接AI智能体和物理设备。该标准的发布标志着Anthropic进入具身智能和物理AI领域,并已在生物医药等行业中展现出潜力。原文金句指出,MHS标准将大模型竞争从对话延伸到动手操作领域,为AI操控物理世界提供了统一的接口。
本期日报的信息密度较高,但主线清晰:模型能力正在从文本对话向图像编辑、视频生成、金融分析、智能体执行和物理设备控制等多个方向同时扩展。腾讯、谷歌、Midjourney、蚂蚁、阿里、小鹏和Anthropic各自选择了不同的切入点,但都在解决同一个问题——如何让模型从“会回答”走向“能干活”。
热门跟贴