一次完整的规划、构建、验证流程,全部在WorkBuddy里跑通了。Hy4预览版用Three.js创建了一座宝塔寺庙,从思考到构建再到验证,总共花了1小时27分钟。这个结果来自WorkBuddy_AI官方账号在2026年8月28日下午2点42分发布的一条实测分享。
发布者用“fun”来形容这次测试体验,并特别提到“从规划到构建到验证,全部在WorkBuddy内部完成”。推文还表达了对用户创作内容的期待:“喜欢看到人们用它创造出的东西。”
Hy4相比Hy3是一次重大升级。根据官方披露的信息,新版本在多个维度上都有明显变化。最直观的是算力规模:活跃计算量从21B提升到49B,几乎翻了一倍。官方表述为“Active compute nearly doubled”,即活跃算力接近翻番。
另一个关键变化在推理方式上。Hy4会像Ox-alpha一样,在执行前先完整思考、整体规划。官方原话是“It thinks, plan whole before execution as Ox-alpha”,强调模型在动手之前先完成全局规划,而不是边做边想。这种先规划后执行的方式,被官方列为Hy4相较Hy3的重要升级点之一。
盲测结果也被写进了这条发布里。官方称Hy4在盲测专家评审中击败了GLM-5.3。推文原文为“Beat GLM-5.3 in blind expert testing”,没有给出具体测试项目、样本量或分差数据,只保留了“盲测专家评审”这一限定条件。
从这次宝塔寺庙的案例看,Hy4预览版的实际产出路径已经比较清晰。用户给出一个目标,模型先完成规划,再调用Three.js进行构建,最后进入验证环节。整个过程被压缩在1小时27分钟内,且全程不需要跳出WorkBuddy环境。对于需要快速验证三维场景或前端可视化方案的用户来说,这种“规划—构建—验证”的一体化流程,省去了在不同工具之间来回切换的成本。
算力翻倍带来的直接变化,可能体现在复杂任务的完成度上。21B到49B的提升,意味着模型在单位时间内可以调用的计算资源大幅增加。结合“先规划后执行”的机制,这类升级通常指向更长的推理链条和更完整的任务拆解能力。不过官方没有在推文中展开说明49B具体对应什么架构或参数规模,只给出了数字对比。
关于GLM-5.3的对比,目前能确认的信息只有一句结论。官方没有公布盲测的题目类型、评审人数或评分标准。因此这个“击败”只能作为官方单方面披露的结果来看,具体差距有多大、在哪些任务上领先,还需要等待更详细的评测报告。
Hy4预览版目前展示出的能力边界,集中在三维内容生成和任务自动化方向。宝塔寺庙这个案例本身带有一定的展示性质——Three.js是成熟的前端三维库,宝塔结构又相对规整,适合用来演示“规划—构建—验证”的完整链路。但能在1小时27分钟内完成从无到有的全流程,并且官方愿意把这个时间数字公开出来,说明团队对当前版本的效率已经有了一定信心。
从Hy3到Hy4的升级逻辑,可以概括为三个关键词:先想、多做、快验证。先想,对应Ox-alpha式的全局规划;多做,对应算力从21B到49B的翻倍;快验证,对应1小时27分钟完成宝塔寺庙的完整流程。这三件事放在一起,构成了WorkBuddy对下一代AI工作流的基本判断:模型不能只会生成,还要会规划、会检查、会交付。
这次发布的信息量不大,但每一条都指向同一个方向。官方没有展开讲技术细节,也没有放出完整的评测报告,只是用一条推文和一个具体案例,把Hy4预览版的关键变化点列了出来。对于关注WorkBuddy进展的人来说,算力翻倍、盲测击败GLM-5.3、1小时27分钟完成三维构建,这三个数字已经足够勾勒出Hy4的大致轮廓。
热门跟贴