把 Hy4 预览版从头到尾跑一遍,过程比预想中有趣得多。从规划、构建到验证,所有环节都在 WorkBuddy 里完成。看到人们用它做出来的东西,确实能感受到这个版本带来的变化。

一次完整的构建实测

打开网易新闻 查看精彩图片

这次测试里,Hy4 Preview 用 Three.js 创建了一座宝塔寺庙。从开始思考、动手构建到最终验证,整个流程耗时 1 小时 27 分钟。这个数字放在上一代版本上,几乎很难想象能跑完全程。

和 Hy3 相比,这次升级的幅度相当明显。最直观的变化是它在执行前会先完整思考、整体规划,而不是边做边改。这种工作方式让整个构建过程更有条理,也减少了中途返工的可能。

算力与评测表现

底层算力方面,活跃计算量从 21B 提升到了 49B,接近翻倍。更大的计算规模意味着模型在处理复杂任务时,有更多空间去推演步骤、校验结果。

在盲测环节,Hy4 的表现也压过了 GLM-5.3。专家盲测的结果通常比公开跑分更能反映真实能力,因为测试者不知道模型身份,评价会更客观。这次能在这个环节胜出,说明 Hy4 在规划和验证上的提升不是纸面参数。

从规划到验证的闭环

WorkBuddy 把规划、构建、验证三个环节串在同一个工作流里,用户不需要在多个工具之间来回切换。Hy4 先想清楚整体方案,再动手执行,最后自己检查结果。这种闭环设计对需要快速验证想法的开发者来说,省下的不只是时间,还有反复试错的成本。

从这次宝塔寺庙的案例来看,1 小时 27 分钟完成一个可验证的 Three.js 项目,已经能说明 Hy4 在复杂任务上的处理能力。随着更多人用它做出不同的东西,这个版本的实际边界还会被继续拓宽。