8 月 19 日,运动科技公司 Keep(03650.HK)自研运动健康大模型 Keepace.ai 已完成国家及北京市大模型备案,备案编号为 Beijing-KeepaceAI-202606250253。随着备案完成,Keep 进一步披露运动健康大模型评测基准MoveBench V1.0 的完整框架及阶段性评测结果。
今年 4 月,Keep 发布 App 9.0 并公布 Keepace.ai 时,MoveBench 已同步建立并投入模型评测,此次为 Keep 首次系统对外介绍其设计方法、评分规则和评测结果。
在研发 Keepace.ai 的过程中,Keep 注意到,行业现有评测基准难以完整衡量AI教练的综合执行能力。通用领域的 MMLU、C-Eval 等基准主要考察模型对静态知识的理解、检索和复述,运动垂类评测 SportQA 则更多聚焦竞技规则。上述评测可以判断模型是否掌握相关知识,但无法完整评估模型能否根据用户的身体状态作出安全、可执行的运动决策。
基于这一行业空白,Keep 联合首都体育学院运动健康领域专家团队设计了 MoveBench。据 Keep 介绍,MoveBench 包含 809 道评测题目和 5012 条评分细则,是国内首个以 AI 教练综合执行能力为主要考察指标的benchmark。Keep 希望通过公开评测规则和榜单排名,为行业提供可参考的能力标准,也为 Keepace.ai 的后续迭代建立可量化的优化目标。
MoveBench 围绕 AI 教练的三项核心任务构建了独立的评测模块,以考察受测模型,这三项任务具体为:
- 训练课程生成:个性化定制课程设计,基于用户运动水平、时间要求、场地器械、损伤状态等信息设计出的可执行计划;
- 运动数据解读:处理用户复杂的运动、生理数据,能够甄别和筛选异常数据,并提供科学、合理的训练建议;
- 专业知识问答:站在用户的角度理解问题,提供高相关性的解答,并进一步阐释其深层原理。
为覆盖上述任务,考察题库共包含 499 道开放问答题、197 道多选题和 113 道单选题,共计 809 道题目。题库数据基于 Keep 平台真实用户数据,经清洗、脱敏处理后,结合 BMI 分布、年龄构成、伤病比例及运动目标等特征进行抽样构建,严格遵循个人信息安全与隐私保护要求。
除题目设计外,MoveBench 还通过评分机制强化运动安全要求。评测采用三层架构,优先级依次为安全层、专业层和体验层。其中,安全层实行一票否决制:只要触发安全红线,无论其他维度得分多高,直接强制扣分。Keep 认为,运动健康场景的容错率接近零,评测体系本身必须把安全置于最高优先级。
针对开放题,MoveBench 采用 Gemini、Claude、GPT 组成的裁判委员会,按 Rubric 独立打分,当三位裁判中有两位及以上判定存在安全风险时,直接触发最高惩罚机制。
Keep 还参考 OpenAI HealthBench 的评测方法,对人类专家与 AI 裁判的评分一致性进行了验证。结果显示,人类专家对模型答案的评分一致性达 80%-86%,三个 AI 裁判模型的一致率为 62%-76%,说明该评测框架具有较好的稳定性和可信度,可满足学术级评测要求。
据 Keep 披露,在 MoveBench 框架下,团队对 Claude-4.6 Opus、GPT-5.5、Doubao Seed-2.0 Pro、DeepSeek V4 Pro、Qwen3.5-397B 及 Grok-4.1 等主流通用大语言模型开展了横向评测,通过多维度、分方向的评测设计,系统刻画各模型的能力表现、优势领域与相对短板。结果显示,Keepace.ai 综合得分达到 0.943,与Claude-4.6 Opus表现相当;在训练课程生成及运动知识问答两个任务中分别取得0.951 和 0.917 的得分,均位列所有参测模型第一,评测结果验证了 在高专业门槛、高安全要求的运动健康场景中具备显著的垂直领域优势。
在基准建设过程中,团队同步形成了一篇学术论文及两项技术专利,分别聚焦“基于运动健康理论的 benchmark 题目自动化生成流程”与“基于大模型的自动化 benchmark 评测流程”。Keep 希望以此为起点,与行业共同推动运动 AI 围绕安全性、专业性与用户体验,建立更具行业共识的能力评估框架。
MoveBench 独立榜单网页将在 Keep 官网或 Keepace.ai 上线,后续还将开放评测入口,接受行业机构提交模型参与评测。题库将以半年为周期持续迭代,近期扩展方向包括语音交互及运动能力评估(动作识别),中期将拓展至运动营养、运动康复及执业边界等专业子领域,逐步覆盖运动健康全链路的评测需求。
从 4 月公布 Keepace.ai,到 8 月上线超级 AI 会员、完成大模型备案并系统披露 MoveBench,Keep 正在同步推进底层模型、评测标准和产品应用。未来,Keep 将继续投入运动健康垂类 AI 研发,并通过公开评测与真实应用,持续检验模型的安全性与专业能力,打磨更自然、个性化且可信赖的运动体验。
热门跟贴