品玩6月20日讯,斯坦福大学的大模型测评榜单HELM MMLU近日发布了最新结果。阿里巴巴的通义千问Qwen2-72B模型在排名上超过了Llama3-70B,成为表现最优的开源大模型

斯坦福大学基础模型研究中心,致力于创建一种透明、可复现的评估方法。HELM框架对不同模型在MMLU上的评估结果进行标准化和透明化处理,解决了现有MMLU评估中存在的问题。例如,对所有参评模型使用相同的提示词,并在每项测试主题上为模型提供同样的5个示例进行情境学习。

斯坦福大学基础模型研究中心主任Percy Liang近日在社交平台发布了HELM MMLU最新榜单。榜单显示,阿里巴巴的通义千问开源模型Qwen2-72B排名第5,仅次于Claude3Opus、GPT-4o、Gemini1.5pro和GPT-4,是排名最高的开源大模型,同时也是表现最优的中国大模型。