【CNMO科技消息】近日,据外媒报道,上海交通大学、苏黎世联邦理工学院等机构研究人员提出一套名为COSM的新型协同调度框架,试图解决手机运行端侧大模型时的高功耗问题。研究显示,当前智能手机进行AI推理时,超过60%的能量并非用于实际计算,而是消耗在处理器与内存之间的数据传输上。
打开网易新闻 查看精彩图片
随着大模型逐渐从云端进入手机,本地AI既要保证响应速度,又受到功耗、散热和内存带宽限制。研究指出,运行约70亿参数模型时,需要持续将存储在内存中的大量数值数据传输到计算设备,既增加功耗,也容易造成发热以及生成速度波动。
COSM的思路是引入PIM,也就是“存内处理”。这类方案把部分计算能力放到内存附近,让数据尽量在原地完成处理,减少反复送往CPU、NPU的次数。不过手机空间和成本有限,CPU与PIM往往需要共享同一片内存,两者同时访问时又容易产生资源冲突。
打开网易新闻 查看精彩图片
据CNMO科技了解,为解决这个问题,COSM加入了可中断的PIM指令和空闲时段感知调度机制。当CPU需要访问内存时,PIM可以暂时让路;系统同时判断CPU访问中的空档,再把PIM任务塞入这些时间窗口,从而尽量减少双方互相抢占资源。
论文实验结果显示,与基线调度方式相比,COSM最高可将PIM吞吐量提升2.8倍,同时把CPU性能损失控制在2%以内。在大模型与普通手机任务并行运行时,AI推理吞吐量最高提升2.6倍,其他任务性能下降不足2.2%,单个Token所需能量也得到明显降低。
热门跟贴