始智AI wisemodel.cn开源社区

始智AI wisemodel.cn社区是源自中国的中立开放的AI开源社区。正在,欢迎加入共同成长。wisemodel社区上线,H800/H20等资源上线,价格实惠,灵活方便,支持在线微调训练模型,及和,并。

在人工智能领域,内存占用和性能之间的平衡一直是亟待解决的难题。姚期智院士团队带来了破局方案——全新注意力机制TPA。

TPA通过对每个token实施动态张量分解,突破传统。它不再保存完整的静态KV,而是存储其分解版本。

实验数据显示,这一创新使内存占用锐减90%甚至更多,同时模型性能并未受到丝毫影响。

TPA不仅性能卓越,还从理论上证明了流行的MHA、MQA、GQA都是它的特殊情况,用一个框架统一了现代注意力设计

T6一经发布便引发各界热议。创业者们惊喜地发现,借助TPA技术,能大幅降低云服务成本;研究者们则期待团队能在更大规模模型上开展实验,带来更多令人期待的成果。代码已上线始智AI-wisemodel开源社区,欢迎大家使用。

代码地址

https://wisemodel.cn/codes/yifanzhang/T6/intro

动态张量分解,无缝集成RoPE

在AI领域,现有注意力机制虽然成果斐然,却饱受计算与内存开销大的困扰。像DeepSeek-v2提出的MLA,虽压缩了KV缓存,却与RoPE位置编码不兼容,每个注意力头都得额外设置位置编码参数。为突破这些瓶颈,姚期智院士团队创新性地推出张量积注意力(TPA,Tensor Product Attention)机制。

TPA独辟蹊径,在注意力计算时对QKV进行分解。和LoRA系列低秩分解方法不同,TPA会把QKV分别构建成与上下文相关的分解张量,能根据实际情况动态适应。

而且,TPA仅缓存分解后的秩,合理设置参数就能让内存占用锐减90%甚至更多。

更值得一提的是,TPA与流行的RoPE位置编码能无缝集成,能以低成本旋转分解KV,无需复杂调整。

基于TPA,团队打造出全新模型T6。实验中,用FineWeb-Edu 100B数据集训练T6,其困惑度相比其他注意力设计更低。

在ARC、BoolQ、HellaSwag和MMLU等基准测试里,T6的零样本和少样本性能出色,TPA和TPA-KVonly在多数任务中优于或追平所有基线。

TPA的出现,为人工智能领域的发展开辟了新路径,有望推动更多高效能模型的诞生 。

论文由清华&上海期智研究员团队、UCLA顾全全团队合作,共同一作为清华博士生张伊凡与姚班校友、现UCLA博士生刘益枫。此外还有来自心动网络Taptap的Qin Zhen。

编辑:成蕴年

----- END -----

wisemodel相关:

系统升级:

系列模型:

关于wisemodel更多

1

欢迎持续关注和支持

开源社区建设需要长期坚持和投入,更需要广大用户的积极参与、贡献和维护,欢迎大家加入wisemodel开源社区的志愿者计划和开源共创计划。期待更多开发者将开源成果,包括模型、数据集和代码等发布到 wisemodel.cn 社区,共建中立、开放的AI开源社区生态。欢迎扫码添加wisemodel微信,申请加入wisemodel社群,持续关注wisemodel.cn开源社区动态。

2

欢迎加盟wisemodel开源社区

始智AI wisemodel社区自2023年9月上线以来,逐渐成为影响力日益扩大的中立开放的AI开源社区,为了加快公司发展,我们长期需要技术、运营等人才加盟,技术侧重在AI infra、后端开发,熟悉K8S、模型训练和推理等技术, 以及熟悉开发者生态运营的成员,欢迎感兴趣的朋友加盟,可以通过添加wisemodel微信,或者将简历投递到邮箱:liudaoquan@wisemodel.cn

3

欢迎投稿优质内容

欢迎投稿分享人工智能领域相关的优秀研究成果,鼓励高校实验室、大企业研究团队、个人等,在wisemodel平台上分享各类优质内容,可以是AI领域最新论文解读、最新开源成果介绍,也可以是关于AI技术实践、应用和总结等。投稿可以发邮件到liudaoquan@wisemodel.cn,也可以扫码添加wisemodel微信。

4

关于wisemodel开源社区

始智AI wisemodel.cn开源社区由清华校友总会AI大数据专委会副秘书长刘道全创立,旨在打造和建设中立开放的AI开源创新社区,将打造成“HuggingFace”之外最活跃的AI开源社区,汇聚主要AI开源模型、数据集和代码等,欢迎高校科研院所、大型互联网公司、创新创业企业、广大个人开发者,以及政府部门、学会协会、联盟、基金会等,还有投资机构、科技媒体等,共同参与建设AI开源创新生态。

向上滑动查看