始智AI wisemodel将打造一个“All for Agent”的原生技术平台,始终坚持“中立、开放、共建、共创、合作”五项基本原则,欢迎加入共同成长。
RWKV7 G1i 13B/7B/3B/1B系列,纯RNN:
目前在code和STEM离qwen35还有差距,预计年底追上。
在线玩(选【✨HTML Generation】):https://huggingface.co/spaces/BlinkDL/RWKV-Gradio-3
https://huggingface.co/spaces/BlinkDL/RWKV-Gradio-4
测试3D场景。这次加的数据多,需要生成更复杂的代码,模型正在消化(代码有bug就会黑屏),预计下月会稳很多。迄今仍没加中转站数据,所以进步空间巨大。
群友反馈。这种题,没专门训过。
以及discord开发者,测试G1i的原生agent能力进步。G1g原生不懂(但state tuning后懂),G1h原生开始懂。
https://codeberg.org/scarletwolf_ai/rwkv-toolcaller-bench
进步更大的G1j会在9月发布,总之,目标是年底base model在各方面到qwen35,同时只需要训十几T数据。我在 分享RWKV-7迄今的训练记录,从1B到13B 分享了训练记录。
现在RWKV discord还有几个RWKV agent / harness项目,欢迎围观。链接在 https://www.rwkv.com/
然后预告RWKV8 RPU。RPU是我造的词。因为RWKV作为RNN有显著的独特的加速潜力,这在现有的GPU/NPU仍非最优体现,必须用新思路。
RWKV和三家芯片公司合作,有三种互补的新思路。而且还需要各种奇怪的未公布的模型架构,擅长做奇怪的架构。
RPU的设计目标是,单路就达到10000+ token/s(其实还可以快几倍,这里保守些)。也就是1秒生成一个游戏。其它方面,欢迎大家推测。
----- END -----
热门跟贴