打开网易新闻 查看精彩图片

始智AI wisemodel将打造一个“All for Agent”的原生技术平台,始终坚持“中立、开放、共建、共创、合作”五项基本原则,欢迎加入共同成长。

打开网易新闻 查看精彩图片

RWKV7 G1i 13B/7B/3B/1B系列,纯RNN:

打开网易新闻 查看精彩图片

目前在code和STEM离qwen35还有差距,预计年底追上。

在线玩(选【✨HTML Generation】):https://huggingface.co/spaces/BlinkDL/RWKV-Gradio-3

https://huggingface.co/spaces/BlinkDL/RWKV-Gradio-4

打开网易新闻 查看精彩图片

测试3D场景。这次加的数据多,需要生成更复杂的代码,模型正在消化(代码有bug就会黑屏),预计下月会稳很多。迄今仍没加中转站数据,所以进步空间巨大。

打开网易新闻 查看精彩图片

群友反馈。这种题,没专门训过。

打开网易新闻 查看精彩图片

以及discord开发者,测试G1i的原生agent能力进步。G1g原生不懂(但state tuning后懂),G1h原生开始懂。

https://codeberg.org/scarletwolf_ai/rwkv-toolcaller-bench

打开网易新闻 查看精彩图片

进步更大的G1j会在9月发布,总之,目标是年底base model在各方面到qwen35,同时只需要训十几T数据。我在 分享RWKV-7迄今的训练记录,从1B到13B 分享了训练记录。

现在RWKV discord还有几个RWKV agent / harness项目,欢迎围观。链接在 https://www.rwkv.com/

然后预告RWKV8 RPU。RPU是我造的词。因为RWKV作为RNN有显著的独特的加速潜力,这在现有的GPU/NPU仍非最优体现,必须用新思路。

RWKV和三家芯片公司合作,有三种互补的新思路。而且还需要各种奇怪的未公布的模型架构,擅长做奇怪的架构。

打开网易新闻 查看精彩图片

RPU的设计目标是,单路就达到10000+ token/s(其实还可以快几倍,这里保守些)。也就是1秒生成一个游戏。其它方面,欢迎大家推测。

----- END -----