打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

又一个新里程碑!

就在今天,谷歌DeepMind官宣Gemma开源「全家桶」的最新战绩——

累计下载,首破十亿大关。

打开网易新闻 查看精彩图片

2024年2月首次上线,从0到10亿,用了整整两年半的时间。

如今,全球开发者基于Gemma,「爆改」出10万个衍生变体,入轨NASA卫星、接入1亿人手机.......

属于Gemmaverse的生态大爆发,真的来了!

打开网易新闻 查看精彩图片

AI找出抗癌通路

4000种药虚拟试杀

如今,AI正式向癌症发起了总攻!

在Gemma的众多案例中,真正令人震撼的是,AI开始深度参与探索癌症治疗的新机制。

就在昨天,全球mRNA巨头Moderna与默沙东用AI治疗癌症,轰动全球。

打开网易新闻 查看精彩图片

实际上,早在今年1月,谷歌便带着Gemma悄悄入局。

谷歌DeepMind、谷歌Research和耶鲁大学团队,基于Gemma开发了一个27B参数模型:

Cell2Sentence-Scale 27B,简称C2S-Scale。

打开网易新闻 查看精彩图片

论文地址:https://www.biorxiv.org/content/10.1101/2025.04.14.648850v4

C2S-Scale只做了一件事:把一个细胞写成一句话。

一直以来,癌症免疫治疗有个卡了很多年的坎,叫「冷肿瘤」。

通俗讲,免疫系统抓坏细胞,靠的是细胞主动「举牌子」——

把自己内部的蛋白碎片挂到表面,等于告诉免疫细胞:我这儿不对劲,来查我。

这个动作的学名叫「抗原呈递」,挂牌子用的那个架子叫「MHC-I」。

「冷肿瘤」的问题就是:它不举牌。

打开网易新闻 查看精彩图片

免疫细胞从旁边走过去,什么都看不见。再好的免疫治疗药,也打不到一个隐形的靶子。

干扰素,就是免疫系统的「警报信号」。但它在真实的肿瘤里,水平通常很低,几乎等同于不存在。

于是,研究团队给C2S-Scale出了一道题:

找一种药,它自己不负责拉警报,但只要环境里有一点微弱的警报声,能把这个声音放大到足以让细胞举牌。

这个「只在特定条件下起效」的要求,是整个实验最难的地方。

把细胞,变成一句话

C2S-Scale最聪明的地方在于,它做了一个很朴素的转换。

单细胞测序的数据本来是一大坨高维向量,人看不懂,语言模型更看不懂。

它的具体的做法是,把基因名按活跃程度从高到低排成一串,最活跃的排最前面,串成一串。

一个细胞,变成了一句由「基因名」组成的句子。

打开网易新闻 查看精彩图片

这么一转,不用改Gemma任何架构,就能直接「读」细胞了。

而且它还能顺带把论文摘要、细胞元数据这些纯文字的东西一起吃进去,第一次在同一个模型里被同一套机制处理。

接下来,是论文最核心的设计——双上下文虚拟筛选(dual-context virtual screen)。

让C2S-Scale同时在两个「平行世界」里做同一场实验。

世界A(免疫上下文阳性):真实患者的原发肿瘤样本,环境里有微弱的干扰素信号。

世界B(免疫上下文中性):培养的细胞系数据,完全没有干扰素活动。

打开网易新闻 查看精彩图片

然后把4000多种药物,一个一个丢进这两个世界里跑一遍。

要找的目标很刁钻:只在A里起效、在B里毫无动静的药。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

C2S-Scale命中的候选药物中,只有10%-30%在过往文献里被提到过。

剩下七成以上,跟这个筛选目标毫无已知关联。

而最终被挑出来的那个,是silmitasertib(代号CX-4945),一种CK2激酶抑制剂。

模型给它打的标签叫「context split」——上下文劈叉:在世界A里效果强烈,在世界B里几乎为零。

论文中,团队称C2S-Scale真正提出了一个新的、可以被证伪的假设。

活细胞实验,成功验证

假设归假设,真伪要靠活细胞实验验证。

团队采用了人源神经内分泌细胞模型,关键在于,这些细胞模型在模型训练时从未出现过。

三组对照结果如下:单用silmitasertib:抗原呈递没有变化;单用低剂量干扰素:有轻微提升。

只有当两个一起上:抗原呈递提升约50%。

这是AI第一次,提出全新的机理性治疗通路,并在活细胞中得到验证。

谷歌Gemma,十亿里程碑

开源AI,10亿次下载,还是Llama那个时代。

谷歌首次发布Gemma时,首批模型只有2B、7B两个尺寸。

它和Gemini「师出同门」,但路线完全不同:旗舰Gemini主打前沿模型能力,Gemma则被设计成更轻、更容易本地部署的开放模型。

开发者能够直接拿到权重,在自己的电脑、手机和边缘设备上运行。

自2024年之后,Gemma的增长速度越来越离谱。

打开网易新闻 查看精彩图片

2025年3月,Gemma发布一周年时,下载量刚刚突破1亿;到2025年12月,这个数字已经超过3亿。2026年4月Gemma 4发布时,累计下载量超过4亿;

到了今年第二季度,已超9亿下载。

现在,又一个月左右过去,数字正式冲过10亿。与此同时,一个庞大的Gemma生态诞生了。

除了入局癌症,谷歌Gemma还被送上了太空,向地球发送了第一条信息,「地球人,你好」!

这是历史上第一次,有大模型在太空里的高性能GPU上跑起来。

打开网易新闻 查看精彩图片

不仅如此,Gemma还钻入海里,破译了海豚的声音。

这款模型名叫,DolphinGemma。

它直接接收海豚声音,寻找其中重复出现的模式和序列,并尝试预测:下一声海豚叫声会是什么。

打开网易新闻 查看精彩图片

Gemma宇宙,大爆发

今天,在宣布10亿下载的同时,谷歌还正式上线了一个新的官方GitHub库。

Awesome Gemma,相当于Gemmaverse的官方目录。

打开网易新闻 查看精彩图片

GitHub传送门:https://github.com/google-gemma/awesome-gemma

这里集中收录了AI社区微调模型、教程、开发者工具,以及各种Gemma应用。

打开网易新闻 查看精彩图片

过去两年的大模型战争,很容易被理解成一场「谁的模型最聪明」的比赛。

但Gemma的10亿下载,展示了另一个维度:

AI更具颠覆性的路径,是悄无声息地融入每一台硬件。

参考资料:

https://blog.google/innovation-and-ai/technology/developers-tools/gemma-one-billion-downloads/

https://github.com/google-gemma/awesome-gemma

编辑:桃子