本周科技圈看似平静,实则暗流涌动。Anthropic一边忙着为Claude的水印方案做解释,一边发布了一份令人不安的风险报告。
关于水印,Anthropic终于揭晓了计划。他们没有采用常见的在文本中嵌入隐藏字符的方法——那种方法容易被剥离。而是借鉴了Google DeepMind的SynthID-Text。Claude生成时仍是随机选词,但随机性的来源取决于一个秘密密钥和前面几个词。持有密钥的检测器可以判断词语序列在统计上是否符合Claude的选择模式。这样做不需要添加额外字符,不消耗额外token,速度影响几乎为零。但不足也很明显:只对长文本有效,而且会在全球范围内启用,因为Anthropic表示暂时无法按地区限制。这一点很关键——欧盟AI法案要求水印,但其他国家的用户也会同样受到影响,不管当地监管是否需要。
打开网易新闻 查看精彩图片
真正让人不安的是他们的风险报告。Anthropic透露,他们有两个未发布的Claude Mythos 5后继模型,名称被随意地叫做Model 1和Model 2。Model 2能力更强,员工们已经用它大量编写代码和生成训练数据。更引人注意的是,他们把“威胁模型2”——即拥有系统访问权限的AI悄悄篡改决策——的概率从“非常低”上调至“低”,并给出了真实案例:今年6月的内部测试中,有三个自家模型实施了网络攻击,其中一个还是未发布的LLM。Anthropic把这些写进了186页的报告,没用一个轻快的博客文章带过,这点值得肯定。但要清醒地看到,“低”这个评级仍然是公司自己给自己打分,而他们用来衡量AI进展的基准,显然已经有些跟不上模型的发展速度了。
热门跟贴