打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

如果你准备投胎,你大概率会降生在哪个国家?

会拥有怎样的职业、收入、价值观,乃至对一个APP按钮颜色的小小偏好?

在过去,要算清这串横跨社会学、行为经济学和心理学的概率,无数社会学家和统计学家要熬秃头。

打开网易新闻 查看精彩图片

1999年《黑客帝国》中科幻场景,刚刚成真了!

哈佛+MIT博士领衔、OpenAI、Anthropic、Google DeepMind、xAI等40余人参与、共200多位顶尖科学家,发布MatrAIx,构建83亿个智能体,模拟全世界人类真实行为。

打开网易新闻 查看精彩图片

在大模型王座争夺战里杀得刺刀见红的巨头们,这一次,竟然心照不宣地联手织造了一张网——一张囚禁了全人类行为的「数字之幕」。

打开网易新闻 查看精彩图片

论文:https://arxiv.org/abs/2608.04205

GitHub Repo:https://github.com/MatrAIx-ai/MatrAIx-Persona-8B

他们赋予AI智能体人格:

1、创建了覆盖全球人口规模的83亿条人物画像记录,涵盖背景、心理、能力、行为及生活方式等 1290 个维度。

2、支持在四种环境类型中进行人物画像智能体评估:问卷调查、AI 聊天机器人、网页和应用。

3、提供覆盖 25+领域、1000+项评估任务,涵盖商业、软件、金融和医疗健康。

打开网易新闻 查看精彩图片

传统用户研究员、产品经理的核心技能瞬间贬值。

同时,每个人都必须面对一个问题:

当你的「个性」只是1290个高维空间中自洽的概率分布时,你如何证明自己仍是不可被完全模拟的唯一?

AI算尽全人类性格!

产品经理的「奥本海默时刻」

传统的用户研究(User Research)在这一天,迎来了它的「奥本海默时刻」。

过去,科技巨头要推一款新应用、新策略,需要耗费数月、招募成百上千个不同肤色和背景的真实志愿者、进行无数次灰度测试和线下访谈。

在 MatrAIx的硅基世界里,这个高壁垒、高延迟、高成本的流程被压缩成了一瞬间。

Persona-8B数据库的规模为83亿,与此刻物理地球上的真实总人口,实现了一比一的精确镜像。

打开网易新闻 查看精彩图片

它们不需要交五险一金,却比你更懂得如何在macOS上优雅地拒绝一个糟糕的UI设计。

有了这83亿可以随时调遣的数字原住民,接下来要做的,就是把它们投放到社会生活中去。

MatrAIx团队为其量身定制了四个全通路的模拟交互环境,称之为MatrAIx Playground

打开网易新闻 查看精彩图片

  1. 调查问卷 (Surveys):测试概念、定价敏感度、不同群体的支付意愿。

  2. AI聊天 (AIChatbots):完整记录对话轨迹,追踪虚拟用户在面对AI犯错、胡说八道时的真实情绪波动和追问习惯 [1.1.5]。

  3. 网站 (Websites):智能体在这个沙盒网络里像普通网民一样搜索、比价、看评论,最终做出购买决策。

  4. 应用程序 (Applications):这甚至不再是文字层面的交锋。智能体可以直接操控 Linux、macOS 和iOS的桌面,通过虚拟鼠标、键盘和触控进行各种复杂的日常软件操作。系统会一滴不漏地记录下它们的文件变动、权限变化和操作轨迹。

在这个沙盒里,研究团队已经针对 25 个不同领域(涵盖商业、软件、金融、医疗等)部署了 1,010 个复杂的评估任务。

打开网易新闻 查看精彩图片

他们总共运行了18,189 次大规模模拟用户交互实验

在400次极其严苛的控制实验中,这些由底层大模型驱动的虚拟智能体,符合指定人设的一致率达到了惊人的91.5%

打开网易新闻 查看精彩图片

在对从真实人类中提取的人设进行一致性评估时,人类专家打出了 4.135 的高分(满分 5 分)。

而驱动这些虚拟人的底层大模型,其表现已经无限逼近人类评估者的黄金标准:

Claude Opus 4.893.8%的情况下,其评估误差与人类专家的评分偏差控制在 1 分以内!

GPT-5.579.2%的情况下,误差在 1 分以内。

这表明,如今的顶级大模型不仅掌握了逻辑和常识,甚至已经掌握了社会学的「同理心模拟器」

它们能精准地计算出一个「身处美国中产阶层、性格保守内向的50岁主妇」,在面对一个科技产品的漏洞时,会表现出怎样微妙的愤怒与失望 。

这83亿个数字幽灵,究竟是怎样被「捏」出来的?

1290高维空间,捏造AI灵魂的精密图纸

每个「人」的背后,都有一张包含1290个画像维度的精密属性矩阵。这些维度被划分成了五大核心地带:背景信息、心理特征、专业能力、行为互动、日常生活。

打开网易新闻 查看精彩图片

数据来源包括联合国人口统计、General Social Survey、Wikipedia人物志、Amazon真实消费评论、Stack Overflow开发者调查……

如果只是随机组合,AI只会捏出逻辑崩坏的「赛博怪物」。比如,一个住在肯尼亚农村、只有小学学历、却只懂冰岛语、拥有哈佛博士学位、年入百万的存在。

为了解决这个问题,研究团队构建了一张宏大的有向无环图(DAG)。属性与属性之间存在着严密的条件依赖:

当系统决定一个虚拟人的「英语能力」时,必须先计算「主要语言」和「所在地区」这两个父节点的联合概率。

再叠加残酷的兼容性过滤器:只要父子属性出现违背常理的冲突,判定立刻归零,该组合被一键抹杀。

在这套公式的洗礼下,合成出来的虚拟人既保持了宏大的多样性,又在个体内部维持了坚不可摧的逻辑自洽。

再加上从Wikipedia、Amazon消费历史、Stack Overflow开发者调查等真实人类历史遗存中提取的数亿级「真实灵魂切片」,Persona-8B 数据库里的每一个幽灵,都像是一个在平行宇宙里真实生活过的、有血有肉的人。

你是否想过:自己对某个APP颜色的偏好,其实可以被还原成父节点概率的乘积?

当个性被1290个刻度精准测量,人类所谓的「独一无二」,在AI眼里,只是一段自洽的概率分布。

虚无的莫比乌斯环

这是技术上的神迹,但如果剥开披在外面的效率外衣,你会看到一个令人毛骨悚然真相。

大模型(比如GPT-5.5、Claude Opus 4.8)在MatrAIx里扮演「消费者」和「社会成员」,去评估和测试另一个由大模型驱动的「虚拟人」。

这就像是一个人,在用左手扮演顾客,去买自己右手做出来的面包,然后左手给右手打了一个五星好评。

打开网易新闻 查看精彩图片

在这个闭环里,真实的人类,无了。

如果虚拟用户在沙盒里给一款新药或一款社交软件打出了91.5%的高分,它在现实中就一定能取悦那些会流泪、会无理取闹、会被天气和荷尔蒙左右的肉身人类吗?

这种「自循环生态」最可怕的副作用,在于「黑天鹅与灵魂」的彻底消失

人类历史上最伟大的艺术、最颠覆性的商业模式、甚至最惊艳的科学突破,往往并不来自于1290个概率刻度计算出来的「自洽性」。

它们往往诞生于不可理喻的执念、以及偶然发生的逻辑混乱——那些被 DAG 算法过滤器视为「不兼容」而一键抹除的异常值里。

如果未来所有的数字产品、政策和内容,「AI模拟的83亿人口」可以测试和优化,那么,这个世界将会变得极其顺滑。

但也同时会变得极度空洞和无趣。

这是一个专门为了迎合「数字幽灵的偏好」而量身定制的索然世界。

论文的末尾,研究团队保持了科学家特有的克制与清醒:

虚拟用户永远无法完全替代真实人类,对于那些关乎社会命运的高风险决策和重大科学结论,真实用户的亲自参与仍然不可替代,

参考资料:

https://matraix.ai/

https://arxiv.org/abs/2608.04205

https://github.com/MatrAIx-ai/MatrAIx-Persona-8B

https://x.com/MatrAIx2026/status/2085217711781564492

编辑:大卫