来源:市场资讯

(来源:ACM 计算机学会)

关注ACM 掌握最新计算机前沿

ACM

ACM「对话」

打开网易新闻 查看精彩图片

Pei Cao是全球最大视频平台YouTube的工程副总裁。2016-2023年,她担任YouTube搜索工程负责人;2023年至今,主导YouTube信任与安全部门的工程团队。2016年前任职于谷歌,设计出可检索数千亿网页文档的可扩展系统。她拥有多项技术与软件创新专利,包括近期一项视频动态缩略图生成专利。

Cao于2013年成为ACM会员,近期获评ACM Fellow,表彰其在网页缓存、搜索引擎效率与信息质量领域的突出贡献。

ACM

访谈内容

Q1

您的职业发展路径,是如何让您如今专注于网络搜索与信息挖掘领域的?

我一直对CPU、内存、存储与网络之间的协同机制抱有浓厚兴趣。对于特定负载下的任意系统,吞吐量几乎总会受限于这四大组件中的某一项。由此引出一个有趣的问题:我们能否利用非瓶颈组件的闲置性能,来缓解瓶颈组件的压力?

攻读博士期间,我研究的负载场景中磁盘存储是性能短板。我发现,优秀的缓存与预取算法可以借助RAM分担磁盘压力,从而提升系统整体性能。

博士毕业后,正值万维网(World Wide Web)飞速发展,但全球互联网基础设施尚未完善。用户访问网站时频繁遭遇延迟与连接超时。整个互联网系统的瓶颈在于网络带宽。解决方案?利用磁盘存储在靠近用户的位置缓存网页,本质上是以存储空间换取网络带宽。我的研究方向便是研发高性能网页缓存服务器。

在搭建网页缓存服务器时,我们遇到了一个具体难题:如何在一台服务器上汇总动态变化的URL集合,以便另一台服务器高效完成集合成员检测?我与Andrei Broder针对该问题开展研究,提出的解决方案——计数布隆过滤器(Counting Bloom Filters),现已成为众多计算机系统中广泛应用的数据结构。

2004年加入谷歌后,我遇到了规模空前的同类挑战:如何索引互联网上全部网页,并实现超高每秒查询数(QPS)的搜索响应?传统方案成本高到难以承受。我们必须创新运用缓存、过滤、预计算、压缩等技术,最大化利用现有算力、随机存取记忆体(RAM)、网络、固态硬盘(SSD)与磁盘,从而降低成本。我带领团队耗费多年搭建了这套系统。

我热爱攻克性能优化难题,恰巧新问题层出不穷,因此我始终乐在其中!

「READING」

Q2

据近期统计,2025年第二季度YouTube用户规模接近28亿,而2010年第二季度仅为2.34亿。从基础设施层面来看,YouTube是如何支撑这种爆发式增长的?展望未来,YouTube又将如何匹配用户规模的持续扩张?

工程师热衷于攻克挑战性问题,而YouTube的规模化发展正是这样一类有趣的难题,推动我们提出新思路、打破固有认知。一个典型例子是我的同事研发的Argos(一种ASIC芯片),可低成本实现视频编码转换。

我在该领域的研究重点是降低网络带宽消耗。我负责YouTube视频缩略图团队期间发现,YouTube是全球图片访问量最大的网站之一,因此图像压缩对平台和用户都至关重要。2016年,我们与Chrome团队合作,为YouTube视频缩略图采用WebP格式,使图片体积缩小15%以上。2017年,我们推出算法筛选的动态缩略图,帮助用户无需观看视频开头即可快速判断是否观看。

随着YouTube持续发展,其工程团队将不断创新,为数十亿用户提供优质服务。

「READING」

Q3

社交媒体正在改变搜索形态,越来越多用户(尤其是Z世代)更习惯通过视频而非文字获取信息。总体而言,YouTube如何应对这些新趋势?

我目前不再负责YouTube搜索团队,因此部分观点可能略显滞后。总体来说,视频信息检索比文本检索更困难,主要有两点原因:视频包含的文本信息远少于网页;在长视频中精准定位查询对应的答案片段十分繁琐。

针对第一个问题,在大语言模型(LLM)普及前,YouTube搜索团队采用多种方式丰富视频关联文本信息,例如利用共观看图协同训练文本与视频嵌入向量。如今,具备强大视觉理解能力的LLM,将大幅缓解这一难题。

针对第二个问题,YouTube搜索团队优化了搜索结果的呈现形式。2021年,我们开始在搜索结果中直接展示视频章节,用户可一键跳转至包含答案的视频片段。2022年,上线“视频内搜索”功能:若查询词匹配视频内某一时刻的内容,搜索结果会展示对应片段摘要并定位该时间点。

我想拓展一下问题,谈谈YouTube搜索另一类独特的服务对象:低识字率人群。全球近8亿人不识字,其中绝大多数为女性。对他们而言,视频无需文字阅读即可观看,YouTube是其获取互联网信息的唯一渠道。但想要检索信息,他们需要依靠语音搜索使用YouTube!

因此我们大力优化语音搜索体验:研发专用纠错技术,降低搜索语音识别的字错误率;利用个性化算法,适配不同用户的说话习惯以提升识别准确率;增加识别语音的音频确认提示,方便用户修正识别错误。这些优化落地后,发展中国家的语音搜索使用量显著增长。这项工作让YouTube搜索团队尤为有成就感。

「READING」

Q4

作为YouTube工程副总裁,您的工作包括负责平台信任与安全部门的技术研发。请举例说明一项支撑平台安全合规使用的重要技术突破(软件或硬件均可)。

我不谈技术突破,想聊聊YouTube当下面临的一大挑战:深度伪造内容与人工智能生成媒体的检测。过去三年,AI工具篡改媒体、生成全新视频的能力飞速提升。如今人类已难以可靠分辨内容是实拍影像、GenAI创作,还是经其篡改的产物。可想而知,AI篡改与生成的媒体极易被滥用,用于传播虚假信息、网络骚扰甚至更恶劣的用途。因此,辨别图像/视频是实拍、GenAI生成还是GenAI篡改,至关重要。

这项内容分类任务未来数年都将是一大难题。正规AI工具厂商正积极推出synthID、水印等技术,但机器学习(ML)模型的开源特性,意味着总有非正规工具生成的内容。此外,若依靠ML模型完成检测,恶意攻击者可针对检测模型训练对抗样本,研发规避检测的生成模型;我们则需要迭代升级检测模型,识别对抗生成内容。这种攻防博弈将无限持续。

YouTube信任与安全团队主要采取两大应对策略:第一,联合行业伙伴,支持C2PA行业规范。该标准既允许正规GenAI厂商标注生成内容来源,也支持数码相机厂商通过加密方式证明图像/视频的真实性。我们认为,这种来源认证方式可与ML检测手段形成互补。第二,积极与学术研究者合作,研发检测GenAI生成媒体的机器学习技术。2026年8月,YouTube与IEEE将联合举办首届合成媒体溯源与检测国际研讨会。我们期待开展更多产学研合作。

「READING」

Q5

结合您丰富的从业经历,您对刚入行的年轻从业者有哪些建议?

计算机科学领域发展日新月异,每十年都会涌现新的挑战,需要科研群体共同攻克。职业发展过程中,你未必一直从事所学的细分技术方向。但扎实的计算机科学基础,能让你快速学习任意细分领域并做出贡献。因此要做好持续学习的准备,勇于涉足全新领域。