这听起来像是谍战电影里的情节,却正在一步步走进现实。
美国情报高级研究计划局成立于2006年,隶属于美国国家情报总监办公室,专门资助高风险、高回报的前沿研究。
按照项目设定,这套系统需要在不依赖任何嵌入元数据的情况下,确定多媒体内容的拍摄或录制位置。
它的性能目标相当苛刻:90%的预测结果误差要控制在250米以内,而且要在5分钟内给出答案。搜索范围则可以大到约1550英里,相当于从北京到广州的直线距离还要更远一些。
这套系统需要同时处理视觉和听觉信息。画面中的建筑风格、植被、道路标识和地形,都可能成为线索;而环境中的鸟鸣、车流声、方言广播等声音,同样能透露地点信息。
而且,整个过程要在没有人工引导的情况下自主完成。
据报道,美国情报高级研究计划局于今年4月召开了项目提案人日会议,相关竞标已于6月截止。项目研发周期为15个月,期间将进行五次独立测试,大约每季度一次。
测试将使用参赛团队从未见过的隔离数据集,以确保系统的真实能力。参赛团队还必须提交容器化的软件和源代码。
值得注意的是,项目明确排除了人脸识别、声纹识别、生物特征识别等技术,也不接受只针对单一地区或单一地貌的系统。这意味着,研究人员必须让AI真正学会从环境本身“读懂”地点,而不是依赖识别特定人物。
按照官方说法,这项技术将主要用于打击人口贩卖、营救人质,以及支持情报和执法行动。
美国情报高级研究计划局首席副局长亚伦·卢卡斯表示,这些研究项目将帮助构建直接适用于任务需求的能力。
北卡罗来纳大学教堂山分校的刘晓明博士则长期从事计算机视觉研究,关注模型在不同地理环境下的泛化能力。
事实上,该机构早在2011年至2016年就曾实施过一个名为“Finder”的类似项目,探索图像地理定位技术。
这项技术引发的隐私担忧同样不容忽视。
如果任何一段视频都能被迅速定位,那么普通人在社交媒体上分享的生活片段,也可能暴露自己的住址和行踪。新闻记者、维权人士和冲突地区的平民,都可能因此面临新的风险。
实际上,通过公开图像判断拍摄地点,早已是开源情报领域的一项重要技能。
过去,这项工作往往依靠经验丰富的分析人员,对照卫星地图、街景图像和各种细节线索,花费数小时甚至数天才能完成。而AI的加入,可能把这一过程压缩到几分钟,并实现大规模自动化处理。
这既是情报工作效率的巨大飞跃,也意味着监控能力的进一步扩张。技术本身无所谓善恶,关键在于由谁使用、如何使用、受到怎样的约束。
如何在公共安全与个人隐私之间划定边界,将是这类技术必须面对的长期考题。
热门跟贴