编辑|Panda、张倩
通勤路上,你挤在地铁车厢里,手机举到耳边,微信语音那头是同事在交代今天要交的方案细节。「关于那个…… 预算…… 三点之前……」声音断断续续地,关键信息大半都遗漏了。
在地铁、地下车库或者大会、演唱会现场,你是不是经常遇到这种情况?只要网络变差,微信通话就变成了一件折磨人的事情,卡顿、吞字、电流声让人莫名烦躁…… 怎么都 2026 年了,想打个微信电话把事情说清楚还那么难?网络差就听不清,这真的是铁律吗?
在今年 WAIC 中国电信的展台上,我们看到了反常识的一幕。展台上摆着两部正在通话中的手机,上面各自显示着一个局域网 IP 地址,音质听起来很清晰。然而,其背后的几个字「极窄带宽语音通话」却吸引了我们的注意。
「极窄」到底是有多窄?我们在现场听到了一个超乎想象的数字:0.266kbps
没错,超夸张。你可以查看你电脑上任意一个音频文件的码率,你几乎不可能找到如此低码率的文件。0.266kbps 确实是一项新的世界记录。
目前主流的音乐文件的码率通常为 320kbps,某些甚至可达到数千 kbps
那么,码率究竟是什么?其实从其单位也能看出来,kbps = kilo-bits per second,也即每秒多少千比特;也就是说,码率决定了一秒钟的语音里能装下多少信息。码率越高,声音细节越完整;码率越低,数据要挤过狭窄的通道,就得舍弃细节 —— 声音发闷、发飘、断断续续,都是这么来的。
在实际语音通话中,服务商通常会使用动态码率:网络好时用高码率,清晰流畅;一旦网络波动(比如地铁钻进隧道),就自动降到低码率,以保住通话不断。
那 0.266kbps 到底有多低?做个对照更能体会:移动通信的语音编码走过了 2G 的 AMR-NB、4G 的 AMR-WB,到今天 VoLTE 高清通话普遍采用的 EVS 编解码(这已是 3GPP 迄今性能最好的语音编码),但也需要在 5.9 到 128 kbps 区间工作,日常一通 VoLTE 高清通话大约需 15 kbps。而智传网(AI Flow)把这个数字压到了 0.266 kbps!
按过去的经验,这种码率顶多传输一些简单的文字指令,打电话是想都不敢想的事,极端情况下,对方说「飞流直下三千尺,疑是银河落九天」,你听得到的却是「飞…… 天」。但在中国电信这里,它不仅能清晰通话,甚至连音乐都能传 —— 仅相当于传统编解码技术 128 kbps 的 1/500;如果只传语音,码率还能更低。这也刷新了已知语音通信的最低码率纪录
可以说,中国电信的这项技术挑战了「网络差就听不清」的铁律。而这项技术也有个名字:智传网(AI Flow),由中国电信人工智能研究院(TeleAI)全自研原创打造。就在大会开幕当天,它从 230 多个项目中脱颖而出,拿下了今年 WAIC 的最高奖:卓越人工智能引领者奖(SAIL 奖),这个奖也被称为「AI 界的奥斯卡」。
此外,智传网(AI Flow)的核心技术生成式智能传输(Generative Transmission)还获得了首届 WAIC-Academic 最佳论文奖
那么,智传网(AI Flow)到底是什么?为什么能做到传统通信做不到的事?会对哪些领域带来深远影响?中国电信集团CTO、首席科学家、中国电信人工智能研究院(TeleAI)院长李学龙在 WAIC 中国电信人工智能生态论坛上进行了深度解析。
生成式智能传输:
把传「比特流」变成传「词元流」
智传网(AI Flow)是什么?其名字本身就已暗示:智代表人工智能,传是指通信传输,而网指网络技术。
表面看是一项技术,但背后融合了三大学科,这就不难理解为什么智传网(AI Flow)会诞生在 TeleAI。
TeleAI 是央企里第一家人工智能研究院。而中国电信这家公司本身就是通信起家的。也正因如此,通信的天花板在哪里、瓶颈卡在哪里,没有人比他们更清楚。智传网(AI Flow)就是他们把 AI 这套新工具,接进通信这门老手艺后长出来的东西。
它到底新在哪儿?关键在于换掉了传输的「货物」。
最传统的通信本质上做的是符号搬运。你的声音被麦克风收进来,收到多少信息,就原原本本传多少比特;视频则拆成一个个像素点往外发。信息越清晰,数据量越大,占的带宽也越多。这是一笔省不掉的刚性开销。
带宽不够怎么办?只能压缩,而压缩又分为无损压缩和有损压缩。为了尽可能降低带宽,只能选择有损压缩,即丢弃部分细节。可压缩有极限,压到最后,就是我们熟悉的那种糊成一团、断断续续的体验。所以在旧框架里,这几乎是个死结:要清晰就得要带宽,没带宽就别想清晰。
不同程度的图像有损压缩示意,音频也是类似
智传网(AI Flow)的不同之处在于,它是一种借助智能完成的压缩。其核心技术叫生成式智能传输,思路可以概括成六个字:用计算换带宽
具体来说,发送端不再直接搬运声音本身,而是先用多模态大模型把这段语音「读懂」,把其中最核心的语义、声纹、特征等信息,凝练成一小串词元(Token)发出去;接收端收到这串词元后,再用生成式大模型把声音重新「生成」还原出来。传输的对象,就此从「比特流」变成了「词元流」。词元的体量远小于原始比特,带宽占用自然断崖式下降。
这套打法背后是 TeleAI 早就铺下来的理论地基。早在 2002 年,李学龙团队就提出了信容理论,揭示了计算、通信与存储之间可以相互折叠、彼此换算的关系。除此之外,团队对「噪声」的重新定义也为这套架构扫清了认知障碍——传统通信视噪声为洪水猛兽,而「正激励噪声」理论指出,当噪声与任务目标相关时,它反而能降低任务复杂度、起到正向驱动作用。这一认知让AI不再盲目地「丢弃」低码率下的细节,而是学会区分哪些是干扰、哪些是可用的线索。后来,多模态大模型成熟,「用计算换带宽」终于得以从纸面走进现实 —— 通信研究盯了几十年的编码和信道,天花板被 AI 捅破。
对智传网(AI Flow)来说,传语音其实只是一道「简单题」,毕竟语音的码率本来就不大。真正的考验是视频。
传统视频编码(从 H.264 到 H.265、H.266)本质上是在「找冗余」,即靠帧间预测和运动补偿,只记录前后画面里变化的部分。这套思路已经打磨到极致,H.266 在理想情况下甚至能把码率压到 H.264 的四分之一。但它再聪明,传的仍然是像素的差值,一旦带宽被压到临界点,残差信息不够了,画面就开始糊、开始丢帧。这是「搬运像素」这条路线绕不开的物理下限。
同样地,智传网(AI Flow)更换了这条路线:不再搬运像素差值,而是传词元。
发送端从视频流中抽出画面语义、动态特征,凝成轻量的词元流发出;接收端再把画面重新「生成」出来。结果相当夸张:一段 1080P、24FPS 的高清视频,不到 100kbps 就能稳定传输,而传统方式需要约 3.6Mbps—— 前者只有后者的 3%。如果说语音方向,智传网实现的是「用发信息的带宽打电话」,那在视频方向它就实现了「用打电话的带宽传高清视频」。
极致的压缩效率让「传词元」这件事的想象力没有止步于传画面。和世界模型联手之后,它甚至能传一个「世界」。
最近有多少人熬夜看世界杯?但无论你买的电视多大,你能看到的画面始终是导播给你切的那个角度,说白了就是一个三维世界的投影。
智传网(AI Flow)就不一样了,借助词元流,它能装下一场球赛的球员、足球、球场和动作轨迹之间的时空关系。当然,要把这样的词元流还原成画面,靠传统解码已经不够了,TeleAI 在接收端引入的,正是当下 AI 领域最热的技术之一:世界模型。
接收端也不再只是逐帧重建像素,而是根据词元流还原出一个可进入、可观察的三维世界 —— 同一次射门,你可以从全景俯瞰,可以贴身跟拍,甚至可以切换到门将的第一人称视角,重新看一遍。
视频链接:https://mp.weixin.qq.com/s/jBVInHGPdfZtFc79I6NBAQ
李学龙在演讲中用了柏拉图的比喻:传统视频里,观众是洞穴中看影子的囚徒;而智传网(AI Flow)让你走出洞穴,自由翱翔。对赛事直播来说,这也许意味着一件不小的事:「导播决定你看什么」的时代,正在出现裂缝。
这就是「传比特」和「传词元」的本质区别,前者很快触及天花板,而后者的应用边界才刚刚开始探索。
当然,画面是 AI「生成」出来的,一个自然的疑问是:它能信吗?毕竟,一个不可信的东西,你传得再快、再清晰有什么用?
这方面,TeleAI 给出的回答是双重保障。一方面,团队对重建的通信速率与理解性能做了系统评估,无论是下游任务的理解能力,还是原始音视频的重建质量,都达到国际领先水平;另一方面,可信溯源技术会给每一段重建视频打上「不可磨灭的数字烙印」,确保无论从哪个视角观察,事件的真实性都不会被篡改。
这其中,藏着一次迟到七十多年的突破。早在信息论奠基之初,香农和韦弗就把通信分成了三层:符号层,关心一串比特能否准确送达;语义层,关心意思有没有传对;效用层,关心接收方拿到信息后能不能真正把事情办成。传统通信八十年来主要在啃第一层。
而智传网(AI Flow)想做的是让同一串词元贯通三层:它既是精准重建画面的特征数据(符号层),又是可被理解、推理的语义向量(语义层),还能直接驱动一次救援决策或一个机器人动作(效用层)。
以灾区救援为例,一棵树的纹理还原得准不准,优先级其实很低;「哪里有人、道路断没断、房子会不会塌」,才是效用层真正在乎的东西。
所以,智传网(AI Flow)真正的意义,不只是把声音、画面压缩得更小,而是让信息以「可信可用」的形态抵达原本到不了的地方,去发挥它应有的效用 —— 这对 AI 来说,正是当下最紧迫的一道关卡。
天空地海:低带宽链路下实时传输音视频
这几年 AI 的演进有一条清晰的主线:从大模型,到智能体,再到具身智能,能力越来越强,也越来越需要突破物理边界「走出去」,走进天空、荒野、深海这些人和网络都难以抵达的地方。可传统通信的覆盖,高度依赖基站、光纤和稳定电力,一旦离开这些基础设施,连接就会迅速崩塌。
智传网(AI Flow)要做的,是让一批硬件终端摆脱这种束缚,把智能送到更远的地方。TeleAI 把这件事拆成了天、空、地、海四个方向。
先看「天」和「空」。当下业界都在喊「算力上天」,但算力上天的意义究竟在哪?过去,卫星在通信网络里扮演的角色几乎没变过,它就像一面挂在天上的镜子,只负责把信号反射回去,大部分的「思考」都发生在地面。算力上天真正的价值,就是让卫星从「管道」变成「节点」:信息还在轨道上,就被读懂了。
道理成立,但怎么落地?智传网(AI Flow)提供了实现的可能。星地链路的特点是地面终端功率小、天线小,往卫星发信号(上行)的带宽很紧张;而卫星往地面广播(下行)的带宽相对宽裕。顺着这个天然的不对称,智传网(AI Flow)把最吃算力的解码模型部署到在轨卫星上 —— 终端只管把轻量词元发上去,重活留给天上。目前,这一应用方向还在推进过程中。
而顺着这张网往下,就到了「空」这一层 ——轻小型无人机直连卫星,传输高清视频,这是国内首次
视频链接:https://mp.weixin.qq.com/s/jBVInHGPdfZtFc79I6NBAQ
轻小型无人机是低空勘察的核心装备,却长期被物理瓶颈死死卡住:想传得快、传得清,就得背更重、更耗电的通信设备,可设备一重,续航和机动性就得打折。过去它还必须先把画面传给地面的临时接收站,再由地面转发上星,而这意味着无人机不能飞得太远,只能围着地面设备打转。
而 TeleAI 在国内首次做到:给无人机装上一个生成式智能传输的「盒子」和一套小型卫星通信设备,让它直接连上卫星。
在这套方案下,无人机以平均约 60 kbps 的带宽就能实时回传 720P 视频,而同样的画面用传统 H.264 编码大约需要 2 Mbps。挣脱了基站和光纤的羁绊,无人机实时回传的范围一下子变大了。从此,断网不再意味着失联,生命线被重新搭起,「信息孤岛」这个词,第一次在物理意义上被拆掉了。
再看「地」,也就是机器人。人类把机器人造出来,目的之一就是让它们去我们去不了的地方,完成对我们有危险或我们不愿意做的任务。但由于机器人的自主性依然有限,人去摇操机器人是当下最好的选择。但这一摇操半径,经常因无法忍受的网络延迟被锁死在一个小小的范围内。智传网(AI Flow)实现的突破在于:通过传词元这种高效的传输方式,它把端到端时延压缩到 20—50 毫秒(最新已降到 20 毫秒),首次让机器人的远程遥操作半径覆盖到全国范围;即便在没有基站的荒野,也能靠卫星链路实现千里之外的画面实时回传和精准操控。
此外,机器人要走进复杂环境干活,光靠单打独斗还不够,关键在于机器与机器之间能不能高效协同。智传网(AI Flow)的不同之处在于:它依托统一编码的词元流,可以让不同型号、不同厂商的机器人共享同一套环境感知。
视频链接:https://mp.weixin.qq.com/s/jBVInHGPdfZtFc79I6NBAQ
TeleAI 自研的人形机器人,以及像宇树这样的合作伙伴的机器人,都能接入这张网:一台机器人发现的路况,可以同步给另一台;一台学到的经验,可以变成整个机器人网络的共识。多台设备由此减少重复感知与重复计算,逐步走向分布式群体智能
最后是「海」或者说「水」。我们生活在一个被水包围的世界,很多活动都在水里展开。可在无线通信意义上,任何一片水域都是一块「信号黑洞」,因为电磁波在水里衰减极快,几乎传不了几米;换光通信,清水里能传得远,可水一浑浊就瞬间失效。于是只能退回到声波,因为声学链路是浑浊水体里唯一还能远距离传输的载体,但它本身带宽极窄。智传网(AI Flow)做的,是在这条狭窄的声学链路上,硬生生跑通了实时高清视频。
依托智传网(AI Flow)与自研的高速声通信模组,TeleAI 首次实现了在任意水体中的远程无线实时视频传输,可在超过 10 米的距离上稳定回传 720P 高清画面,应用于水下巡检、生态监测、应急搜救等场景,为这些极端环境提供了稳定、实时的无线视觉通信能力。
这套核心载荷,目前已经搭载在 TeleAI 自研的「空海跨域潜航器」上。我们可以把它理解成一台能从空中扎进水里的无人机,未来还将随着与中国船舶集团的合作,出现在更多平台上。
视频链接:https://mp.weixin.qq.com/s/jBVInHGPdfZtFc79I6NBAQ
卫星、无人机、机器人、潜航器,形态各异,但智传网(AI Flow)让它们说上了同一种语言 —— 词元。过去,每往一个新空间拓展,通信方案就得重新造一套;而现在,同一套词元流从天到地、海一路通用。这意味着一件事:机器能抵达的地方,智能就能抵达;过去网络到不了的地方,从此不再是智能的禁区
当然,让终端走得远只是上半场。这些被送出去的能力,最终要在一个个真实的场景里兑现价值 —— 这是智传网(AI Flow)要回答的下一个问题。
三个规模化落地场景
TeleAI 目前跑得最实的,是应急、存储和隐私三块。
第一块是应急救援。今年全球极端天气频发,洪涝灾害往往带来「断路、断电、断网」的三断困境,灾区瞬间被切割成一座座信息孤岛,而救援最大的难处,常常不是没有力量,而是不知道现场究竟发生了什么。
智传网(AI Flow)在这里派上了大用场。中国电信打造的「翼锋·智传网(AI Flow)应急系统」,只需在手机上装一个 App,一线人员就能在极窄的卫星链路下把现场画面传回后方 —— 传一张图只要约 9.6 kbps,配合应急救援车提供的约 110 kbps 带宽,就能实时回传 720P 高清视频。
要知道,过去在三断场景下,传一张高清照片都要几分钟,现场态势根本来不及送达指挥部。今年,这套设备已经投入到全国 31 个省份的一线防汛抗洪中,累计超过千余套。它让远方的指挥中心,第一次拥有了一双能抵达现场的「眼睛」。
视频链接:https://mp.weixin.qq.com/s/jBVInHGPdfZtFc79I6NBAQ
第二块是海量视频的存储。城市里的摄像头越来越多,4K、8K 设备不断普及,视频数据正在爆炸式增长。传统做法要完整保存每一帧画面,可大量监控画面长期「存而不用」,既吃存储空间,又难以按需调取。很多监控往往只能留存一周左右就得清空腾地方。
智传网(AI Flow)换了个思路:不再逐像素保存,而是把视频编码成精简的词元存下来,需要时再用生成式模型按需还原。
需要说明的是,传统视频压缩同样会利用前后帧的冗余,这不新鲜。智传网(AI Flow)的不同在于它进一步借助模型能力,把背景、人物、车辆、事件统一编码,因为固定机位的监控画面里,背景常年不变,系统就只留人和车这些真正动态的语义,而不是一帧帧去记录几乎没变的画面。
中国电信拥有全球最大的视联网,覆盖超过 1 亿路摄像头,正在规模化推广这项压缩存储技术。
效果是:在同等硬件条件下,存储空间可降低为传统方案的约 1/40,原本只能存一周的影像,如今能存下接近一整年。这项技术已在天翼视联的视联网上规模化落地,首批已有上千路摄像头接入。
第三块是隐私保护。在养老看护、校园防霸凌这类敏感场景里,人们既希望摄像头能及时发现危险,又不愿意自己的生活被赤裸裸地录下来、传上去。这是一对天然的矛盾。
视频链接:https://mp.weixin.qq.com/s/jBVInHGPdfZtFc79I6NBAQ
智传网(AI Flow)靠分层的语义词元流化解了它:在传输阶段就把敏感词元筛掉,让接收端能读懂「发生了什么」,却无法还原「看到了什么」。比如在养老场景中,系统能识别老人跌倒、挥手求助等异常行为并及时向后台报警,但原始影像无从恢复。用一句现场文案来说 ——「传的是词元,不是画面;认的是行为,不是人脸」。这套方案将在智云上海等平台上线,触达约 400 万终端用户。
从灾区到城市,从抢险到看护,这三块场景的共同点在于:智传网(AI Flow)关心的,已经不只是「传了多少数据」,而是「这些信息能不能帮人和机器把事情办成」。
通信,正在成为智能涌现的条件
从地铁里那通断断续续的电话,到灾区、深海和卫星轨道,智传网(AI Flow)在 WAIC 上讲的其实是一个关于「连接」的故事:那些因为带宽、距离和环境而被切断的连接,正在一条一条被接回来。
李学龙在演讲里说过一句让人印象很深的话:「智能的涌现,源于连接和交互。」他说,智人之所以繁衍壮大,靠的不是比尼安德特人更强壮的体格,而是语言和信息的交流互动,即连接让个体的聪明变成了集体的智慧。
AI 时代同样如此。大模型、智能体和机器人都不会孤立成长,只有当一个机器看到的世界能成为另一个机器的经验,当分散的感知与能力能够持续流动、融合,智能才可能真正涌现
七十多年前,香农用信息论教会人类如何把比特送得更远;今天,智传网(AI Flow)想回答的是另一个问题:当比特变成了词元,当连接无处不在,智能可以生长到多远?
值得玩味的是,AI 圈这些年一直在讲「压缩即智能」,即一个模型能把世界压缩得多好,某种程度上就代表它对世界理解得多深。智传网(AI Flow)把这句话反了过来:用智能去做压缩。它靠对世界的理解,把该传的意思拎出来、把冗余的比特扔掉,还在其分层网络架构中部署了一系列大小不同的家族式同源模型,希望实现基于连接与交互的智能涌现。压缩与智能,就此变成了一条真实跑在网络里的技术路径。
从这个意义上说,通信正在卸下「传输工具」的旧身份,成为智能得以涌现的条件本身。而智传网(AI Flow)所拓展的也不只是带宽的边界,更是智能能够抵达、连接与生长的边界。
热门跟贴