为什么同样用 Copilot 写代码,有人断网也能补全,有人却要等云端转圈?答案可能藏在一个数字里:每秒 63 个词元。这是微软在旧金山发布会上给出的本地推理实测吞吐量,跑在 Surface Laptop Ultra 上。
太平洋时间 10 月 7 日上午 10 点,微软宣布 GitHub Copilot 将在本月底前支持本地 AI 模型推理。开发者可以在云端模型与设备端模型之间自动或手动切换,不再只有云端一条路。
从云端独占到双轨切换
GitHub Copilot 是微软推出的 AI 编程助手,可集成于 Visual Studio Code、CLI 等工具,根据代码上下文生成补全、解释或重构建议。目前它依赖云端托管模型,由协调器根据性能、成本与准确性路由请求。
本月底扩展后,Copilot 能自动选择云端模型与本地 AI 模型,后台协调推理任务。微软给用户两种模式:自动编排,或强制使用设备端模型。偏好可在 GitHub Copilot CLI、Copilot 应用与 Visual Studio Code 中设置。
本地模型的选择也不是黑盒。开发者可以指定提供程序、模型或端点,通过 Windows ML 选择 MAI Code 1.1 Flash,或者连接 OpenAI 兼容的本地端点并选用其暴露的模型。
1370亿参数,只激活68亿
支撑本地推理的是微软新推出的 MAI Code 1.1 Flash“混合专家”模型。它的总参数达到 1370 亿,但活跃参数只有 68 亿——采用量化与推测解码技术优化响应速度与内存占用。
实测数据来自 Surface Laptop Ultra。复杂任务中的峰值内存使用率、Token 利用率与处理速度均显著提升。解码吞吐量测试显示,提示长度从 2K 到 256K Token 时,吞吐介于每秒 40 至 63 个词元。
把模型放到设备端,意味着推理不再完全依赖网络往返。对开发者来说,切换的主动权第一次交到了自己手里:什么时候用云、什么时候用本地,可以按场景决定。
热门跟贴