AI推理速度的竞争正在白热化,美国芯片公司Cerebras在5月IPO首日便获得市场热烈追捧,其专用芯片备受青睐。然而,法国初创公司Kog却持不同观点:传统GPU中仍有大量潜力等待挖掘,无需更换硬件。 该公司于今年5月登上Hacker News首页,其技术演示旨在证明一个观点——企业现有的标准数据中心GPU(如AMD MI300X和NVIDIA H200)上,可以实现“极速单请求解码”。这一成果让部分人失望,因为演示并未涉及笔记本电脑中的GPU,但另一些人看到了巨大商机。如今推理速度和成本已成为关键瓶颈,Kog通过软件优化在现有硬件上解锁新能力的承诺,吸引了大量关注者。“我们获得了200个切实的商业线索。”CEO Gaël Delalleau告诉TechCrunch。 基于早期反馈,这位独立创始人预计软件工程将成为首个应用场景。资深Claude Code用户深知,有时需要等待数小时才能获得结果。Anthropic自身也清楚速度即金钱,对Claude的快速模式收取数倍溢价。Kog希望通过显著缩短等待时间,吸引那些依赖AI工作流完成专业任务、却苦于延迟的客户。 此外,Kog还拥有设计合作伙伴,他们通过提示词生成游戏和应用,Delalleau表示,依托Kog推理引擎(KIE)获得的更快输出,将直接转化为更多收入。不过该公司也意识到市场尚未完全成熟。在观察需求时Kog发现,潜在客户不愿对小型模型进行微调。“正因如此,自发布以来我们全力聚焦于加速大型模型的开发,以满足我们看到的市场需求。” Kog要实现“30倍更快LLM推理”的承诺,仍有巨大跨越。其演示中展示的每秒3000次请求处理速度令人印象深刻,但从demo到大规模商用,这家初创公司还有很长的路要走。
打开网易新闻 查看精彩图片
热门跟贴