Featured image of post Kog押注GPU底层优化:用软件把大模型推理再榨快一档

Kog押注GPU底层优化:用软件把大模型推理再榨快一档

法国初创公司试图用软件释放现有GPU推理性能。

一场围绕“现有GPU”的推理竞赛

一场围绕“现有GPU”的推理竞赛
一场围绕“现有GPU”的推理竞赛|新闻截图

法国初创公司Kog正在试图证明一件事:AI推理不一定要依赖专用芯片,企业已经部署的数据中心GPU,仍有大量性能可以通过软件优化释放出来。随着大模型应用从聊天走向代码生成、自动化任务和“智能体”工作流,推理速度与成本成为瓶颈。所谓推理,是指模型在训练完成后根据输入生成输出;对用户而言,它直接决定等待时间和服务成本。

今年5月,Cerebras凭借面向AI推理的专用芯片在IPO首秀中获得市场欢迎,显示资本市场看好“为AI重新设计硬件”的路线。但Kog选择了另一条路:不先更换硬件,而是深入GPU底层,通过Kog Inference Engine(KIE)让标准数据中心GPU跑得更快。其技术预览曾登上Hacker News首页,演示目标是证明在企业已有的AMD MI300X、英伟达H200等GPU上,也能实现极快的单请求解码。

从小模型演示到大模型承诺

Kog最吸引眼球的数据,是在演示中实现了每个请求每秒约3000个token的生成速度。token可理解为模型处理文本的基本片段,速度越高,输出越快。不过,这一结果来自约20亿参数、为该目标定制的小模型Laneformer 2B;该模型目前已开源。Kog对外提出的更大愿景,是实现“大语言模型推理快30倍”,但公司也承认,要从小模型跨到主流大模型,还需要完成关键验证。

目前可确认的关键事实包括:

  • 演示使用的是标准数据中心GPU,包括AMD MI300X和Nvidia H200;
  • 技术预览实现约3000 TPS的单请求生成速度;
  • 演示模型为约2B参数的Laneformer 2B;
  • 公司团队规模为11人
  • CEO预计在9月完成首个主要模型的10倍加速实现,并以此推动客户验证和A轮融资。

Kog创始人兼CEO Gaël Delalleau称,技术预览带来了约200条“实质性商业线索”。他判断,软件工程会是最早落地的场景之一。原因并不难理解:代码智能体常需要长时间运行复杂任务,资深Claude Code用户也知道,有时等待结果可能以小时计;Anthropic自身也通过Claude的Fast Mode收取更高价格,说明“更快响应”已具备明确商业价值。

需求变化迫使Kog“做大”

需求变化迫使Kog“做大”
需求变化迫使Kog“做大”|新闻截图

Kog最初观察到的市场反馈,也改变了公司的技术优先级。Delalleau表示,潜在客户并没有准备好去微调小模型。微调是指在已有模型基础上用特定数据继续训练,以适配某类任务;它需要数据、工程能力和额外成本。因此,自发布以来,Kog把重心转向加速更大模型,以匹配企业真实需求。

这也让Kog面临更高门槛。大模型推理的挑战不仅在计算量,还在显存容量、内存带宽和数据搬运效率。Delalleau反驳了“GPU不适合解码”的怀疑,认为这已经成为一种误解;新一代GPU拥有越来越高的内存带宽,关键在于能否被软件充分利用。这里的“解码”是大模型逐步生成下一个token的过程,常常无法像训练那样完全并行化,因此优化空间与难度并存。

Kog并非唯一押注软件优化的公司。法国另一家公司ZML发布了不依赖特定硬件的软件,绕开英伟达CUDA,以支持不同芯片上的高速推理。CUDA是英伟达GPU生态中最核心的并行计算平台。Delalleau则认为,Kog更接近斯坦福大学Hazy Research实验室的路线:不是只做上层框架适配,而是更深地研究GPU加速机制。

“黑客式”工程路线的优势与代价

Kog的技术路径与Delalleau的背景有关。他曾在法国巴黎综合理工学院学习固态物理,后来从事进攻性网络安全,也就是白帽黑客工作,并曾四次进入DEFCON CTF决赛。他称,物理训练带来理解“GPU规律”的思维,而安全攻防训练则强调从汇编语言、二进制代码等低层次反向理解系统,并尝试让系统完成原本未必为之设计的目标。

这种方法的优势是足够深入,有机会挖出通用软件栈难以触及的性能;代价则是非常耗时。Delalleau表示,对每一款新GPU,团队都要投入数周甚至数月研究硬件细节并进行GPU工程研究。以11人的团队规模看,Kog短期内能覆盖的芯片数量必然有限。

长期来看,Kog希望把方法沉淀进基于智能体的流水线,从而支持更多芯片和模型。欧洲正在寻求在AI模型与计算基础设施上建立自主能力,这可能给Kog带来“主权AI”方面的顺风。公司已获得Scaleway支持,并得到法国Bpifrance和French Tech 2030项目支持;其种子轮由Varsity VC等共同领投,Varsity VC的Kamel Zeroual曾是Delalleau上一家创业公司Stribe的联合创始人。

行业点评:GPU路线仍有窗口,但证明题刚开始

Kog的故事说明,AI推理竞争并不只有“买更贵、更专用的芯片”一条路。对已经拥有GPU集群的企业来说,如果软件能显著提升吞吐和响应速度,投资回报会非常直接。不过,Kog目前最关键的不是小模型演示有多亮眼,而是能否在主流大模型上复现足够高的加速,并把低层优化转化为稳定、可维护、可销售的产品。

接下来几个月将是验证窗口:如果Kog能按计划在首个主要模型上展示10倍级加速,它将更有说服力地进入企业采购和融资谈判;如果无法跨过大模型门槛,30倍推理加速仍会停留在愿景层面。无论结果如何,Kog代表的方向值得关注:在专用AI芯片之外,GPU的软件栈仍可能是下一阶段推理效率竞争的主战场。