GPTProto

Inside the megakernel serving engine for North Mini Code

Cohere Labs:官方研究博客·Sep 8, 2026, 12:00 AM·Tutorials

Cohere 发布为 North Mini Code 构建的围绕 decode megakernel 的推理引擎,BF16 下单张 H100 端到端解码吞吐比 vLLM 快 1.25–1.41 倍,batch size 1 时达 292 tok/s(SoL 的 62%),代码已在 GitHub 开放。