Event Tensor: 编译动态Megakernel的统一抽象

Lobsters AI 2026-06-23T09:13:53.658489

Event Tensor: 编译动态Megakernel的统一抽象

现代GPU工作负载,尤其是大语言模型(LLM)推理,受限于内核启动开销和粗粒度同步,这些因素限制了内核间的并行性。最近的megakernel技术将多个算子融合到单个持久化内核中,以消除启动间隙并暴露内核间并行性,但在处理实际工作负载中的动态形状和数据依赖计算时面临困难。我们提出Event Tensor,一种用于动态megakernel的统一编译器抽象。Event Tensor对分块任务之间的依赖关系进行编码,并为一等公民支持形状和数据依赖的动态性提供了可能。基于这一抽象,我们的Event Tensor Compiler(ETC)应用静态和动态调度变换,生成高性能持久化内核。评估表明,ETC在显著降低系统预热开销的同时,实现了最先进的LLM服务延迟。

查看原文