Import AI 464:Fable编写GPU内核,并讨论AI自动化与模拟计算
Fable在KernelBench-Mega上用CUDA写出megakernel,于RTX PRO 6000 Blackwell相对优化后的PyTorch基线达到18.71X加速,高于写Triton的Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和GPT 5.5(4.34X),且每个解码token只启动一次协作式kernel。
Fable在KernelBench-Mega上用CUDA写出megakernel,于RTX PRO 6000 Blackwell相对优化后的PyTorch基线达到18.71X加速,高于写Triton的Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和GPT 5.5(4.34X),且每个解码token只启动一次协作式kernel。