DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!
事件
DeepSeek 宣布将面向英伟达 GPU 的全套算子工具链原样移植到华为昇腾 950 NPU 上。核心产品 TileLang 官宣原生支持昇腾,同时 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大计算与通信库也同步推出昇腾版本,直接对标英伟达平台的全套工具链。这是国产算力首次在核心算子工具层面做到与英伟达生态能力对标。
算子开发长期是 AI 底层门槛最高的工作。芯片理论算力虽高,若算子不达标,硬件利用率可能只有 20%。传统路径要么手写 CUDA 深度绑定英伟达,要么用厂商预制库缺乏灵活性,要么用 Triton 等高层编译器性能受限。TileLang 走第四条路:基于多级分块,开发者只需声明每块数据在哪里计算,编译器自动完成数据搬运与线程同步,性能直逼手写 CUDA。它复用 Apache TVM 编译能力,主攻 GEMM、FlashAttention、稀疏 MLA 等承载大模型 90% 以上计算量的算子。
官方基准显示,基于 TileLang 优化的 DeepSeek V3.2 稀疏注意力 TopK 算子比原生 PyTorch 快 2 至 20 倍,在 H100 上速度也大幅超越 PyTorch 原生实现。对国产芯片厂商和 AI 开发者而言,这意味着跨平台算子开发成本显著降低,国产算力生态自主性增强,大模型训练与推理成本有望进一步摊薄。
来源
本条目由采集管线自动抓取并发布,完整内容见下方来源链接。
*采集源:雷锋网*