✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!

事件

DeepSeek 宣布将面向英伟达 GPU 的全套算子工具链原样移植到华为昇腾 950 NPU 上。核心产品 TileLang 官宣原生支持昇腾,同时 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大计算与通信库也同步推出昇腾版本,直接对标英伟达平台的全套工具链。这是国产算力首次在核心算子工具层面做到与英伟达生态能力对标。

算子开发长期是 AI 底层门槛最高的工作。芯片理论算力虽高,若算子不达标,硬件利用率可能只有 20%。传统路径要么手写 CUDA 深度绑定英伟达,要么用厂商预制库缺乏灵活性,要么用 Triton 等高层编译器性能受限。TileLang 走第四条路:基于多级分块,开发者只需声明每块数据在哪里计算,编译器自动完成数据搬运与线程同步,性能直逼手写 CUDA。它复用 Apache TVM 编译能力,主攻 GEMM、FlashAttention、稀疏 MLA 等承载大模型 90% 以上计算量的算子。

官方基准显示,基于 TileLang 优化的 DeepSeek V3.2 稀疏注意力 TopK 算子比原生 PyTorch 快 2 至 20 倍,在 H100 上速度也大幅超越 PyTorch 原生实现。对国产芯片厂商和 AI 开发者而言,这意味着跨平台算子开发成本显著降低,国产算力生态自主性增强,大模型训练与推理成本有望进一步摊薄。

来源

本条目由采集管线自动抓取并发布,完整内容见下方来源链接。

*采集源:雷锋网*

📎 原始来源:雷锋网
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容