多DSL横向对比,建立算子开发本质认知:不局限于单一工具,系统对比九齿、Triton、TileLang三种DSL的设计理念与核心编程范式。我们不讲"哪个最好",而是讲"面对什么平台、什么问题该选什么"——让学员真正理解算子开发的本质,建立跨工具、跨平台的迁移能力,而不是只会套用某一种语法。
聚焦异构适配,发挥DSL跨平台快速验证优势:DSL能够实现在异构计算平台上快速验证、快速适配算子。本课程依托九源软件栈与沐曦GPU、MXMACA软件栈的联合生态,让学员亲身体验不同DSL在国产异构平台上的适配效率,抢占国产算力时代跨平台算子开发的人才先机。
AI Agent赋能开发,探索算子开发新范式:AI Agent辅助算子开发的课程,从算子代码生成、正确性验证到性能优化、调试排错的完整实践案例讲解。学员将亲手体验通过Agent提升算子开发效率,理解人机协作的最佳实践与边界,走在算子开发方法论的前沿。
真实算力支持,免费使用国产GPU环境:为解决学员实战算力不足的痛点,所有学员均可领取沐曦官方提供的GPU算力券,在课程中全程免费使用沐曦C系列的云GPU环境,无需自行购置硬件即可完成所有算子开发与适配实验。
有GPU编程基础的开发者: 参加过TileLang训练营、InfiniTensor大模型与人工智能系统训练营,想系统学习多种DSL、掌握异构平台算子适配能力的开发者;
AI系统/Infra工程师: 从事大模型推理、训练框架或AI编译器相关工作,想深入底层算子开发,建立跨平台、跨工具的全栈算子开发能力的工程师;
高校计算机相关专业师生: 想补全AI底层系统能力,积累国产GPU算子开发的硬核项目经历,为科研、竞赛、求职增加竞争力的同学;
国产算力生态从业者与技术爱好者: 想切入九源/沐曦MXMACA国产算力生态,参与国产异构平台算子适配与编译生态建设,在国产算力浪潮中占据技术高地的技术爱好者。
https://www.gitlink.org.cn/ccf-ai-infra/gollamago
https://developer.metax-tech.com/activities/30
建立全局视野:理解九源软件栈与沐曦GPU、MXMACA软件栈的设计理念、各层组件定位与开源生态路线图,建立对国产异构算力平台的全局认知
掌握多DSL开发与选型:系统掌握九齿、Triton、TileLang三种DSL的核心编程范式,理解各自设计理念与适用场景,能根据硬件平台和算子特点选择最合适的开发工具
攻克复杂算子实现:理解GEMM、FlashAttention等典型复杂算子,建立复杂算子的分析与实现思维;
掌握性能分析工具链:学会使用McProfiling等性能分析工具定位算子瓶颈,理解不同GPU架构下的优化方法差异,具备基础的性能调优能力
体验AI Agent辅助开发:体验Agent在算子代码生成、验证、优化、调试中的应用,理解与 AI 协作的最佳实践与边界
完成异构适配实战:在国产GPU上完成多DSL算子开发与适配的完整项目,产出可对比、可验证的实战成果
推荐学习周期:约3周
课程与学习任务日历:
| 课程名称 | 课程概要 | 完成时间 |
|---|---|---|
| 第一课: 九源软件栈核心技术与开源生态 | 系统性介绍九源软件栈的设计理念、各层组件的作用、开源生态现状及路线图;包括InfiniLM推理框架的整体介绍和PD分离(Prefill-Decode分离)的实现讲解,建立对国产统一计算架构的全局认知。 | 9月13日 |
| 第二课: MXMACA软件栈整体架构与开源生态 | 详细拆解MXMACA各层的功能与定位——从驱动、运行时到编程框架、算子库,以及沐曦开源生态现状与路线图。理解在沐曦GPU上进行算子开发的完整软件栈支撑。 | 9月13日 |
| 实战任务: | 1. 领取沐曦GPU算力券,完成算力卡时的兑换 2. 运行MXMACA示例代码,熟悉沐曦GPU开发环境与 mx-smi等基础工具 | 9月14日 |
| 第三课: 九齿的设计思想与核心编程范式 | 系统介绍九齿的设计思想与核心编程范式,并横向对比九齿、Triton、TileLang三种DSL的设计理念和使用场景。重点理解DSL在异构计算平台上快速验证算子、完成硬件适配的核心特性与编程范式。 | 9月15日 |
| 第四课: TileLang——以Tile编程为核心的高性能AI编译生态系统 | 系统介绍TileLang开源tile编程语言及其背后的高性能AI编译生态。讲解tile级编程思维如何帮助开发者更精准地控制硬件计算资源,掌握基础算子的TileLang实现。 | 9月15日 |
| 实战任务: | 1. 用九齿实现一个基础算子(如向量加法或ReLU),体会DSL的编程体验与开发效率 2. 搭建TileLang开发环境,运行官方示例 3. 用TileLang实现一个基础算子,体会tile级编程与传统GPU编程的差异 | 9月17日 |
| 第五课: 基于九齿的复杂算子实现案例 | 深入讲解GEMM算子的计算本质、性能特点与实现方法;剖析Attention机制的计算特点、FlashAttention的算法原理和完整实现流程。通过两个最核心的大模型算子,建立复杂算子的分析与实现思维。 | 9月17日 |
| 第六课: 基于TileLang的复杂算子实现 | 分享Tile级算子开发的完整案例,基于TileLang完成典型算子的开发,建立Tile级思维——如何从硬件的tile结构出发设计算子,实现更高效的计算与访存控制。 | 9月17日 |
| 第七课: 用McProfiling优化MetaX算子的全链路详解 | 讲解在MetaX上的核心优化策略与工具链,用McProfiling分析MACA算子性能的全链路。理解如何通过性能分析工具定位瓶颈。 | 9月17日 |
| 实战任务: | 1. 基于九齿实现GEMM算子,完成可运行版本并记录基线性能数据 2. 用TileLang实现一个复杂算子(如Softmax或LayerNorm) 3. 对比TileLang与九齿在同一算子上的实现差异、性能差异与开发效率 | 9月22日 |
| 第八讲: 基于AI Agent实现算子的编写、验证与优化 | 分享构建AI智能体辅助算子开发的完整实践——从算子代码生成、正确性验证到性能优化建议、调试排错。探索AI如何提升算子开发效率,以及人机协作的最佳实践与边界,走在算子开发方法论的前沿。 | 9月22日 |
| 实战任务: | 1. 使用AI Agent辅助完成一个算子的开发、验证或优化 2. 总结AI辅助算子开发的优势与局限,形成实践笔记 | 9月24日 |
| 项目阶段 | 在go-llama-go仓库里用九齿/Tilelang/MACA C++(选择其中2个)实现并优化至少 2 个算子,集成到 Llama 推理中,仓库地址:https://www.gitlink.org.cn/ccf-ai-infra/gollamago | 10月18日 |