课程介绍:
本实战营采用循序渐进的设计:先在CPU上用220行代码跑通最小Transformer,理解核心原理;再迁移到沐曦C500国产GPU,完成大规模数据集训练;随后扩展到Decoder-Only架构与KV Cache;再深入推理性能测试与工业级推理框架;最后体验MACA C++、Triton、TileLang三种方式的算子开发与性能对比。真实的国产GPU实验环境,加上系统的适配实践课程,让学员通过21天打卡学习,实现在国产GPU上,手搓大模型的项目成果。
开源课程地址:
gitlink.org.cn/ccf-ai-infra/Transformer-on-Metax
第一课:从 0 到 1 跑通你的第一个 Transformer
课程详情:
Transformer 到底在“注意”什么?本课从 RNN 的局限讲起,带你理解 Attention 如何改变序列建模。通过约 220 行 Python 代码,亲手拆解词表、Embedding、位置编码、Attention、Mask 和训练循环。
实验环境:
CPU(个人电脑),Python + Pytorch
实验任务:
通过 20 组中英词汇组成的极小数据集,观察训练损失下降,完成从代码运行、数据修改到 Attention 数值验证的最小闭环。
课程PPT:
第一课ppt-沐曦.pptx
课程视频: