岗位职责
● 基于CUDA/Triton/TileLang等技术,参与高性能算子(如Attention、GEMM等)的设计与实现,涵盖FP16/BF16/FP8/INT8等多精度类型
● 针对PyTorch训练与推理场景进行性能分析与优化,解决长序列Attention等典型痛点问题
● 借助Nsight Compute/Nsight Systems等工具,对算子进行精细化的性能剖析与调优
● 参与分布式并行(CP/DP)场景下的算子与通信协同优化
● 参与训练与推理引擎的底层性能优化工作,直面算子计算、显存管理、并行策略及执行链路等核心环节
任职要求
● 知名院校大学本科学历以上,来自计算机、电子工程、计算数学、工程优化等相关理工科专业
● 具备扎实的C++编程能力,对底层系统有天然的亲近感
● 对GPU编程模型(CUDA/Triton/TileLang之一)有基本了解,或愿意在短时间内系统性补齐
● 拥有算子开发或任意领域性能优化相关的课程项目/实习/个人实践经历
● 具备良好的工程习惯和问题拆解能力,遇到复杂问题时善于分层分析、逐步推进
● 表达清晰,乐于沟通,能够在技术讨论中把自己的思路讲明白
加分项
● ACM、编程竞赛获奖经历
● 有开源项目、技术博客或技术分享经历