company logo
#2650
超算集群研发工程师
AI超算集群研发
北京
上海
深圳
杭州
工程-开发
岗位职责 ● 设计并实现大规模异构计算资源的调度系统,解决CPU/GPU/NPU等计算资源的抽象、池化与拓扑感知调度,优化调度算法以平衡任务吞吐、排队延迟和资源利用率。 ● 开发集群管理系统,覆盖任务和节点生命周期管理、日志采集和召回、关键性能数据收集与可视化、故障发现与自动容灾,以及新硬件、新软件栈的导入与适配。 ● 从集群视角进行端到端系统性能调优,覆盖CPU/GPU/NPU计算任务优化、Linux内核、I/O和网络协议栈等,构建集群可观测性体系,主导大规模训练下的故障诊断、性能回归和全链路排障。 ● 分析大规模并行系统中的性能抖动、长尾延迟以及性能不均等系统性瓶颈,支撑所有同事更高效地使用集群。 ● 参与AI超算集群网络的拓扑设计、路由策略、多路径负载均衡和拥塞控制,深入研究RDMA(RoCEv2 / InfiniBand)协议栈,与通信算子、存储团队配合,提供来自高性能网络的最优底层支撑。 ● 参与新一代超算集群的架构规划与建设,探索和评估GPU、国产AI加速器、网卡以及新兴硬件,与IDC数据中心团队配合,以集群架构需求驱动数据中心的规划、建设与交付。 任职要求 ● 知名院校大学本科学历以上,计算机科学、电子工程或相关专业。 ● 扎实的计算机体系结构基础:深刻理解计算机组成、操作系统、计算机网络等核心原理,能够从硬件微架构、访存子系统到片上和网络互联架构系统性思考。 ● 熟悉C/C++/Rust/Python之一,具备优秀的设计能力、极强的动手和工程能力以及代码质量意识。 ● 对分布式系统有深刻理解与实践经验,如熟悉分布式任务调度与资源编排,或能设计高性能、高可用的系统架构。 ● 对性能优化有较高热情,发自内心地想要跑满所有计算资源,榨干每一份算力。 ● 良好的中文沟通能力和团队协作能力。 加分项 ● 熟悉容器运行时(cgroup、namespace等)与容器编排系统(Kubernetes等)的底层实现原理,理解资源隔离、调度(sched_ext)与QoS等机制。 ● 精通RDMA编程及RoCEv2/InfiniBand网络架构,深入理解拥塞控制、多路径、自适应路由等机制,具备大规模RDMA网络排障与调优经验。 ● 有HPC和超算全机规模应用经验,熟悉并行编程范式,或有超大规模集群组网设计、部署建设、调优经验。
Contact Our Consultant
Chloe Chang
wechat