职位描述
1. 负责分布式存储集群部署与运维,支撑大数据、AI 训练推理等业务,保障高吞吐、低时延、低抖动、高可用稳定运行;
2. 负责存储系统故障治理、瓶颈分析、性能调优,定位和解决IO抖动、长尾时延、性能瓶颈等问题;
3. 负责存储运维体系建设,建立日志审计、故障预案、容灾备份机制,推动存储运维自动化、标准化。
职位要求
1. 国内或海外知名院校本科及以上,计算机、网络、软件工程等相关专业;
2. 具备 3-10 年头部互联网/云计算/AI公司分布式存储研发&运维工作经验;
3. 精通 Linux 内核、文件系统底层原理;熟悉分布式文件系统一致性、元数据管理、failover等核心原理;
4. 理解大模型训练推理及对存储的核心需求,熟悉 KV Cache、GDS/GDR,具备 SPDK、RDMA 深度实战经验者优先;
5. 具备海量数据及高并发场景的问题定位与优化能力,熟悉 K8s 容器存储、CSI 存储插件、云原生存储架构者优先。