职位描述
负责基座大模型训练数据平台的架构设计与核心研发,建设覆盖预训练、后训练等场景的数据处理、存储管理和数据交付能力,以高质量数据基础设施支撑模型能力持续突破。
面向海量、多模态训练数据,设计并优化分布式计算与存储体系,解决超大规模数据处理中的性能、稳定性、扩展性和成本效率等关键挑战。
建设统一、高效的数据开发与管理平台,完善数据版本、元数据、血缘、质量、权限及审计等能力,支持算法团队完成从数据开发、实验分析到规模化生产的全链路迭代。
与数据算法及模型训练团队紧密协作,参与核心数据处理算子的研发和工程化落地,通过平台能力与数据生产效率的持续提升,加速数据策略验证和基座模型迭代。
岗位职责
● 负责基座大模型训练数据平台的架构设计与核心研发,建设覆盖预训练、后训练等场景的数据处理、存储管理和数据交付能力。
● 面向海量、多模态训练数据,设计并优化分布式计算与存储体系,解决超大规模数据处理中的性能、稳定性、扩展性和成本效率等关键挑战。
● 建设统一、高效的数据开发与管理平台,完善数据版本、元数据、血缘、质量、权限及审计等能力。
● 支持算法团队完成从数据开发、实验分析到规模化生产的全链路迭代。
● 与数据算法及模型训练团队紧密协作,参与核心数据处理算子的研发和工程化落地。
● 通过平台能力与数据生产效率的持续提升,加速数据策略验证和基座模型迭代。
任职要求
● 知名院校大学本科学历以上,计算机或相关专业,具备扎实的系统设计和工程能力。
● 熟练掌握 Java、Go、C++、Python 等至少一门编程语言。
● 具备大规模数据处理系统研发经验,熟悉 Spark、Flink、Ray 等一种或多种分布式计算框架,对任务调度、容错和性能优化有深入理解。
● 熟悉分布式存储、对象存储或数据湖相关技术,对数据组织、元数据管理、数据版本和海量数据读写优化有较深入的实践经验。
● 具备数据平台、机器学习平台或 AI 基础设施建设经验,能够兼顾底层系统性能、平台易用性与算法研发效率。
● 具备良好的复杂问题分析和跨团队协作能力。
加分项
● 有大模型训练数据、多模态数据或超大规模数据处理平台经验者优先。
● 有数据治理或数据安全相关经验者优先。
● 有开源项目贡献或技术社区活跃者优先。