岗位职责
●基于开源 SOTA 模型提供企业内部的 LLM Serving API 并适配主流的工具(如 Claude Code)满足企业内部 AI Coding、AI Agent 等场景使用需求。
●基于 SGLang/vLLM 等主流的 LLM Serving 框架,构建并维护可扩展的推理服务基础设施,保障服务性能和稳定性,探索调度、分布式优化机会,追求单卡吞吐量最大化。
●基于内部场景建设 LLM 评估框架和 benchmark,快速评估不同开源模型的智能和性能。
●设计并实现 LLM 快速交付流水线,实现模型到生产环境上线的自动化交付。
●针对企业内部数据、低延迟场景(如代码补全)优化开源模型。
●跟踪最新模型进展,设计技术架构将模型应用到产品。
任职要求
●知名院校大学本科学历以上,计算机、人工智能或相关专业。
●拥有良好的代码开发习惯,熟练掌握Python, Golang, C/C++ 其中一种编程语言,拥有“代码整洁”意识,追求代码可读性与高维护性,遵循 Clean Code 原则优先。
●熟悉操作系统、计算机网络、数据结构和算法等基础知识。
●熟悉主流开源大模型推理框架。
●快速学习能力,能够独立思考和解决问题。
●对大模型和 AI 工具有强烈的好奇心。
●具备良好的团队合作精神和沟通能力。
加分项
●熟悉 LLM 模型原理,有模型部署、推理优化、PostTrain 实践经验。
●有 CUDA/Triton 算子开发、分布式推理策略优化、量化/稀疏化等模型 Efficiency 加速优化等经验。
●熟悉 Kubernetes,容器化技术。
●有自己精心维护、参与的 github 开源项目。
●熟练使用各种 AI 编码工具,同时保持优秀的代码质量。
●有端到端性能分析能力,可以正确理解性能表现的原理。
●在ACM/ICPC、NOI、Top Coder、Kaggle 等比赛中获奖。