岗位职责
- 参与公司AI中台整体架构规划与设计,根据公司数字化转型战略,搭建统一的机器学习平台,覆盖数据接入、特征工程、模型训练、模型评估、模型部署、在线推理、监控告警等全生命周期管理;
- 负责公司级MLOps体系建设,构建标准化的模型持续集成/持续部署(CI/CD for ML)流水线,实现模型版本管理、自动化测试、灰度发布和回滚机制,将模型从实验到上线的周期从"周级"缩短到"天级";
- 负责搭建统一特征存储与服务层(特征平台),支持离线/在线特征的一致管理和高效复用,解决特征重复计算和数据孤岛问题;
- 负责建设高性能、高可用的模型推理服务网关,支持多框架模型(TensorFlow/PyTorch/ONNX等)的统一部署、弹性扩缩容和流量管理;
- 开发面向算法工程师的自助化工具链,包括Notebook环境、实验追踪、超参搜索、数据标注管理等,降低全公司算法开发门槛;
- 评估和引入开源及商业化AI基础设施组件(如MLflow、Kubeflow、KServe、Feast等),结合实际业务需求做适配和二次开发;
- 深入理解各业务线(研发、制造、供应链、营销等)的AI应用需求,将业务场景抽象为可复用的平台能力,推动AI能力在全公司范围内的规模化落地;
- 建设大模型(LLM)相关基础设施,包括模型微调平台、向量数据库、RAG工程化、GPU资源调度等,支撑公司级大模型应用的快速开发与部署;
- 建立平台运行监控与分析机制,定期输出平台运行状况、资源利用率、模型服务SLA等运营报告,推动平台持续优化;
- 沉淀AI平台技术文档与方法论,开展技术分享与培训,赋能各业务域算法团队高效使用平台能力;
- 完成领导交办的其他工作。
职位要求
- 硕士及以上学历,计算机科学、软件工程、人工智能、数学等相关专业,具有3年以上AI/ML平台工程、MLOps或算法工程化相关工作经验;
- 精通Python,熟悉Go或Java至少一门后端语言,具备扎实的软件工程素养(代码规范、测试、Code Review);
- 熟悉主流ML平台组件(MLflow/Kubeflow/Airflow/Feast/KServe等),有实际搭建和使用经验;
- 熟练使用Docker和Kubernetes,具备模型服务化部署经验(Triton/TorchServe/TensorFlow Serving等);
- 熟悉Spark/Flink等大数据处理框架,了解数据湖/数据仓库架构,具备大规模数据处理能力;
- 具备良好的分布式系统设计能力,理解高可用、弹性伸缩、监控告警等工程实践;
- 有从0到1搭建AI平台或MLOps体系的完整经验者优先;熟悉大模型基础设施(模型微调、向量数据库、RAG、GPU调度)者优先;有模型推理优化经验(量化、剪枝、TensorRT、ONNX Runtime)者优先;
- 具备系统性思维与全局规划能力,能够在复杂的组织环境中识别技术机会并推动落地;
- 具备良好的跨部门沟通与协调能力,能有效对接业务、算法、数据、运维等多方团队;
- 有较强的文字表达与文档编制能力,能规范输出技术架构文档、平台使用手册与运营报告;
- 结果导向强,执行力高,能够在压力下高效推进平台建设工作,对前沿AI Infra趋势保持持续关注与学习热情。