岗位职责
- 负责一站式模型全生命周期管理平台的设计与搭建,涵盖从模型训练、评估、版本控制到在线部署、监控的完整闭环,提升模型研发与运维效率;
- 主导模型服务网关与资源调度体系建设,实现异构计算资源的自动调度、统一推理接口与高并发负载均衡,并建立全面的服务健康监测与自愈机制;
- 设计与实现模型自动化迭代工作流系统,集成自动触发评估、数据回流、策略比对与智能发布流程,推动模型在风控策略中形成数据驱动的持续优化闭环;
- 保障平台的高可用与可扩展性,设计并实施容灾、降级方案,支撑日均亿级任务稳定运行,并持续优化系统性能与资源利用率。
职位要求
- 本科及以上学历,计算机相关专业;
- 扎实的数据结构、设计模式与算法功底;追求高可用、可扩展、可观测的架构设计与优雅代码;
- 熟悉分布式系统常用组件与实践:数据存储、缓存机制、消息队列、批流一体/大数据处理;
- 了解并能应用Prompt Engineering、RAG、MCP、A2A、Agent架构等技术,具备将LLM落地到实际业务场景的能力,关注鲁棒性、成本与质量权衡;
- 编程语言不限,熟悉Golang或Python更佳,具备良好的代码质量与测试意识;
- 有良好的产品思维,能从业务目标出发主动思考产品与技术方案。 加分项:
- 机器学习/大模型训练与推理/评测相关经验;
- 有构建Multi-Agent系统、工具市场/MCP或策略平台的经验;
- 有团队管理或技术带队经验,能规划路线图并落地复杂项目。