岗位职责
- 参与AML火山方舟推理千亿级TPM流量调度核心架构的开发、优化与迭代,共同打造国内领先的AI MaaS平台;
- 在公有云&云原生(Kubernetes)环境下,深入设计和实现大模型推理服务的关键子系统;
- 探索并实现智能流量路由、精细化服务治理策略,保障平台在超大规模负载下的超高可用性(
- 99%+)与极致性能;
- 持续优化平台在资源调度效率、服务稳定性、成本效益等方面的表现;
- 与团队一起攻克大规模分布式系统带来的复杂挑战,确保平台能够弹性扩展,支撑业务的飞速增长。
职位要求
- 计算机科学、软件工程或相关专业本科及以上学历;
- 熟悉Golang/C/C++/Python/Java(至少一种),熟悉Linux开发环境;
- 对计算机基础(数据结构、算法、网络、操作系统)有良好理解;
- 强烈的求知欲和解决复杂技术问题的热情,渴望在大型分布式系统领域深耕。 加分项
- 有大规模分布式系统相关项目经验;
- 熟悉Service Mesh,有服务治理、流量管理相关实践经验;
- 熟悉云原生技术栈(Kubernetes,Docker,服务网格),有编排调度、流量管理相关实践经验;
- 对公有云技术(AWS/Aliyun/火山引擎等)的存储、网络、安全、产品化有了解或实践经验;
- 接触过大模型推理服务部署、优化或相关框架(如vLLM,Triton Inference Server)。