岗位职责
面向长文档理解、企业知识库问答、代码分析和多轮 Agent 等长上下文大模型应用,研究跨地域 P-D 分离推理服务优化机制。 岗位聚焦 Prefill 计算密集、Decode 低延迟敏感以及 KV Cache 跨地域传输等核心问题,探索在多地域基础设施中对 Prefill 与 Decode 进行解耦部署、协同调度和网络优化,提升长上下文推理的首 token 延迟、GPU 利用率、服务成本和用户体验。
职位要求
- 精通计算机网络和网络编程;
- 精通至少一门主流编程语言,比如 C/C++, Python, Go 等;
- 熟悉当前高性能智算系统领域的最新进展,包括 RDMA,拥塞控制,集合通信,训练推理框架等技术;
- 有自驱力,对智算场景新兴技术有主动学习和应用的热情;善于攻坚克难,有创新热情,积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破;
- 有较好的执行能力和沟通能力,需要与团队内外部同事融洽合作。