岗位职责
- 负责云原生AI平台的研发工作,包括 模型训练和推理服务工作流的设计开发,模型训练引擎和推理引擎的建设;
- 负责大语言模型(LLM)、CV/搜广推/社区/客服等相关的通用CNN、RNN、NLP、多模态等模型的训练和推理效率提升, 解决规模增长带来的技术和业务问题;
- 参与AI基础设施资源管理,包括GPU/NPU/CPU、存储、网络等算力资源的调度能力建设,OSS/NAS/RBD等存储资源的管理等,持续提升资源利用率,为业务提供一个满足企业级稳定性和性能要求的AI平台;
- 编写相关业务、技术文档等。
职位要求
- 2027届毕业生,本科及以上学历,计算机类、软件类、通信类等相关专业优先;
- 具备扎实的计算机操作系统、网络、数据结构基础;熟悉Golang,Python等编程语言的一种或多种,编码风格良好;
- 熟悉PyTorch、Tensorflow等基础框架,具备AI模型训练和推理相关的基础知识,有相关项目开发经验者优先;
- 具备容器、Kubernetes、Kubeflow、Argo Workflow等基础知识,有相关项目开发经验者优先;
- CET4及以上,能够看懂技术相关的英文文档。 加分项:
- 有Llama系列、Qwen系列、DeepSeek系列以及其它开源/闭源大模型相关落地项目经验者优先;有StableDiffusion相关项目经验者优先;
- 熟悉Linux内核,有相关经验者优先。