岗位职责
- 配合算法工程师,推动大模型相关算法的落地,打造高吞吐、低延迟的推理系统,在产品上实现快与准的交互体验;
- 探索面向高并发场景下(千万量级)的高性能推理服务架构,针对NVIDIA GPU、NPU等国产算力进行性能调优,包括算子融合、显存管理、计算图编译优化、Batching、KVCache管理,打造高效的推理服务架构,结合LLM能力实现业务的高效运转;
- 持续跟进业界最新Infra技术,如高效通信库、量化、稀疏蒸馏等训练部署方案,配合实际业务进行技术预研;
- 结合推理引擎和业务服务,优化动态流量调度、资源管理等结合业务实际情况的后台策略。
职位要求
- 具备扎实的编程语言基础,掌握 C++/Python/Golang 至少一门语言,熟悉Linux开发环境;
- 有vllm/sglang/Tensorrt-llm/FasterTransformer等大模型推理框架的实际使用经验;
- 熟悉CPU/GPU异构加速瓶颈分析方法,有服务器端/手机端AI芯片、GPU加速经验优先;
- 熟悉常用推理加速方法,有超大模型分布式部署经验优先。