岗位职责
大规模搜索系统面临长序列建模、高计算开销与异构资源约束的挑战,传统稠密注意力模型在效率、存储及部署层面存在显著瓶颈,制约系统性能与扩展性
- 高效推理注意力机制 研究并设计高性能注意力机制(线性注意力、稀疏注意力),针对搜索长序列短输出场景定制算子,将计算复杂度从 O(n^2) 降至 O(n) ,在保障排序精度的前提下显著提升推理吞吐与响应速度
- 高精度结构化模型压缩 构建融合结构化稀疏、动态路由与非均匀量化的联合压缩范式,以排序指标为约束优化模型体量,实现计算与存储的协同压缩,确保轻量化后精度无损
- 异构分布式推理架构 设计混合并行策略与通信原语融合机制,优化跨节点传输与动态调度能力,打通从算子内核到集群的全栈链路,挖掘异构资源潜力以触达系统性能边界
职位要求
- 计算机、人工智能、高性能计算或相关专业硕士/博士同学,需具备扎实的深度学习理论基础,在高性能计算、编译器优化或大模型架构领域有深入研究背景;
- 精通PyTorch/TensorRT等框架,熟练掌握CUDA编程与分布式训练推理技术,深入理解Transformer/SSM架构,拥有模型剪枝、量化及大规模搜索系统落地经验者优先;
- 具备极强的技术追求与系统架构思维,善于跨算法与系统工程边界协同攻关,拥有优秀的沟通协作能力,能在高并发、低延迟的生产环境下高效解决复杂工程难题。