岗位职责
课题背景: 大规模搜索系统面临长序列建模、高计算开销与异构资源约束的挑战,传统稠密注意力模型在效率、存储及部署层面存在显著瓶颈,制约系统性能与扩展性。 课题挑战:
- 近线性注意力的语义保真:在实现O(n)的近似注意力计算时,需突破在长序列建模中的语义瓶颈,在降低计算负载的同时保持全局语义的建模能力,避免因近似计算导致的排序精度衰减。
- 多约束的联合压缩优化:结构化稀疏、动态路由与非均匀量化形成了包含离散与连续变量的混合优化空间,需在精度、效率、鲁棒性的多重约束下建立联合优化范式,实现多维压缩目标间的平衡。
- 异构算力的协同调度:混合硬件架构中,计算、通信、I/O等资源深度耦合。需建立统一的计算图分析与调度模型,突破异构分布式推理的性能边界,实现异构资源的性能突破。 具体工作:
- 高效推理注意力机制 研究并设计高性能注意力机制(线性注意力、稀疏注意力),针对搜索长序列短输出场景定制算子,将计算复杂度从 O(n^2) 降至 O(n) ,在保障排序精度的前提下显著提升推理吞吐与响应速度。
- 高精度结构化模型压缩 构建融合结构化稀疏、动态路由与非均匀量化的联合压缩范式,以排序指标为约束优化模型体量,实现计算与存储的协同压缩,确保轻量化后精度无损。
- 异构分布式推理架构 设计混合并行策略与通信原语融合机制,优化跨节点传输与动态调度能力,打通从算子内核到集群的全栈链路,挖掘异构资源潜力以触达系统性能边界。
职位要求
学历和专业要求: 计算机、人工智能、高性能计算或相关专业硕士及以上学历,博士优先。需具备扎实的深度学习理论基础,在高性能计算、编译器优化或大模型架构领域有深入研究背景。 技术技能要求: 精通PyTorch/TensorRT/vLLM等框架,熟练掌握CUDA编程与分布式训练推理技术。深入理解Transformer/SSM架构,拥有模型剪枝、量化及大规模搜索系统落地经验者优先。 软性素质要求: 具备极强的技术自驱力与系统架构思维,善于跨算法与系统工程边界协同攻关。拥有优秀的沟通协作能力,能在高并发、低延迟的生产环境下高效解决复杂工程难题。