岗位职责
- 分布式模型训练:深度参与B站搜推模型分布式训练框架的设计与演进,优化数据并行与模型并行策略,提升训练吞吐与稳定性,支撑千亿级稀疏参数的高效训练;
- 高并发在线推理:设计并优化支撑毫秒级延迟、高QPS的模型Serving架构,涉及计算图优化(XLA/图融合)、算子融合、模型量化及异步流水线调度,满足搜推实时打分需求;
- 超大Embedding存储与检索:突破千亿规模Embedding表的存储、分片(Sharding)、增量更新及高频检索的技术瓶颈,优化GPU显存管理与Host-Device数据搬运效率;
- GPU异构计算与Scaling:优化GPU多卡/多机训练与推理的横向扩展性,结合CUDA Kernel优化、TensorRT部署及编译优化技术,支撑超长用户行为序列(10K+)建模与模型参数持续Scaling Up;
- 下一代智能分发系统:参与构建面向大模型时代的智能内容分发架构,探索LLM与搜推系统的融合,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎。
职位要求
- 2027届应届毕业生,计算机相关专业本科及以上学历,具备扎实的C++/Python编程功底,熟悉Linux开发环境;
- 有GPU异构计算实践经验,熟悉CUDA编程、TensorRT部署或编译优化技术(TVM/XLA/算子融合)在模型推理加速中的应用;
- 有搜推模型训练或推理经验优先,了解PyTorch/TensorFlow等框架的底层机制,熟悉稀疏Embedding的分布式多级存储设计、超长行为序列建模、GPU多机多卡扩展与Scaling优化;
- 熟练使用AI agent能力者优先。