岗位职责
- 负责多模态大模型的架构设计、预训练策略优化和微调算法研究,包括但不限于LLM与视觉编码器的高效融合、跨模态注意力机制、对齐技术等
- 主导大模型分布式训练与优化,包括数据构建、训练加速、效果调优等,实现SOTA级别的模型性能
- 将多模态技术应用于实际业务场景,如视觉问答、图像/视频字幕生成、多模态对话、文档智能解析等
职位要求
- 深入理解Transformer、注意力机制、自监督学习等核心原理
- 熟悉CLIP、BLIP、LLaVA、MiniGPT-
- Qwen-VL等主流多模态模型架构,有相关项目经验
- 具备10B+参数规模模型训练经验,熟悉分布式训练框架(DeepSpeed/FSDP)
- 具备数据工程能力,熟悉大规模多模态数据挖掘与清洗
- 精通Python/PyTorch