岗位职责
- 面向电商客服场景,升级现有「离线 Caption + 在线 RAG」链路,研发多通道检索索引(视觉语义 / OCR 文本 / 结构化属性)与模态自适应路由,并构建多模态知识重要性图谱驱动的上下文压缩,解决细节问题检索不准与多轮长上下文知识遗忘。
- 研发视觉定位增强的图文回复生成能力,让 Agent 自主决定何时引用哪张图,并输出框选 / 圈选 / 箭头 / 高亮等空间标注,做到「说到哪、圈到哪」,同步优化标注必要性与图文一致性。
- 研发循环式 On-Policy 蒸馏的持续自进化训练体系,包括成功轨迹的分布级自蒸馏、能力缺口驱动的定向 Teacher 蒸馏与 Teacher 渐进退役,实现新品类与新话术快速习得、旧能力低衰减,把上线周期从周级压到天级。
- 负责上述能力的数据 pipeline、训练与评测闭环建设,推动在真实客服链路上做 A/B 验证并落地,同时沉淀论文与发明专利,与业界、学术界保持交流。
职位要求
- 计算机、人工智能、自然语言处理、多模态等相关专业的硕士生/博士生,有扎实的编程基础和独立的算法实现能力,熟练掌握 PyTorch;
- 熟悉多模态大模型(Qwen-VL / CLIP / SigLIP 等)与 RAG 技术栈,做过检索、视觉定位或图文交错生成中任一方向的实际项目者优先;
- 有大模型后训练实操经验,参与过 SFT、强化学习或知识蒸馏项目,理解分布对齐与灾难性遗忘问题者优先;
- 具备良好的逻辑分析与数理基础,能自己定义指标、搭评测集并从实验数据里找问题,在人工智能相关国际顶级会议/期刊发表过论文者优先。