岗位职责
专注于Model-as-Agent后训练,并重点从以下技术方向进行深入研究:
- Tool - 幻觉抑制及知识信息的精准生成。核心解决Extrinsic hallucination:例如模型调用外部工具(数据库查询、Web 检索、RAG等)时产生错误查询、误解释或忽略结果。
- Model - Model as Agent的能力增强。构建Agent训练数据 + 沙盒环境 + API工具集 + Verifier的完整数据训练方案,解决Agent后训练中奖励稀疏和信用合理分配的问题。
- Scaling - 在test time阶段通解决模型agent推理时学习增强的scaling问题,解决长上下文、长期状态管理记忆等关键问题。
职位要求
- 具备大模型相关领域的研发经验,熟悉Qwen等主流大模型架构、具备丰富的模型训练优化经验及LLM Agent、Agent RL等大模型训练技术。
- NLP/多模态/ML相关专业背景,博士在读,具有扎实的机器学习或大模型算法基础,在NeurIPS、ICLR、ICML、ACL等顶级会议上有论文发表者优先。
- 熟悉Qwen等主流开源大模型细节,探索Agent learning前沿技术,能够独立主导从问题建模、数据治理、算法任务设计、实验验证等完整技术闭环。