岗位职责
- 我们正在围绕大模型与Agent构建新一代评估体系,关注如何在真实任务和复杂交互中,对模型能力、风险、稳定性与优化方向进行系统性推断;
- 算法研究员的核心职责是把评估问题变成可运行的研究对象,包括任务设计、数据构造、评分协议、比较方法和推断分析;
- 从真实任务和复杂Agent行为中抽象高价值评估问题,设计面向大模型/Agent的评估任务、样本集、Benchmark、Protocol与Scoring Policy;
- 研究并落地Rubric-based Eval、LLM-as-a-judge、Pairwise comparison、自动Red-teaming、多轮交互评估等方法;
- 运用统计推断、实验设计和归因分析方法,对不同模型、策略与环境配置进行严谨比较;
- 在日常工作中,写实验代码、清洗样本、分析Judge分歧、复盘模型失败模式,并据此重写任务和评分协议;
- 与科学家讨论能力定义合理性,将其落成为可执行的任务集、Rubric或比较实验;
- 持续面对Benchmark失效、模型利用规则漏洞、线上线下结论不一致等真实问题。
职位要求
- 计算机、机器学习、统计、数学、物理、语言学等相关专业,硕士学位及以上;
- 具备机器学习、NLP、LLM、Agent、推荐、广告、强化学习等方向研究或项目经验;
- 熟悉实验设计、统计分析、模型评测、因果推断中至少一类核心方法;
- 能将模糊问题拆解为清晰任务、方案、证据与评估体系,擅长研究抽象与技术表达;
- 关注智能系统评估、能力边界、失败模式与泛化问题,愿意落地真实业务场景;
- 具备跨团队协作能力,有评测相关、业务落地、开源或论文成果者优先。