岗位职责
- 以算法视角,参与快手大模型文生图、图像编辑评测工作、算子评估和相关评测体系建设;
- 参与评测相关自动化评测工具开发及维护,最大化提高评测效率;
- 以算法手段,对基座大模型和AI Native应用进行分阶段、端到端评测;
- 参与构建评测Agent工具链、机评设计、对战平台、模型竞技场、模型效果判别模型、应用数据飞轮等工具链建设。
职位要求
- 本科及以上学历,计算机、人工智能、软件工程、数据科学、自动化等相关专业优先;
- 具备扎实的软件工程能力,能够独立完成评测工具、自动化流程、数据处理 pipeline 或平台系统的设计与实现;
- 具备较好质量意识,且对大模型、多模态模型、图像生成或图像编辑有兴趣,能够主动理解模型能力、模型缺陷与数据分布之间的关系;
- 具备较强的数据分析和问题归因能力,能够从评测结果、线上数据和用户行为中定位问题,并推动后续优化;
- 具备良好的沟通能力,能够与算法、数据、产品、平台团队协作,推动评测标准和工程方案统一;
- 具备以下任一方向经验即可: ○ 测试开发:有自动化测试、测试平台、质量体系、稳定性保障、效果评测相关经验; ○ 数据分析:有数据清洗、分布分析、指标建设、A/B test、实验分析相关经验; ○ 算法评测 / 模型评测:有 CV、多模态/LLM、AIGC、推荐、搜索、广告等模型评测经验。 加分项:
- 有 AIGC、多模态大模型、图像生成、图像编辑、VLM、Agent 等相关项目经验;
- 有评测平台、对战平台、模型竞技场、自动化评测系统、数据飞轮建设经验;
- 熟悉 diffusion、VLM、LLM、prompt engineering、偏好模型、reward model、VLM-as-Judge 等相关概念;
- 熟悉 SuperCLUE、LMArena、GenAI-Bench、HEIM、T2I-CompBench、DPG-Bench、EditBench 等评测基准或方法论;
- 有较好的图像审美能力,能够从构图、风格、真实感、文字准确性、主体一致性、指令遵循等角度判断生成效果;
- 有复杂项目推进经验,能够跨团队推动评测标准、工具链或数据流程落地。