部门介绍
评测是大模型能力演进的指南针,尤其在严肃的医疗健康等复杂生活场景中,如何定义、度量并指导大模型的能力跃升,是当前AGI领域最核心的未解难题之一。我们致力于探索行业最前沿的大模型评测技术,打破传统静态评测的局限,构建评测-诊断-对齐的自动化闭环,旨在通过科学的评测体系推动通用/医疗垂域大模型突破能力天花板。在这里,你将直接面对业界最具挑战性的复杂推理与高风险场景,你的研究成果不仅能发表在顶会,更将决定亿级用户产品的智能底座高度。 除了前沿课题研究,你将参与到全链路的医疗AGI能力建设,包括:
- 数据理解和质量优化体系:构建行业领先的数据解析和理解能力,不断提升数据处理的深度和理解广度。
- 模型自我迭代闭环:基于大量的线上问题和医院内真实数据,规模化挖掘模型的难负样本,找到模型的提升空间,建设数据的自我迭代反馈闭环。
- 医疗数据合成:设计并落地针对各个能力的大模型的医疗数据合成,生成高质量、可控、多样化的训练样本(包括病例生成、对话模拟、推理链构造等),降低模型幻觉,提升泛化能力。
- 实验分析和归因能力:建立医疗数据的质量评估标准与自动化分析和归因能力,追溯模型输出的数据来源和推理路径,提升医疗AI的可解释性和可信度。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 学术背景:计算机科学、人工智能、统计学、数学等相关领域的顶尖博士(或具备同等科研能力的极优硕士),具备极强的代码落地能力(熟练使用Python及PyTorch等框架);
- 大模型底座认知:深刻理解LLM/Transformer底层架构及后训练范式(SFT, RLHF, DPO, PPO等),对当前业界主流模型(GPT-4, Llama3等)的能力边界与缺陷有深入洞察;
- 顶尖学术成果:在国际顶级AI会议或期刊(如ICLR, NeurIPS, ICML, ACL, EMNLP等)一作或共一;
- 敏锐的研究嗅觉:对AI前沿技术充满狂热的好奇心,能深刻理解大模型评测、Agent架构、RAG体系的典型失败模式,并能独立提出创新性的解决方案;
- 复杂问题解决能力:具备极强的逻辑拆解与数学功底,能建立严谨的统计推断与实验规范(置信区间、显著性检验、多重比较等),确保结论的可信与可解释性。 加分项:
- 开源与竞赛影响力:作为核心贡献者参与过知名开源评测框架/数据集(如HELM, OpenCompass, MMLU, CL-Bench等),或在Kaggle等顶级算法竞赛中获得TOP名次;
- 实战经验:有大厂大模型训练/后训练/对齐方向的实习经验;或具备Reward Model训练与偏好对齐的成功实践;
- 跨学科背景:具备医疗健康、生物信息学相关背景,或对高合规/高安全性AI系统的评测与对齐有研究经验者优先。