岗位职责
业务价值和岗位价值全链路介绍:https://render.alipay.com/p/yuyan/180022670000135291/index.html
- 模型训练策略制定:结合临床场景与医学专业要求,参与医疗大模型训练目标、训练策略及优化方向制定。
- 训练数据构建:设计并建设高质量医学训练数据,包括临床问答、病例推理、诊疗建议等内容,确保数据专业性与安全性。
- 评测集和自动化评测:负责医疗大模型医学专业评测集的设计与维护,制定医学评测标准,构建自动化评测策略并执行模型评测和分析。
- 跨团队协作:与算法、数据、产品团队协作,将临床专业判断转化为可执行的训练和评测方案,推动模型迭代提升。
职位要求
本岗位需转正实习。
- 教育背景限制:临床医学专业,硕士或博士学历,临床医学八年制优先。
- 工作经验:医疗大模型相关实习经验;完成临床规培者优先。
- 大模型认知:了解大模型训练的基本原理,对医疗评测有初步认知,对医疗AI的前沿发展有敏锐洞察,有大模型评测经验者优先。
- 底层思维与数据能力:对数据极度敏感,逻辑思维与系统建模能力强;善于通过数据发现数据冲突与治理盲区,能通过数据驱动模型训练策略的优化和决策。
- 综合素质:有极强的好奇心、有自驱力,对探索“AI+医疗”充满热情。具备严谨的医学态度、优秀的抗压能力、跨部门沟通能力及高度的Owner意识。 请提前准备以下题目(任选其一)
- 评价一下Healthbench,或 PhysicianBench。
- 同时评测 4 个模型(GPT-
- Gemini-
- 1-Pro、DS-v4-Flash-0731、Claude Opus
- 8)在一道医学问答题上的表现,使用 LLM-as-judge 打分(0-10)。结果 Claude 得
- 2,显著高于其他3个模型(均值
- 5)。请列出至少 3 个可能导致该结果的系统性偏差,并针对每一个给出具体的排查或缓解方法。