岗位职责
- 围绕医疗场景(电子病历、处方、检验报告、医学影像、基因测序、医学知识图谱等),构建医疗多模态非结构化数据的结构化、标准化处理能力,打造涵盖解析、召回、去重、去毒、脱敏合规等多环节的高质量医疗数据处理算子,参与医疗大模型数据处理工程平台建设,推动医疗业务与数据技术的融合落地;
- 熟练应用 prompt 工程、SFT、RLHF 等技术,追踪业界医疗数据合成与优化前沿方法(如基于医学知识图谱的合成数据生成、病历增强、影像-报告对齐、罕见病/长尾数据合成等),建立针对医疗大模型的数据质量与效果评估方法,持续提升医疗数据的准确性、多样性、安全性、有用性与合规性;
- 跟进医疗大模型与通用大模型发布进展,引入医学权威 benchmark(如 MedQA、MedMCQA、MMLU-clinical、CMExam 等),为医疗模型的 scaling & alignment 提供鲁棒的实验观测指标,深度参与医疗 LLM 效果优化,加速数据系统迭代流程;
- 作为医疗大模型的调教师推进数据构建、评估与优化。根据医疗业务需求制定详实的标注、合成、采集标准,对医疗数据集进行质量检查与标准迭代,测评模型在临床辅助决策、辅助诊断、病历生成等场景的能力边界,并从数据视角提出优化方案。
职位要求
你将负责什么? ● 破解「医疗数据荒」: 真实医疗数据(电子病历、医学影像、基因测序)受隐私法规(个人信息保护法/HIPAA)与院内壁垒限制,获取成本高、标注昂贵,亟需通过合成数据在合规前提下补齐训练所需的海量「养料」。 ● 补齐长尾与罕见病: 罕见病、少见体征、边缘病例在真实数据中样本极少,模型容易「看不见」,需要基于医学知识图谱与生成模型合成覆盖长尾分布的高质量样本。 ● 跨模态对齐难题: 病历文本与医学影像(CT/病理/放射)的配对标注极度稀缺,需合成「影像-报告」对齐数据,支撑医疗多模态大模型的训练与评测。 ● 质量与合规护城河: 医疗数据噪声大、术语不规范、含敏感 PHI(个人健康信息),亟需构建去毒、脱敏、术语标准化与质量评估体系,守住安全与合规底线。 ● 评测体系缺失: 医疗模型缺乏权威、可复用、贴近临床的 benchmark,需要从数据视角引入并搭建 MedQA/MedMCQA/CMExam 等评测能力,为临床辅助决策、辅助诊断、病历生成等场景提供能力边界度量。