岗位职责
面向医疗全模态大模型,建设AI-Native数据技术体系,推动高质量医疗数据从采集、理解、构造、评估到持续迭代的全流程建设,主要工作包括:
- 研究文本、影像、检验、病理、语音、结构化病历等多模态医疗数据的融合、对齐、标注与质量评估;
- 结合医学知识、临床流程、专家反馈和真实诊疗结果,建立医疗数据的可信度评估与正确性校验机制,降低模型幻觉;
- 构建“模型缺陷挖掘—数据筛选与增强—消融迭代”的数据飞轮,提升模型在医学理解、临床推理、科研分析和真实医疗工作流中的能力;
- 研究医疗数据合成、难例构造、价值挖掘与数据配比优化,持续释放高价值医疗数据的潜力;
- 与算法、产品、临床专家及数据工程团队协作,推动研究成果落地为可规模化的数据生产和评测能力。
职位要求
- 计算机科学、人工智能、数据科学、生物医学工程、医学信息学、医学或相关专业背景;具备计算机 / AI 与医疗交叉背景者优先;
- 对医疗 AI 有浓厚兴趣,有医学、临床、医疗信息化、医学影像、生物信息等相关学习、研究或项目经验者优先;
- 具备扎实的计算机基础和良好的编程能力,熟练使用 Python,熟悉常见数据结构、算法及 Linux 开发环境;
- 具有实际的大规模数据处理或数据算法经验,熟悉数据采集、清洗、去重、过滤、标注、质量评估、数据合成、数据挖掘、数据配比等一个或多个方向;有大模型 Pre-training / Post-training 数据经验者优先;
- 熟悉熟悉Agent相关技术,了解至少一种大规模分布式数据处理框架或计算系统,能够设计和实现高吞吐、可扩展的数据处理 Pipeline;有 TB / PB 级数据处理经验者优先。