岗位职责
研究领域: 大模型 项目简介: 随着阿福逐步从“文本问答”走向“多模态医疗服务”(如检验检查单解读、影像/皮肤照片辅助建议等),以及大模型推理能力、对齐方式(RLHF/RLAIF/自反馈等)快速演进,现有评测体系暴露出结构性不足,难以支撑“可信上线、可持续迭代、可对外对标”的要求,主要体现在:
- 评测范式缺乏科学性与可证性:当前评测多依赖静态题库+人工打分,指标定义与标注一致性缺乏可验证的统计学与因果支撑,导致“分数提升不等于真实风险下降/真实体验提升”。
- 多模态医疗场景评测缺位:医学多模态任务(图像/报告单/用药记录等)存在输入不确定性、信息缺失与噪声、跨模态推理链长等特性,沿用文本问答评测指标会系统性低估风险与高估能力。
- 缺少权威可复现的Benchmark:内部指标难以与业界(如DeepSeek-R1等推理模型、医疗多模态开源评测)建立可比性,也难以沉淀为可公开的研究成果与技术影响力。
职位要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作