岗位职责
- 多元数据深度分析:从零开始规划数据集的用途和框架,制定清晰且可执行的标准。深入书籍、期刊、报纸、网站和专业数据库等多样化的知识来源,以严谨的态度筛选、分类和验证数据,确保信息准确。
- 严格把控标注质量:根据项目需求为海量数据贴上精准的标签,建立严格的标注规则和验收机制,实时监控标注过程,发现问题并迅速解决,确保输出的高质量成果。
- 精准构建知识库:将零散的数据编织成结构化的知识体系,打造一个全面、系统化的知识库体系。不断更新和完善知识库内容,保持前沿性并满足业务需求。
- 高效制定标注标准:制定科学合理的标注标准和计划,明确每个阶段的目标与要求。建立高效的沟通机制,及时收集和解决标注过程中遇到的问题,推动流程的持续改进。
- AI评测与标注前沿研究:与团队开展前沿研究,合作撰写、发表高水平论文,打造有影响力的体系化数据集评测集开源工作。优秀同学能够参与学术论文、开源数据集评测集署名,受邀参与团队主办的大模型评测论坛等高规格交流活动。
职位要求
- 硕博在读同学,语言学、语音学、语音算法或相关专业优先;
- 了解数字音频基础知识及主流音频模型评估指标,具备有ASR/TTS/语音交互/文生音乐评测项目经验优先;
- 具备AI Coding、基础编程、PE工程等技能优先;
- 逻辑严谨,擅长论文写作及数据分析,有语音技术或语言学顶会/顶刊发布经历者优先;
- 思维活跃,对语音模型有浓厚兴趣,持续关注语音技术领域的前沿动态;
- 具备良好的沟通协作能力,能与上下游协作团队顺畅对接。