岗位职责
- 建设多语种语音大模型(端到端同传、ASR、TTS等)训练数据体系,覆盖中文、英语、阿拉伯语、俄语、土耳其语、泰语、印尼语、越南语等20余个语种。与算法/产品团队协同,评估数据缺口,针对语种特点和模型需求制定数据建设路线与优先级;
- 统筹标注标准和标注资源,定义语音模型高表现力指标,为提升模型在音色多样性、韵律表现、副语言信息、情感表达、表达张力、流式自然度等方面表现提供数据方案;解决多语种在语音同传、翻译场景下的表达习惯、文化适配等问题;
- 建立数据生产规范,搭建智能化数据生产管线,覆盖清洗、预处理、加工、精标、验收等环节,提升中/低资源数据获取效率和质量;主导数据合成、Agent驱动数据生成等智能化数据生产技术的探索和应用,持续生产高质量训练数据,并把控数据合成与采集的合规风险。统筹数据供应商,负责供应商选型、交付标准制定与质量审计;
- 建立主客观结合的数据评价体系,统筹高质量评测集,开展数据质量评估和分析调优。跟踪数据配比与血缘,通过训练效果、离线评测、用户反馈及 Bad Case分析进行模型效果的数据归因,持续优化数据策略、结构与分布;
- 持续关注语音大模型前沿技术发展,沉淀多语种适配经验与数据方法论,形成可复用的标准,持续提升数据生产质量与效率。
职位要求
- 本科及以上学历,语言学、计算语言学、计算机、数据科学、统计学或相关专业;
- 2年及以上数据策略、数据生产或语音大模型数据相关经验;
- 熟悉语音大模型训练数据生产逻辑,掌握数据标注、预处理、质量评估的核心方法,具备搭建多语种数据生产框架的实操能力;
- 清楚 ASR、MT、TTS、S2S 等模块所需的数据形态及其对模型表现的影响,能独立分析模型能力问题并设计对应的数据解决方案;
- 具备优秀的数据审美和鉴赏能力,能系统性评价语音模型表现力,形成方法论和评测体系;
- 熟悉目标语种使用区域表达习惯,对多语种模型优化、语音表现优化有认知,具备解决多语言场景下的表达习惯、文化适配问题的相关能力或落地经验;
- 具备良好的跨团队协作及项目推动能力、结构化思考能力、工程理解力,能高效推进多语种数据生产任务,擅长解决不同语种的差异化协作问题。