岗位职责
- 负责语音识别模型的研发与优化,重点建设低延迟、高准确率的流式语音识别能力,支持实时对话、按住说话、语音助手等场景;
- 负责流式 ASR 模型架构、训练和解码策略优化,包括 Streaming Conformer、CTC、Transducer、Attention 等技术方向;
- 负责语音理解模型研发,提升模型对语义上下文、用户意图、实体、热词及多轮对话信息的理解和利用能力;
- 负责热词和上下文增强能力建设,包括通讯录、人名、地名、应用名称、业务词汇及动态热词召回;
- 负责中英混说、方言、口音、噪声、远场、重叠语音、轻声及非标准表达等复杂场景的识别优化;
- 负责端点检测、流式上屏、结果稳定、标点预测、文本规整及上下文纠错等链路优化;
- 负责大规模语音数据清洗、伪标注、难例挖掘和数据配比,持续提升模型泛化能力;
- 建立语音识别与语音理解评测体系,推动模型训练、推理优化和产品上线。
职位要求
- 计算机、人工智能、语音信号处理等相关专业,硕士及以上学历优先;
- 具备流式语音识别模型研发经验,熟悉模型训练、流式解码、状态缓存和延迟优化;
- 熟悉 CTC、Transducer、Conformer、Transformer、语言模型融合等技术;
- 具备语音理解或上下文建模经验,熟悉热词增强、语义纠错、意图理解、实体识别或多轮对话建模中的一种或多种;
- 熟悉语音数据处理流程,具备数据清洗、伪标注、难例分析和效果归因能力;
- 熟练使用 PyTorch,具备较强的模型训练、实验设计和问题定位能力;
- 具备良好的工程意识,关注识别准确率、首字延迟、尾字延迟、实时率及线上稳定性。