部门介绍
Data-语音团队致力于语音、音乐等大模型AIGC技术的研发和产品创新,我们的使命是通过多模态AIGC音频技术赋能内容创作和语音交互,让内容生产、消费与互动变得更加简单、沉浸、多元化。当前团队已有成熟的大模型语音合成、语音理解、音乐生成等多模态音频技术,并持续迭代大模型端到端语音交互方案等,一方面通过中台形式服务于公司众多业务线,例如豆包/Dola、抖音/TikTok、剪映/CapCut、番茄小说、海绵音乐等产品;另一方面,团队已经通过字节跳动旗下的火山引擎开放平台-语音技术和火山方舟平台,向众多企业开放技术成熟稳定的能力和服务。
- 负责多模态音频理解大模型(ALM)后训练中说话人相关能力的建设,并结合其它语音理解任务落地业务场景,解决落地过程中的前沿问题,持续优化技术效果;
- 深度参与下一代多模态音频理解基座模型的核心技术构建,持续跟进并攻克说话人相关的前沿技术难题,探索追求业界算法。
岗位职责
招聘官网暂未提供完整岗位职责,请前往官网核实。
职位要求
- 理解说话人聚类、说话人日志、说话人识别等相关任务的技术实现,对业务效果优化有实际经验;
- 熟悉语音识别、音频caption、语音对话等技术,了解音视频多模态理解相关技术;
- 对深度学习和大模型技术有较好的理解,如AHC、ResNet、EcapaTDNN、ALM和LLM等系列模型架构;
- 对工业级数据的处理管线有实际经验,有使用海量数据优化实际业务模型的动手经验;
- 有不错的编码能力,熟悉Codex、TRAE等Code Agent,熟悉C++、Python等常用编程语言;
- 有独立工作能力并同时能与团队融洽协作,敢于发现和提出问题。 加分项:
- 在会议和智能硬件等场景有说话人日志或语音识别系统落地和优化经验;
- 对前沿的端到端说话人日志有优化经验或在GitHub上有优秀的相关技术的开源项目;
- 在相关国际会议或主流期刊上发表论文(ICASSP、Interspeech、ASRU、IEEE/ACM Transactions等);
- 语音相关比赛或机器学习相关比赛拿到过国际领先名次,具备ACM/NOI/IOI/TopCoder等编程比赛获奖经历。