岗位职责
研究领域: 人工智能 项目简介: 随着远程医疗、居家康复、互联网医院等场景爆发式增长,医患之间“面对面”实时交互从“线下”迁移到“线上”。传统文字/图片问诊已无法满足听诊、视诊、康复指导、急救指挥等强实时、强感官的临床需求。 项目聚焦“听得到、看得见、看得懂、答得准”四大痛点,构建一套医疗级、低延时、可解释、可扩展的音视频多模态实时交互 Agent 框架。通过融合图像、视频、音频、文字、结构化数据等模态数据,实现接近真人医生视频对话的实时交互效果,提升用户体验,保障在AI诊疗任务中的识别效果。
职位要求
要求
- 目前正在攻读计算机科学、人工智能、语音信号处理或相关领域的硕士或博士学位。
- 具备扎实的多模态信号处理和深度学习基础,有计算机视觉(CV)、语音合成(TTS)、语音识别(ASR)、语音对话系统等相关项目经验。
- 熟练掌握Python,熟悉PyTorch、TensorFlow等深度学习框架。
- 有相关领域的高质量论文或开源项目成果。 加分项
- 有医疗AI、医疗NLP或医疗语音处理相关项目经验。
- 有原生多模态大模型训练优化经验。
- 熟悉流式语音处理技术,有实时语音系统开发经验。