岗位职责
- 负责具身智能场景下多模态(语音、视觉、文本、触觉等)交互算法的设计、开发与优化,重点解决多模态数据融合、语义理解、意图识别等核心问题;构建具身多模交互领域专用数据集,设计数据增强与清洗策略,支撑模型训练与迭代;
- 深入分析用户需求与使用场景,设计自然流畅的交互逻辑(如多轮对话、情感识别及场景化服务);与上下游团队紧密协作,明确多模态交互的产品需求与技术指标,制定算法迭代交付计划,跟进项目进度,解决开发过程中的技术难题;
- 优化RAG技术体系(包括向量检索、ES检索及图数据库检索方案),提升语义理解与知识融合能力;了解并关注模型在云侧及端侧的工程化部署技术,优化模型结构,确保低延迟与高稳定性;
- 持续跟踪行业动态、技术趋势,提出突破性技术方案并推动POC验证;
- 负责多模态算法相关技术文档的撰写(包括设计文档、开发手册、测试报告等),沉淀技术资产。
职位要求
- 计算机科学、人工智能等相关专业硕士研究生及以上学历,5年以上AI算法开发经验,3年以上智能硬件交互领域经验;
- 掌握多模态/语言大模型底层原理,包括模型结构差异、位置编码及并行训练算法;
- 熟悉深度学习框架(TensorFlow/PyTorch),熟悉大模型训练与优化技术(LoRA、P-Tuning、分布式训练);
- 主导过大模型落地项目,涵盖算法设计、数据构建及工程化部署全流程;
- 有语音交互、计算机视觉或个性化推荐系统开发经验,熟悉汽车、家居、具身场景数据特点与隐私保护要求;
- 较强的问题解决能力与技术文档撰写能力,能够独立分析并优化复杂算法流程。