岗位职责
课题背景: 刷掌支付在业务落地中面临多方面的约束与挑战:多样的环境与用户使用习惯、严格的法律法规限制。在这些前提下,刷掌问题排查与优化面临巨大的挑战。随着大语言模型(LLM)及多模态大模型(MLLM)技术的突破性发展,通过多模态大模型进行刷掌问题排查与优化成为一种可能,本课题聚焦多模态大模型在刷掌支付场景中的深度应用,解决支付现场理解与身份识别可靠性的核心业务痛点。 课题挑战:
- 支付现场理解:基于多模态大模型对支付现场进行综合理解,包括用户行为意图、设备环境状态、手掌质量等因素,并进行综合推理确定问题和优化方案。
- 身份识别可靠推理:将多模态大模型的语义理解能力与掌纹识别管线深度结合,结合上下文提供可靠的识别结果与可解释的识别结论。
- 生成识别统一框架构建: 将AIGC生成机制与掌纹识别深度融合,利用生成模型的内在特性反哺识别任务,实现高效率的识别问题修复;
- 模型轻量化与端侧部署:面向刷掌支付终端的算力与时延约束,研究低延时的多模态大模型技术,在保证现场理解与推理能力的前提下实现多模态大模型的高效端侧部署 具体工作: 你将参与面向刷掌支付的多模态大模型研发,包括多模态大模型训练与微调、可解释推理能力增强(DPO、GRPO等)、模型轻量化研究等,推动多模态大模型在刷掌支付真实业务中的落地应用。
职位要求
- 计算机科学、人工智能、模式识别等相关专业的博士及优秀硕士;具有目标检测、Grounding,MLLM等研究背景者优先;
- 熟悉VLM/MLLM前沿进展,熟悉 CLIP/InternVL等技术路径;精通 PyTorch,在 CVPR/ICLR/NeurIPS/ICCV等顶会有相关成果者优先;
- 对多模态理解技术有强烈研究热情,对技术有较强的好奇心,具备较好的研究能力;沟通协作能力强,逻辑性强,具备独立解决问题的能力。