岗位职责
一句话描述:参与CV、及多模态核心算法研发,涉及视觉对抗、多模态智能体的深度创新和产品应用。 团队成员皆来源于国内外知名高校和企业,并在CVPR、ICCV、ACM MM等顶级会议发表多篇学术论文,鼓励发表前沿学术论文和工程落地,具有业界一流的实习生待遇;
- 负责多模态大语言模型(MLLM)图文对齐,富文本图像理解,视觉问答(VQA)等领域的前沿研究;
- 深入金融等垂类行业,在具体业务场景探索多模态大模型(MLLM)与智能体(Agent)前沿应用如GUI Agent、Chart/DocVQA、OCR-free与OCR融合理解;
- 在导师指导下发表前沿学术论文,撰写专利。
职位要求
- 在读研究生(博士、硕士均可),人工智能、计算机、软件工程、数学等相关专业;
- 拥有较丰富的科研经验或实际工程落地项目;
- 有MLLM/VLM训练或微调经验;文档/表格/图表理解、VQA、视觉对抗/鲁棒性、RAG/Agent任一方向项目或论文成果
- 参与过有影响力的项目或论文者优先,有推理模型研发经验者优先;
- 具备较强的问题分析与解决能力,能够快速落地方案并进行效果验证;
- 良好的沟通协作能力,能和团队一起探索新技术,推进技术进步。