岗位职责
- 复杂文档结构化解析: 专注于复杂文档的深度解析,包括版面分析(Layout Analysis)、公式表格识别(Formula Table Recognition & Reconstruction)、关键信息抽取(Key Information Extraction, KIE)等,将非结构化的文档图像或PDF高效地转换成机器可读的结构化数据。
- 文档问答(DocVQA)系统构建: 研发和迭代文档视觉问答模型,让大模型能够精准理解用户的自然语言提问,并结合视觉与文本信息,从复杂的文档(如研究报告、财务报表、合同、票据等)中定位、抽取并生成结构化答案。
- 核心OCR能力提升: 负责前沿OCR技术的研发与优化,攻克手写体、低质量图像、艺术字、复杂排版等挑战性场景下的文字检测与识别难题,显著提升多模态大模型底层的文字信息获取(Text-in-Image)精度与鲁棒性。
- 前沿技术探索与创新: 紧密跟踪多模态、OCR及文档智能领域的最新研究成果,结合业务需求进行技术预研、方案设计和原型实现,推动技术创新和专利产出。
- 模型与系统优化: 负责构建和完善相关方向的数据集、评测体系和模型训练/推理流程,并与工程团队紧密合作,推动算法模型的性能优化与实际落地。
职位要求
- 学历背景: 计算机科学、人工智能、模式识别、电子工程或相关领域的硕士或博士学位。
- 从业经验: 3年以上在OCR、文档理解或相关计算机视觉处理领域的算法研发经验。
- 专业技能:精通至少一种主流深度学习框架(如PyTorch、TensorFlow),并具备丰富的模型开发与调优经验;拥有大规模多模态大模型(VLM)的训练、微调或应用经验;在以下至少两个方向有深入研究和实践经验:文字检测/识别、版面分析/KIE、表格识别和文档视觉问答 (DocVQA);
- 编程能力: 具备出色的Python编程能力和扎实的数据结构与算法基础。
- 学术能力: 对领域内的前沿技术有敏锐的洞察力,有在CVPR, ICCV, ECCV, NeurIPS, ICML, ACL等顶级会议或期刊上发表论文者优先。