岗位职责
我们正在构建下一代AI智能搜索系统的离线数据底座——不仅处理结构化日志,更要从海量非结构化文档(如PDF、扫描件、图文混合报告)中提取语义、实体与知识,并通过大语言模型(LLM)与多模态大模型(VLM) 进行深度加工,为搜索、问答、Agent等上层应用提供高质量、可推理的数据资产。 核心职责
- 聚焦多模态大模型的数据处理链路,负责PDF等复杂文档载体的内容高精度解析与结构化提取,结合开源框架进行效果优化与性能调优;
- 深入大模型分布式训练体系,设计并实现高吞吐、可扩展的通用数据编排引擎,支撑大规模多模态数据高效供给,提升模型训练效率;
- 基于AI Coding能力快速响应研发需求,构建稳定、可维护的数据处理与存储系统,保障端到端 pipeline 的可靠性与可观测性;
- 推动多模态数据处理技术在实际业务场景中的落地,通过技术创新驱动大模型理解能力与应用效果持续提升。
职位要求
- 计算机、数学、人工智能等相关专业本科及以上学历,3年以上后端研发或算法工程经验,具备大模型应用开发或AI Infra 实践背景者优先;
- 精通 Python/Java 编程语言,具备扎实的数据结构、算法基础和工程化能力,熟悉主流深度学习框架(如 PyTorch、TensorFlow);
- 有文本、图像等多模态数据处理实战经验,熟悉 OCR、文档智能(Document AI)、Layout 分析等技术者优先;
- 熟练掌握 LLM 调用、Prompt 工程及 RAG 相关技术,能结合大模型能力优化数据处理流程;
- 了解大模型分布式训练机制(如数据并行、流水线并行),熟悉高性能数据加载与预处理技术者优先;
- 热爱技术,积极拥抱 AI 变革,具备技术全栈视野和快速原型验证能力;
- 有高质量开源项目贡献、技术博客或专利者优先。