岗位职责
- 全模态数据流水线与架构建设:参与万亿级、EB级海量多模态数据(涵盖多语言文本、图像、音频、视频及 Agent 行为数据等)的采集、存储、清洗与加工;设计并实现高效率、高质量的全模态流程编排引擎及核心处理算子(Pipeline),保障海量异构数据的规模化流转与高扩展性;
- 全模态数据自动化标注:能够结合深度学习与多模态大模型技术,研发并落地智能化的数据处理策略;利用算法模型进行跨模态特征提取与对齐、低质量噪声数据过滤、复杂场景下的异常数据拦截与高价值数据挖掘,大幅提升数据处理的自动化水平与数据质量;
- 多模态数据对齐、评估与合成:主导大规模“图-文”、“视-文”、“音-文”等多模态对齐数据的规模化生产,尤其是在稀缺数据领域,探索并落地智能标注与前沿的数据合成(Data Synthesis)技术;与算法团队紧密合作,深度参与多模态大模型SFT及对齐阶段的高质量数据集构建、配比调优与评测,并通过评测结果反向持续优化语料质量;
- 数据资产化与科学分析:主导AI应用的全流程数据仓库与数据分析研发工作,包括数据同步、数据建模、数据计算、数据挖掘分析与数据可视化;构建高扩展性、高一致性、高业务价值的AI应用核心数据资产体系,确保指标准确、及时与可追溯;
- 关注数据处理领域的新技术、新工具和新方法,积极参与技术分享和团队内部培训,推动团队的技术升级和创新。
职位要求
- 熟练掌握Java、Python、Sql中一种或多种数据处理语言等,具备良好的编程习惯与工程能力;熟悉 Linux/Unix 环境及常用 Shell 操作;
- 熟悉主流大数据平台(如 Hadoop、Spark、Flink、MaxCompute 等),有数据清洗、ETL开发、数据建模或数据仓库建设经验者优先;
- 具备机器学习与深度学习算法基础,有数据挖掘项目落地经验,如分类、回归、聚类、推荐系统、NLP 等方向;
- 在实际业务中有 Data Agent 落地经验,如基于 LLM 构建自然语言查数(Text-to-SQL)、智能数据分析助手、自动化报表生成等数据智能体应用,能独立完成从需求理解、Agent 架构设计到上线交付的全流程;
- 学历背景:本科及以上学历,5年以上相关工作经验,计算机、数学、统计等相关专业优先;
- 了解大模型(LLM)的基本原理与调用方式,有 Prompt Engineering、RAG、Fine-tuning、Function Calling 等实践经验者优先。