岗位职责
- 你是蚂蚁数据背后的研发人, 能够参与蚂蚁大数据的采集、存储、处理,通过分布式大数据平台加工数据,支持业务管理决策;
- 能够构建面向大模型的高质量企业信用数据资产体系,通过多源异构数据的清洗、融合、向量化和结构化,挖掘可被AI理解和推理的通用知识,打造AI-Native数据处理链路从原始日志等数据到模型可消费数据的端到端闭环,驱动内部智能决策和外部商业化场景;
- 能够参与蚂蚁大数据体系的模型设计、开发、维护,通过元数据、质量体系有效的管理和组织EB级的数据;
- 能够接触世界领先的大数据处理与应用、大模型基础设施的技术和平台,获得大数据浪潮之巅的各类大牛的指导。
职位要求
必须具备的:
- 所学专业是计算机、数学、统计、数据科学与大数据技术等相关专业;
- 有强的动手能力和学习能力,熟练掌握一门数据处理语言,如Python、SQL、JAVA、Perl等,熟悉unix或者linux操作;
- 会用AI、善用AI,了解在数据处理中大模型的使用、评估、优化方法;
- 理解大模型的应用与优化,熟悉Transformer模型结构、注意力机制、位置编码等基础架构,能结合业务场景设计高效Prompt或微调方案,熟悉Agent工作流;
- 具备扎实的专业基础,良好的沟通能力和团队合作,主动积极,乐于面对挑战。 有一定了解的:
- 了解常用的数据建模、知识建模理论、方法。 可以加分的:
- 有参与过大模型相关数据项目,如训练数据准备、知识构建、向量索引、核心数据挖掘等相关项目;
- 对Hadoop、Hive、Spark、Flink、Ray、Hbase等分布式平台有一定的理解;
- 在Github等开源社区具备有较大影响力的技术项目,作为Collaborator/Committer/Member优先;
- 作为重要角色参与领域内有含金量的比赛并取得成绩(比如ACM);
- 发表顶刊顶会(参考CCF-A),担当一作/并列/二作;● 获得过大模型数据处理、向量检索、Agent知识系统等相关的专利。