岗位职责
负责建设面向 AGI 的核心数据与检索引擎,支撑全域大模型的训练及 Agent 应用闭环。 具体的职责包括以下相关方向的一项或多项:
- 高密度语料熔炉与预训练基建。建设面向海量多模态数据的极速流水线。研发高效和高准入门槛的分布式去重、质量打分与退火期数据动态配比调度统。通过提升预训练数据的纯度与信息熵,直接为底座模型节省海量 GPU 算力,拉升模型的基础逻辑推理天花板;
- 数据合成与后训练飞轮。结合强模型蒸馏与大模型评测,构建自动化的 SFT 与 RLHF 数据合成与清洗流水线。打造从真实线上 Agent 复杂轨迹捕获、清洗到模型自动微调对齐的数据反馈飞轮,实现模型能力的高效自我进化;
- 认知记忆与智能检索基建。建设高吞吐的向量/图数据库索引。探索并落地结构化知识图谱与大模型底层的深度融合,根除模型多跳推理幻觉。研发支持亿级用户的 Agent 长周期记忆系统,实现对话上下文的高能压缩与合规流转,提升个性化推理效果。
职位要求
- 扎实的工程底色: 计算机、数学或相关专业应届毕业生。精通Python,并熟练掌握C++、Java,Go或Rust中的至少一种语言。对数据结构、算法及高并发系统设计有深刻理解;
- 熟练的大数据技能:熟悉分布式计算与存储原理。了解 Spark、Flink 等传统框架,同时对 Ray 等面向 AI 计算调度的现代分布式框架有强烈的探索欲或实践经验;
- 核心的 AI Native 思维: 不仅将数据视为报表或资产,更将其视为模型的表征与燃料。理解Transformer底层原理,熟悉Tokenization、Embedding机制,深刻认知数据分布、多样性及噪声对生成式AI效果的决定性影响;
- 敏锐的技术视野:关注开源 AI 社区,了解 LangChain、LlamaIndex 或各类主流向量/图数据库。对 GPU 显存机制、推理延迟(TTFT)或 Token 成本有基本概念者佳。 加分项(非必须但高度优先):
- 有在核心搜索、推荐系统或商业化广告引擎的数据架构实习经验;
- 曾亲自动手微调过开源大模型,或深度参与过高质量Instruction-tuning数据集的构建与清洗;
- 在顶会(如 KDD, ACL, NeurIPS, OSDI, SOSP)发表过数据挖掘、NLP 或分布式系统相关论文;
- 活跃的开源贡献者,曾向 vLLM, Ray, Megatron-LM 等知名 AI Infra 项目提交过 PR。