岗位职责
我们在做什么?核心预训练(Core Pre-training)我们不仅是在训练模型,更是在探索智能的本质边界。我们致力于从零构建下一代通用的智能基座:
- Backbone & Architecture - 下一代基座:Model size scaling & context length scaling - 原生多模态:设计文本、视觉、音频原生融合的统一架构,实现端到端的物理世界感知与推理。 - Co-design:坚持 Algorithm-Infra Co-design,结合底层硬件特性(Kernel/拓扑)设计架构,突破训练与推理的效率瓶颈。
- Data - 真实数据 scaling:建设超大规模多模态数据发掘、采集、清洗与配比流水线,覆盖所有人类已有数据。 - 合成数据 scaling:攻克高质量合成数据的生成与验证难题,解决数据稀缺性,提升数据知识密度、推理密度、推理长度。
- Optimization - 极致收敛:研发适应万卡集群、超大 Batch Size 的新型优化器。 - 训练稳定性:深入研究 Training Dynamics,解决 Loss Spike 与泛化难题,保障大规模训练的鲁棒性。
职位要求
我们在寻找怎样的你? - 笃信 AGI 愿景 — 笃信而建,即使前路未明,仍坚持探索,致力于推动 AGI 的实现。 - 坚定的技术信仰 — 深刻理解 "The Bitter Lesson" 的核心逻辑,笃信算力规模与通用算法的长期价值,具备从系统全局视角思考算法问题的宏观视野。 - 卓越的学术背景 — 在 AI 领域顶级会议或期刊(ICLR, NeurIPS, ICML, CVPR, ACL 等)发表过具有影响力的学术论文,展现出深厚的研究品味与技术前瞻性。 - 扎实的工程底蕴 — 精通 PyTorch 等主流深度学习框架,具备处理大规模分布式训练 (Distributed Training) 的实战经验。熟悉 Megatron-LM 等训练框架底层原理,具备对 Backbone、Optimizer 或 Data Loader 进行底层代码级优化的能力。 - 韧性与协作能力 — 具备在高度不确定性环境下解决复杂问题的韧性;能够与 Infra 团队进行跨学科的高效沟通,共同推进极具挑战性的工程落地。