岗位职责
现在在做什么:
- 理解生成一体化架构升级,同时打通图视频统一底座;
- 理解能力正在成为生成质量的天花板。Google Nano Banana
- GPT Image
- 0 都在朝这个方向收敛。我们的下一代模型需要在多模态理解上有完整 hands-on 经验的人,一起定义新架构——而不是执行已定方案。 你将主导:
- 理解生成一体化架构设计;
- Thinking / Chain-of-Thought for Image Generation;
- Long Visual Context Compression;
- 大规模多模态预训练;
- 后训练与对齐;
- 图视频统一探索。 我们能提供:
- 真正的架构话语权——你的判断直接写进技术路线图;
- 经过验证的执行力和产品力——O1 和
- 0 Omni 不是 paper,是每天上百万用户在用的产品;
- 充足资源——中心级千卡算力 + 完整数据基础设施;
- 图视频协同的独特 scope——国内少数同时在图像和视频头部的平台。
职位要求
必备:
- 2-3 年大规模多模态理解/生成模型 hands-on 经验,主导过完整项目或者核心贡献者;
- 深入理解 MLLM / Diffusion:视觉 encoder、跨模态对齐、长 context、多图交互;
- 有大规模多模态预训练经验(数据配比、训练稳定性、loss 平衡);
- 后训练全链路至少亲手做过两个阶段;
- 博士 or 顶会一作 or 业界核心项目主导者。 我们更看重:
- 对"理解生成如何深度一体化"有自己的技术判断;
- 深入研究或做过 Transfusion / Janus / BAGEL / MetaQuery 等统一架构;
- 有大规模弱关联数据挖掘和预训练经验。 加分: Visual Tokenizer / Compressor、Chain-of-Thought、视频理解或生成、开源影响力。