岗位职责
- Agent-Native平台架构设计 - 主导设计面向视频全链路生产的Multi-Agent系统架构,拆解并定义不同角色Agent的能力边界与协作协议,构建支持复杂任务分解、动态规划、自主决策、异常恢复的Agent运行框架。 - 设计底层媒体服务平台架构,包括媒体引擎、媒资系统、媒体工作流引擎的统一规划与演进,构建GPU驱动、云原生的AI媒体架构。 - 设计Agent间的通信机制、状态管理与记忆体系,保障长链路生产任务的一致性、可追溯性与可干预性。
- 多模态模型集成与AI媒体关键技术攻坚 - 持续跟踪并将最新的图片生成、视频生成、音频生成、VL等多模态大模型集成进Agent生产链路,保持Agent能力的持续技术领先。 - 攻关视频生成、编辑、合成场景的高性能媒体处理技术,解决大规模任务下多层视频流/文件、特效、音频轨道的实时并行渲染合成难题,突破传统框架在生成式场景下的性能瓶颈。 - 构建为实时交互而生的流媒体生成框架,从传输、模型编排、流媒体性能等维度优化端到端延时,打破""提交-等待""模式,实现""所言即所见""的创作体验。
- 任务规划、Pipeline编排与调度优化 - 设计基于LLM的动态任务规划引擎,根据不同创作意图、内容类型、生产规格动态构建差异化的视频生产Pipeline。 - 攻关长链路任务的可靠性保障:任务断点续传、局部重试、人机协同介入点设计等核心工程难题,确保复杂任务在动态工作流下依然稳定可控。 - 深入分析AIGC Pipeline的复杂依赖关系与性能瓶颈,动态优化工作流活动的执行路径与资源分配,缩短从创意到成片的端到端耗时。
- Agent效果与算法工程性能优化 - 极致化媒体处理与流式生成性能:深入GPU底层,对编解码、合成渲染等核心引擎算子极致调优,将""指令-生成-反馈""循环极致压缩,实现真正的实时创作。 - 建立算法性能基准体系,实现端到端生产链路的延迟/倍速、吞吐、成本三角平衡。 - 对模型输出质量进行系统性调优,针对视频生产场景的语义一致性、运动合理性、视觉/音频质量、叙事逻辑性、指令遵循度等关键指标进行专项优化,让Agent的生产风格与用户意图高度契合。
职位要求
- 基础条件 - 计算机、人工智能等相关专业硕士及以上学历。 - 符合以下情况中的一种:顶会一作、国际顶级竞赛冠军、知名开源社区Commitee、高Star开源项目作者。 - 熟悉 C++ / Go / Python / Rust / Java 中至少一门语言,具备良好的工程落地能力。
- 核心技术能力 - Agent应用方向:理解LLM/Agent核心技术(RAG/Function Calling/Tool Use/Multi-Agent协作),有高质量Agent系统落地经验;熟悉多模态大模型特性与微调技术(SFT/RLHF/DPO),具备良好的Prompt Engineering/DSpy实践经验。 - 平台架构方向:理解音视频技术栈,熟悉AI推理工程与GPU架构(CUDA/TensorRT/vLLM/Triton),掌握模型量化、算子融合等极致性能优化手段;熟悉云原生技术栈,理解或实践过规模化平台或高并发媒体计算系统。
- 优先考虑 - 有Multi-Agent系统(多智能体协作、角色分工、冲突解决)设计与落地经验,或有视频生产、影视创作、内容平台相关AI产品的完整研发经验。 - 拥有较大用户规模的AI视频平台的架构设计经验,解决过AI视频技术在云端的全链路痛点。 - 熟悉CUDA C++编程,有混合精度推理优化、算子融合、异步流水线、零拷贝等极致硬件性能优化经验。 - 对视频美学、镜头语言、导演逻辑有一定理解,能将创作领域知识转化为系统设计输入。