岗位职责
- 构建核心推理代工平台:负责支持Hugging Face全量模型的自动化接入与分发,利用性能模拟器与动态库存匹配技术,实现高效的延迟与吞吐优化;
- 研发Agent基础设施:设计并实现云端存储与状态机系统,支持智能体任务的断点回滚、时间回溯调试及KV Cache的高效管理;
- 开发AI开发者工具栈:建设智能体可观测性系统,通过全链路Tracing展示Agent决策树,帮助用户识别冗余交互并自动提取高质量对话轨迹用于模型微调;
- 打造混合工具运行时:设计SDK实现本地工具与云端工具(如Sandbox、Search、Browser)的无缝集成,支持MCP等协议转换,兼容主流Agent框架(如LangGraph、AutoGen、Dify);
- 前沿推理加速落地:在代工平台上部署自动推测解码、结构化输出、自动量化与OPD等高端推理能力。
职位要求
- 扎实的基础功底:精通Python及C/C++,熟悉Linux环境及分布式系统设计;
- 深厚的推理/模型背景:深入理解大模型推理机制,熟悉vLLM,TensorRT-LLM或类似的推理引擎,对Transformer架构有深入研究;
- 工程与架构能力:具备后端系统开发经验,熟悉高并发、高性能存储(如Redis,PostgreSQL,Vector DB)的应用;
- 敏锐的技术视野:对Agent生态有热情,熟悉至少一种Agent开发框架(如LangGraph,AutoGen,CrewAI或Dify);
- 较强的自驱力:能在快速演进的AI浪潮中保持学习,具备独立解决复杂工程问题的能力。 加分项
- 架构级优化经验:有推测解码、PagedAttention或软硬件联合设计经验者优先;
- 协议与标准贡献:熟悉OpenAI Assistants API架构,或对MCP等Agent通讯协议有研究;
- 全栈/SDK经验:有面向开发者的SDK开发经验,能够从用户视角优化AI产品的易用性;
- 算法理解力:能使用数学工具分析RLHF或Agent调优中的优化算法。