岗位职责
- Sandbox 安全与隔离架构 设计并实现多租户、高隔离性的AI代码执行沙箱,支持动态资源限制、网络策略及文件系统隔离。 优化沙箱启动速度与冷启动性能,满足在线推理、Agent工具调用及离线批处理场景需求。 探索轻量级虚拟化技术(如gVisor、Firecracker、Wasm运行时)在AI场景下的最佳实践。
- AI Observability 可观测体系建设 构建覆盖模型调用、Token消耗、推理延迟、Prompt/Response全链路的可观测体系。 设计Trace、Metrics、Logging三位一体的数据采集与存储方案,支持实时监控与事后回溯。 针对Agent场景,建立多步骤推理轨迹追踪、工具调用成功率统计及异常行为告警能力。
- Agent 全生态架构设计与落地 主导Agent运行时架构设计,包括Agent生命周期管理、会话状态持久化、工具注册与发现机制。 设计并实现Agent编排引擎,支持单Agent、多Agent协作及人机协同模式。 构建Agent开发者工具链,包括调试CLI、可视化编排面板及自动化测试框架。 推动Agent间通信协议标准化,对接主流编排框架。
- 架构演进与技术决策 制定技术路线图,平衡稳定性、成本与迭代效率。 输出架构设计文档,组织技术评审,指导中高级工程师落地。 跟踪业界前沿技术趋势,推动AI基础设施的持续演进。
职位要求
- 本科及以上学历,计算机相关专业,5年以上后端/基础架构开发经验,其中至少2年AI基础设施领域经验。
- 精通至少两种编程语言(Go / java / python / js)。
- 深入理解容器化技术(Docker / containerd / kata)及Kubernetes调度原理,有大规模K8s集群开发经验。
- 熟悉分布式追踪系统(OpenTelemetry / Jaeger / Zipkin)及时序数据库(Prometheus / VictoriaMetrics)。
- 有实际参与过沙箱安全机制(如gVisor、Firecracker、Wasm运行时)的设计或二次开发。 加分项
- 有Agent框架(LangChain、openclaw、Hermes)源码阅读或二次开发经验。