岗位职责
- 负责面向创作场景的多轮 Agent 系统研发与线上演进,覆盖编排运行时、上下文工程、工具体系等核心链路,保障长程任务可中断、可恢复、可追溯;
- 独立设计并落地 Agent 执行流程:多步任务拆解与推进、子 Agent 调度、任务挂起与恢复、人在环确认,以及超时、部分失败、重复调用的兜底策略;
- 负责上下文分层组织与预算分配,设计历史裁剪 / 压缩、会话摘要、缓存友好的 prompt 结构,以及多模态内容接入方案;
- 建设工具体系:接口与错误语义、工具网关、调用幂等与重试、产物校验与出站管控,对齐 Function Calling / MCP 等外部协议;
- 建设效果评测与可观测闭环:评测用例与回归门禁、全链路追踪与分段埋点、成本归因与延迟拆解,用数据驱动效果与成本优化;
- 与产品、前端、客户端协同,将模糊需求收敛为可验收的接口契约与跨端协议,保障同一套 Agent 能力在 Web 与桌面端一致交付。
职位要求
- 计算机相关专业本科及以上学历,5 年以上后端 / 分布式系统研发经验,其中至少 2 年 LLM / Agent 生产系统经验;能独立负责高并发服务的设计、上线、容量规划与线上排障;
- Go 作为主力语言有生产级交付经验(具备扎实的 C++ / Java / Rust 大规模并发系统背景可接受,入职后以 Go 交付);熟悉微服务、配置中心、容器与 K8s,改动必须可回滚、可观测、可灰度;
- 独立设计并上线过完整的多轮工具调用 Agent 运行时(排除框架套壳、低代码编排、单轮问答 Demo),对执行状态机、上下文装配、失败恢复与幂等有完整设计权责,能讲清一次请求从接入到产物校验的分层与取舍;
- 对上下文工程有生产级实践:能设计分层预算与裁剪优先级,理解 prompt 结构对前缀缓存命中的约束,能处理长程会话下的窗口溢出、摘要失真、工具轨迹膨胀与多模态上下文;
- 对 LLM 工程有量化认知并能用自己项目里的数据说话:上下文窗口与 token 计费、TTFT 与端到端延迟的区别、流式协议、结构化输出稳定性、模型路由与降级、重试与幂等边界;
- 具备生产级可观测与成本意识:能基于 Trace / Metrics / Logs 将一次 Agent 请求拆到编排、模型、工具、检索各段,定位延迟、错误率与成本异常,并用对照实验验证优化是否生效;
- 熟悉主流 Agent 框架与协议生态(如 LangGraph、AutoGen、OpenAI Agents、Claude Agent SDK、MCP、A2A 等),有源码级改造或自研运行时经验,而不是停留在官方 Demo 或低代码编排;
- 工程规范过硬:核心路径单测覆盖边界与失败场景,配置与策略外置,能把模糊需求写成可验收的接口契约,并与上下游直接对协议、对验收标准。