岗位职责
● 搭Agent能力闭环:规划并落地Agent的认知/执行loop——可观测(步骤结构化、产出落盘、可回溯、可局部重跑)、有Before/After的错误率/成功率对比、有真实样本流入流出的漏斗 ● Agent-First 架构:用AI的垂直扩容替代之前的水平扩容,把分散在多人多系统里的上下文收回到一个Agent 里。对Agent架构的性能、成本、稳定性有优化经验 ● 把"建了什么"变成"流过多少":不追求"建了 5 个Harness/1000条评测集",而是回答——客户是谁、解决了什么问题、本周流入多少样本、流出多少解、漏斗卡在哪 ● 评测作为一级工程资产:不是上线前临时拉一份评测,而是专人持续维护、每周滚动输入,既驱动模型/能力优化,又反哺场景验证 ● 跨方协作:和算法组、产品组深度对齐,把能力工程化、把形态落线上;关键项目把相关方拉进来一起做成,形成AI Native Team
职位要求
必须项: ● 3 年以上工程研发经验,至少1年LLM Agent方向实战(不是看过、是做过、能说清Before/After) ● 主导过一个Agent/RAG/Tool-Use闭环的工程落地,能讲清loop的入口在哪、样本怎么流入、卡点在哪 ● 理解"评测是工程资产"而非辅助工具,做过评测体系建设或Bad Case治理 ● Java/Python工程能力扎实,能独立完成从架构到上线到稳定性保障全链路 加分项: ● 即时零售 / 电商交易域经验(商品、订单、营销、搜索推荐任一) ● 主导过千问/通义这类大模型在业务侧的工程化接入与放量 ● 有Agent可观测/Trace体系的落地经验 ● 有团队带人或技术Lead经验,能给Context不Control,把人送上loop而不是替人跑 我们特别看重的几条(团队文化底色): ● 需求驱动:先回答"客户是谁、解决什么",再讲"我建了什么" ● 知行合一:对外只输出认知,不输出观点。说出的结论要自己验证过、买过单,而不是看几篇公众号复述