AI Agent 架构师 · 2026 年 8 月航海关卡 6 成果物Hermes Profile
一个只做内部运营判断的 AI 员工:读当天的商品与推广数据, 先判断这些数据能不能用,再给出每个商品该继续观察、改版、下架还是投放, 最后产出一份带依据、可审批、可回读的日检文档。 它不碰买家会话,不改任何商品,不花一分钱。
它解决的问题
这家店同时跑着自然流和付费流。实测发现:广告会推高商品曝光,但不是 1:1 计入 —— 有的商品按“总曝光减广告曝光”算,能算出负数。 “商品曝光减广告曝光等于自然曝光”这个算法当场作废。
同一周还查出:大部分商品的点击率被付费流量污染,几乎没有干净的观测点; 两条标题一字不差的商品互相抢词,弱的那条几乎拿不到曝光。 这些都不是“分析得不够深”,而是在不该下结论的数据上下了结论。
所以这个 Agent 的第一职责不是给建议,是拦住不该给的建议。
工作方式 · 一次日检的五道工序
第一版让 Agent 自己找数据、自己算口径,结果它在 5 分钟里反复重算同一组早有定论的问题, 两轮日检都超时被人工终止。第二版把口径搬进确定性脚本 —— 这是它从“能跑”变成“能按时交付”的分水岭。
本机浏览器只读卖家后台的商品页与推广计划页,产出带数据日期的标准快照,落进事实库。登录态不交给 Agent。
一次性算死:数据日期基准、缺了哪些页面、每条商品的 lane 是否被投放污染、样本够不够判、实验闸门命中什么结论。输出一份固定 JSON。
只消费证据包,不再自己搜数据库、不重算阈值、不复活已作废的算法。每条商品给一条主结论,必须带依据和置信度标记。
固定模板渲染成八段式文档。结论里出现证据包外的商品、漏判某条商品、缺置信度标记、或把平台写操作标成“不需要审批” —— 一律拒绝渲染。
创建飞书文档并回查内容,把链接回给发起人。所有平台改动停在审批清单上,由人执行,执行后由 Agent 回读线上字段核对。
判断规则 · 数据可用性分级
每个数字都必须带商品 ID、平台数据日期、范围和来源。标签决定用途 —— 这一步不通过,后面的分析一律不许开始。
日期、范围、映射、lane 都完整,未发现影响结论的污染。可按预注册规则比较和判断。
存在付费污染或影响横比的变更。只看可确认的绝对事实,不做受影响的横向归因。
数据完整但样本量不足。留档继续观察,不判输赢,也不提前改阈值。
平台日期未更新或数据已过期。不作为本期最新判断依据。
关键字段未接入或无法确认。明确列为未知并进补数清单,不猜、不填。
判断还必须分层,不许跨层归因:曝光归词与标题,点击率归头图, 询单率归详情、展示价与信任信号。每一层都有预注册的样本量门槛 —— 最少完整自然日数、每个实验臂的最小曝光量、最小有效询单数,都在开跑前写死,中途不许改。 不到门槛时它输出的是“还差多少样本、下次什么时候能判”,而不是结论。
安全边界
所有平台写操作和花费动作一律标为 approval_required,写进审批清单等人批准。 历史批准只对当次任务、对象和动作有效,不会自动沿用到下一次。
一次真实运行
下面是重构后的一次完整运行,跑的是这家店的真实后台数据,不是演示数据。 为避免暴露经营信息,商品 ID 已部分遮蔽,具体指标数值与判定阈值已做脱敏, 保留的是判断结构本身。
“在架商品全部卡在曝光层:近 7 天全店曝光只有两位数、0 询单; 三个实验臂的日均曝光都低于预注册的换词线。本轮不动任何头图。”
| 商品 | 数据状态 | 瓶颈层 | 样本是否达标 | 结论 |
|---|---|---|---|---|
| 1067****1447 | dirty | 曝光 | 不达标 | 继续观察,不动它 —— 历史付费占比过高,已不能当干净基准 |
| 1070****1026 | thin | 曝光 | 不达标 | 该词没量,准备换词 |
| 1070****9831 | thin | 曝光 | 不达标 | 该词没量,准备换词 |
| 1072****9479 | thin | 曝光 | 不达标 | 该词没量,准备换词 |
| 1070****9864 | thin | 曝光 | 不达标 | 与另一条标题完全重复,同词簇互抢,优先下架 |
注意这一轮它没有建议换头图 —— 没有一条商品达到判断点击率所需的曝光样本量。 在曝光层没解决之前动头图,改了也归因不了。这条“今天不该做”和结论一样重要。
局限