ratemy.sh

rate-my-harness · 面向 agent 运行时的上线审查

Demo 不是证据。

你的 agent 跑通了一个 demo。现在证明这套运行时配得上真实的工具、数据和用户。循环、工具调度、它记得什么、能动什么、坏了怎么回来,全部按你能亲手复核的证据来判。

审计 · H-014 目标:public-release ref: sha256:9f3c…e2a1

问题清单

BLOCKER · H-002取消不会真的停下工具调用。用户按了停止,agent 还在继续花钱。

HIGH · H-005重试会重新执行一次非幂等的转账。一次批准可能扣两次款。

待验证

UNKNOWN · U-003从来没人真的去试过能不能读到别人的数据。一个用户的数据可能被另一个用户看到。

证据通道

deterministic-checksPASS
critical-journey-e2eFAIL
probabilistic-evalUNVERIFIED
continuous-evidenceN/A (尚无部署)
最高安全档位:local-prototype
阻断闸门:runaway-execution, duplicate-irreversible-effect
NOT READY
这份判决样张里,四条证据通道分别是:确定性检查(校验器和断言过没过)、 关键旅程(一个真实任务真的从头跑到尾没有,连失败和取消一起试)、概率性评测(重复跑多次的行为达没达到门槛)、 持续证据(上线之后这套结论还成不成立)。最高安全档位是它敢放行到哪一步,五档从松到严是 local-prototype、team-shared、public-release、privileged-production、high-stakes。

范围

它到底审什么。

只审有产品后果的东西。风格偏好和时髦架构不算问题。

·

跑起来之后绝不能破的几件事:权限、哪个结果对应哪次调用、互不串味、同一件事只做一遍、停得下来、状态说的是真话。

·

概率性任务质量:重复成功率、不安全结果、波动、延迟,以及每次成功的成本。

·

它读到的东西按什么顺序进来、从哪来、有没有被截断、记住了什么、会不会串到别人那里。

·

超时、重试预算、取消、检查点、恢复与确定性终止。

·

权限、沙箱、审批、不可信输入、密钥、网络与租户边界。

·

队列、背压、追踪、故障恢复;面向公开发布时还要漂移、灰度与回滚。

·

跟最朴素的裸循环或上一版运行时比,任务表现有没有可测量的提升。

装与不装

装上它之后,有什么变化。

一个称职的 agent 本来就会读你的运行时代码,也会有意见。下面这些是只有装了它才会出现的行为。

用户按了停止,agent 还在继续跑。

没装它

它把锅甩给「模型」,建议你把提示词写好点。

装了它

它把「模型选择动作」「循环重复执行」「运行时强制管控」三件事分开,然后找出取消信号收到了却从未向下传递。

一次转账超时了,运行时自动重试。

没装它

它建议你加上重试和退避。

装了它

它分清模型那侧的调用 ID 和对方系统真正认的幂等键,然后追出「已提交 → 超时 → 重试」这条链。

工具返回的内容里夹着一句写给 agent 的指令。

没装它

它把那段文字当成指令带了进去,照着做了。

装了它

它拒绝这段内容,并把「哪些东西可信」这条线,从工具输出一路画到调度器。

仓库很漂亮,CI 全绿。

没装它

于是被当成运行时的行为也没问题。

装了它

它直接说清:CI 绿和测试夹具合法只是结构检查,证明不了这套运行时的行为。

别家跳过的一步

那修复本身,谁来审?

多数审查列完问题就结束了。要是接着动手修,先想清楚补丁是什么。它是项目里最新写的代码,为了赶紧关掉问题才写出来。它没有自己的测试,也没人读过。

1

修复的人不能给自己打分。

得换一个人来看。

2

一份 diff 不等于修好了。

每条问题都带一个验收测试。另一个人重现出原来的故障,又看着它不再发生, 这条才算 verified-fixed

3

补丁本身也要被审。

复测的人还会把改动本身当成新代码,再审一遍。修复自己带出来的毛病算新问题、新编号, 没解决之前这一批不算完。

4

什么时候停,看证据不看清单。

它只在三种情况下停:全部验过、遇到一个它说得出名字的阻碍、或者你明说剩下的风险你认了。最后这种会记成「你认了」,不会被悄悄写成「修好了」。

这个网站本身就是这么审的。第一轮问题修完之后,独立复测在那批补丁里又找出两个缺陷:一份公开可读的旧备份,和一个焦点进不了正文的跳转链接。两个都是修复过程带出来的,重跑原来的验收测试一个也发现不了。

怎么跑

开审之前,先问你两个设置。

它不会默默替你选最严的那档,也不会默默选最松的。

1

审查角色

agent 产品负责人 / Staff 运行时工程师 / 红队评审 / SRE 运维 / 答辩教授

2

审查程度

从松到严五档:快速体检(默认,只查最要紧的几项)、严格审查(给小范围试用的标准)、 发布门禁(公开发布的标准)、特权审查(能碰工具、密钥或写操作)、生死档(受监管或者出事就致命)。

§

分数不能把硬闸门平均掉。

有些问题不管总分多好看都拦住发布。你说「这个我认了」,它也不会因此变成通过。

§

从快速体检起步。

它是默认档,因为完整档要贵好几倍。它查得少,但会告诉你哪些没查。

安装

一条命令,或者插件市场。

一个客户端选一种装法就行。第一遍只读,什么都不改;能碰什么,仍然由你自己的沙箱和授权弹窗说了算。

任意 Skills 客户端 · 推荐
npx skills add AmsonntagChow/rate-my-harness --skill rate-my-harness
Claude Code
/plugin marketplace add AmsonntagChow/rate-my-harness
Codex
codex plugin marketplace add AmsonntagChow/rate-my-harness && codex plugin add rate-my-harness@amsonntagchow-rate-my-harness