跳到正文

实证同一个功能。两种造法。

造一个功能 到底要花多少钱?

这个对比拿一个 issue 造两遍:一遍用传统方式,开发者驱动 Claude 带子 agent,一遍交给 developerz.ai。方法是公开的。它的筛选规则已经公开地对每一个候选跑过一遍,没有选出任何功能,所以两条路都还没开始,这一页上也没有任何东西是测量结果。

developerz.ai 不写代码。写码跑在你自己的 AI agent 里、你自己的服务器上、用你自己的模型密钥。我们做的是:分流这个 issue、把它派出去、审查 PR、发布版本。

方法在两条路开跑之前就登记好了。结果说什么,这一页就写什么。

01正面对比

同一份活,两份回执。

这个功能

没有选中任何功能。选择规则已在公开场合对整份候选集执行过两次,第二次是在公开修订之后,而所有候选项都被跳过。每一次跳过都作为独立评论发布在协议议题上。2026-09-17 采取了事先就已命名的两个处置方案中的第二个,公开进行,且在通知任何外部人士之前:候选集已经用尽,因此由一位外部人士在场地仓库新开一个议题作为功能,那个议题就是功能。我们不提出任何候选项,也不表达任何偏好。

  • 同一个仓库
  • 同一个起始提交
  • 同一套验收标准
  • 同一个模型

这次运行发生在一个我们维护的公开仓库里,而且不是这个产品自己的代码库。

registration.repodeveloperz-ai/wurk

不是这个产品自己的代码库,所以两条路都不会在那段正被拿来当尺子的历史里面施工。但场地终究还是我们维护的,下面的局限里就是这么写的。两条路落在同一个公开场地上,两条时间线任何人都能读。

在两条路开跑之前就冻住的东西登记2026-09-14
这个功能和它的验收标准
筛选规则的一项输出,而它没有产生任何结果
起始提交,两条路一样
筛选规则的一项输出,而它没有产生任何结果
目标的规模等级,在选定功能的同时判定
筛选规则的一项输出,而它没有产生任何结果
模型,两条路完全相同
z-ai/glm-5.3
工作装置,两组之间唯一变化的东西
筛选规则的一项输出,而它没有产生任何结果
对照组那条路的提示词和子 agent 配置
一字不改地公开,留了两处空,而筛选规则没有填上:起始提交和 issue 链接
停止规则,两条路共用同一对:做完,以及失败
两条都完整写了出来
公开场地,一个我们维护的仓库
developerz-ai/wurk
审查者,他在作者身份被隐去的情况下阅读
Din (developerz.ai)

这些是先写下来的,写在一个公开 issue 里。GitHub 会公开 issue 的编辑历史,所以你可以自己核对它们没有在数字出来之后被改写。

传统做法

开发者 + Claude

一个开发者驱动 Claude 带子 agent,全程守在键盘前。

模型花费

运行时测量

模型服务商控制台。为这条路新开的一把 API 密钥,没用在别的任何地方。

这不是交付这个功能的全部成本

日历时间未测量

将取自 GitHub 时间戳:从 issue 开出到 PR 合并

人为介入次数运行时计数

公开的 PR 时间线。任何人都能重新数一遍。

不含人力和服务器

查看这份回执这个数字是从哪来的

这个数字是从哪来的

主仪器模型服务商控制台spend.usd

运行时测量

这笔花费由服务商作证,所以你不必去相信我们的数据库。这才是算数的那个数字。

不适用副仪器spend.our_rows_usd

不适用

这条路跑在开发者自己的机器上,用开发者自己的密钥。我们没有任何一条账目给它定价,所以也就不存在我们这边缺了哪个金额。

这个差额spend.usd - spend.our_rows_usd

算差额需要两个金额,而这条路只有一个。协议在这里的第二台仪器是会话记录自己的 token 计数,那不是价格。

没有第二台仪器

活儿本身

Pull request

尚未开出待定

会话记录

尚未记录

一个人驱动 agent,这一次和下一次就是不一样。提示词和子 agent 配置被白纸黑字冻住,整份会话记录完整公开,这缩小了差异。但两者都没有消除它。

编排做法

developerz.ai

issue 开出来,剩下的交给平台。写码跑在你自己的 AI agent 里、你自己的服务器上、用你自己的密钥。

模型花费

运行时测量

模型服务商控制台。为这条路新开的一把 API 密钥,没用在别的任何地方。

包含我们的编排 token。一分都没扣掉。

日历时间未测量

将取自 GitHub 时间戳:从 issue 开出到 PR 合并

人为介入次数运行时计数

公开的 PR 时间线。任何人都能重新数一遍。

00交接点:issue 开出来,然后平台把它派出去。在那之后,只有在仓库自己的策略要求升级时我们才会去找人,而安全、许可证和 CLA 一律要求升级。

你的服务器和你的模型密钥是直接算在你头上的,不经我们的账

查看这份回执这个数字是从哪来的

这个数字是从哪来的

主仪器模型服务商控制台spend.usd

运行时测量

这笔花费由服务商作证,所以你不必去相信我们的数据库。这才是算数的那个数字。

只有 token,没有金额我们自己记下的数字spend.our_rows_usd

尚未记录

没有任何账目,因为这次运行还没有发生。

这个差额spend.usd - spend.our_rows_usd

算差额需要两个金额。我们这边可能一个都没有,所以它是以“无法计算”发布的,而不是被抹平对齐,也不是被悄悄填上一个零。

无法计算

活儿本身

Pull request

尚未开出待定

会话记录

尚未记录

这条路上的每一个动作同时也会写进只增不改的审计日志,那是哈希链式的。

02结果

没有结果。 没有结论。

这次对比还没有跑。顺序是:协议先登记,然后两条路开跑,然后这块面板照它说的填上去。在那之前,这一页上没有任何东西是测量结果。

模型花费

未测量

尚无数字

模型服务商控制台,每条路各一把新密钥

日历时间

未测量

尚无数字

GitHub 时间戳,从 issue 开出到合并

人为介入次数

未测量

尚无数字

公开的 PR 时间线,任何人都能重新数

n = 0 次已发布的对比。还没有记录任何一次运行,所以这三格背后没有任何样本。这个设计的上限就是每条路各一次运行,那同样支撑不了任何显著性的说法。

一个功能,两种造法。它是一次带回执的演示,永远不是一个比率。B 路里包含我们自己的编排 token:那部分是你用自己的密钥付的,所以没有被扣掉。

阅读这套方法

03人给出的判定

一个读者。两个 pull request。名字被隐去。

一位被点名的审查者一次性读完两个 pull request,分支名和提交作者信息都被抹掉。他同时也是驾驶对照组那条路的人,所以他认得出自己写的那份 diff:所谓“盲”,在这里就只是这个意思。判定保持为一段文字。没有评分,没有星级,也没有条形图,因为审查质量这件事我们手上没有一个可以拿出来公布的数字,而现编一个就是造假。

审查者

Din (developerz.ai)

协议在审查开始之前就点名了审查者,而作者身份一直被隐去,直到判定写完为止。

A开发者 + Claude

尚无判定

Bdeveloperz.ai

尚无判定

换你,你会合并哪一个?

这个答案可以是两个都不,也可以是没有偏好。

未作答

04按你的量来算

你的账单不会随功能数变动。

它只在你加一个 AI 开发者的时候变。所以一个功能的成本,就是你每月的订阅费除下来的结果,你交付得越多,每个功能摊到的就越少。下面是一个算好的例子。价格页上的估算器会按你自己的数字来算。

一个算好的例子

3 个 AI 开发者,这个月交付 8 个功能。

Pro 订阅,3 个 AI 开发者PRIMARY_TIERS.pro代码审查和 CI 都包含在内,不额外收费
$3,000.00
你的服务器,9 台可接入的机器EXAMPLE_DEVS × BOXES_PER_DEV由你的主机商收费,不经我们
你的主机商
你的模型密钥byok由你的服务商直接向你收取
你的账单

每个功能,不含模型花费

$375.00

PRIMARY_TIERS.pro ÷ features

订阅费除以你那个月交付的数量。你的模型花费由你的服务商直接向你收取,不在里面。

这是拿公开的标价做的算术,不是一个跑分结果。你的模型花费由你的服务商直接向你收取,不在里面。

打开价格页上的估算器

05别只听我们说

就是造成让你能自己查的样子。

质量不是一个我们已经有资格拿出来公布的数字。下面这些是你今天就能自己去查的保障机制。

  • 一份改不动的记录,除非它自己的链先断掉。

    这是什么意思

    每一个动作都进只增不改、哈希链式的审计日志。改过就会留下痕迹。

    去查这套机制
  • 该过的检查还是得过。

    这是什么意思

    CI、审查和分支保护把着合并这道关。编排不等于有资格跳过它们。

    去查这套机制
  • 一条结论必须有出处。

    这是什么意思

    审查是“要么给出处、要么不说”。一条没法对应到你代码里的结论会被扣下不发,而且审查会说明扣下了几条。例外是机器人自己在执行的规则,那种情况它按规则拦。

    去查这套机制
  • 你永远知道那是个机器人。

    这是什么意思

    机器人会表明自己的身份。它绝不会装成一个真人去跟你的客户说话。

    去查这套机制
  • 你的密钥,封好了,而且是你的。

    这是什么意思

    模型密钥是信封加密的:每个密钥由它自己的数据密钥封装,而那个数据密钥再由一个主密钥封装,主密钥永远不离开平台、也永远不会下发到任何一台机器上。费用你直接付给服务商,我们绝不转售 token。

    去查这套机制
  • 你的活跑在你自己的服务器上。

    这是什么意思

    worker 跑在你掌控的基础设施上。连接是往外拨的。不需要开任何入站端口。

    去查这套机制

06局限

一个功能不构成任何承诺。

已发布的样本n = 0 次已发布的对比
阅读这些局限

一个功能造两遍,是一则带回执的轶事。这有它的价值,但比一个比率的价值要小。这些局限被写在页面上,是因为反正你自己也会发现。

  1. 01

    n = 1。

    一个功能。这是一次演示,永远不是一个比率。不管结果难看、混杂,还是某一条路直接失败:原样发出来。

  2. 02

    对照组不可复现。

    一个人驱动 Claude,这一次和下一次就是不一样。我们把提示词和子 agent 配置写死并公开了会话记录,这缩小了差异。但没有消除它。

  3. 03

    功能由外部人士挑选,规则修订过两次。

    谁挑任务谁就挑了赢家,所以从这里开始挑选的人不是我们。规则在列出任何候选项之前就已公布,第一次执行排除了所有未关闭议题,得到空集。随后在公开场合删掉了其中一条,即排除本团队自己开的议题那一条,规则再次对八个候选项执行:全部因为没有改动本仓库自己的 Ruby 而被跳过。针对这一死胡同的两个处置方案在它发生之前就已命名。第二个于 2026-09-17 采取,时间早于外部人士被告知、也早于其查看仓库,因此先后次序可在议题历史中核对,而不必听我们自述。它的代价是失去日历为那八个候选项提供的论据,即它们都不可能是为这项研究而开的;换来的是挑选的人不是我们。议题正文从未编辑过;所有版本都按发布顺序公开。

  4. 04

    两条路都是我们自己跑的。

    造出 B 路的那些人,正是在驾驶 A 路的人,而 A 路是我们要去比的那个对照组。一次独立的运行会比我们这次更有价值,我们宁愿把这句说出来,也不愿意让人误会。

  5. 05

    日历时间不等于投入的工作量。

    我们的钟里包含了你现实中真的要等的排队时间。对照组的钟是一个人不被打断的专注时间。这个口径是在抬高对照组,不是抬高我们。

  6. 06

    审查者是我们自己人。

    一个审查者,是我们团队的人。他同时也是驾驶对照组那条路的人,所以在打开任何一个 PR 之前,他就认得出自己写的那份 diff。两份 diff 送到他手上时都去掉了分支名和提交作者信息,而所谓“盲审”在这里就只是这个意思。一个外部审查者会直接消除这条局限,而不是把它说软;我们没有这样一个人。

  7. 07

    场地是我们维护的。

    两条路都跑在一个我们维护的公开仓库上:我们的组织、我们的 CI、我们的机器人守着合并通道。换一个外部仓库会消除这条局限。那需要一个不是我们的维护者,愿意让两条路在他的仓库上开 PR、跑 CI、并且合并,而我们没有这样一个人。

07方法

在我们去看结果之前就写下来。

已登记,未选出任何功能这份协议,作为一个公开 issue2026-09-14公开 issue:规则在评论里逐条应用,每一次跳过都公开,编辑历史公开

什么才算跑完了一次。

一次运行算完成,是指这一条路在公开的场地仓库上开出了一个 PR,它的 diff 满足所选 issue 上的每一条验收标准,并且该仓库自己的 CI 在它上面是绿的,审查者不需要问作者任何问题就能核查。一条路如果 24 小时的钟走完了还没做到,或者它的驾驶者宣布卡住了,就被记为那条路的一次失败,而不是从这一页上拿掉。这一页是从合并这个动作上读出这个结论的,而那也是这条规则里唯一被记录留下来的部分。

这些数字包含什么,又不包含什么。

  • 钱指的是这条路自己那把专用密钥在服务商控制台上的总额。不是我们自己的账目。
  • B 路的钱里包含我们自己的编排开销:分流、scout、审查通道、babysit 驱动。这些一分都没有被扣掉。
  • 钟用的是 GitHub 自己的时间,从 issue 开出到 PR 合并。两条路用同一个公式,所以两边都包含 CI、审查和等待合并的时间。两个数字都不是工时。
  • PR 开出之后每一次人的介入都计数,两条路都算:每人每种介入类型算一次,类型就是评论、审查、合并和关闭这四种。
这份协议必须事先钉死哪些东西
  1. 01这个功能和它的验收标准,写到第三方能照着跑的程度。
  2. 02起始提交,两条路一样。
  3. 03模型,两条路完全相同。两条路跑在不同模型上,那不叫对比。
  4. 04对照组那条路的提示词和子 agent 配置,一字不改地公开。
  5. 05停止规则,两条路共用同一对:什么算做完,什么算失败。
  6. 06公开场地:一个我们维护的仓库,而且不是这个产品自己的代码库。
  7. 07指定的审查者,他在作者身份被隐去的情况下读两个 PR。
  8. 08每个数字的来源:钱来自服务商控制台,钟来自 GitHub 时间戳,人为介入来自公开的 PR 时间线。
  9. 09结果不管说什么都照发,以及一个功能得不出任何比率。
结果不管说什么都照发。

协议在两条路开跑之前作为一个公开 issue 登记。如果我们这条路输了,或者中途停下没交付,那就是这一页上会写的内容。GitHub 会公开 issue 的编辑历史,所以等数字出来之后你可以自己拿它来核对:正文从未被编辑过,每一次修订都是它自己那条带日期的评论。

价格

阶梯不会因此改变。

这一页比的是一个功能。价格页给的是阶梯定价和那个估算器。两者互相链接,但各自独立。

查看价格和估算器