介绍 Reason Agent 1.1
在 GPT-6 Astra 上,Reason Agent 在 Coding Agent Index 上以 65.1 比 62.5 胜过 Codex,每个已解决任务的成本低 22%。
作者:Reason Machines
2026 年 10 月 10 日
Reason Agent是 Reason Machines 打造的自主软件工程师。
今天我们推出 Reason Agent 1.1。在 GPT-6 Astra 上,使用相同的任务和相同的评分器,它在 Coding Agent Index 上以 65.1 比 62.5 胜过 Codex,并且在每一项基准上每次尝试的成本都比 Codex 低 15–23%。Pi 的得分为 61.4。2
模型决定通过率,harness 决定账单。同一个模型在一个 harness 中的成本最高可达另一个的五倍。3在 GPT-6 Astra 上,我们的 harness 每次尝试的成本低于 Codex 和 Pi,得分也更高。
前沿质量,更低成本
在 GPT-6 Astra 上,Reason Agent 在三个 harness 中拥有最高的 Coding Agent Index 和最低的每个已解决任务成本:比 Codex 低 22%,比 Pi 低 10%。每次尝试的成本是全部 303 个任务的平均值,与 Artificial Analysis 报告每任务成本的方式一致;每个已解决任务的成本是它除以 Index 的结果。讨论之后的图 2 将每个分数链接到对应的 Harbor 任务。2
质量与成本的帕累托前沿
越靠右上越好
图 1. Coding Agent Index(取整)与每任务成本的关系,越靠右越便宜,因此越靠右上越好。这些点选自 Artificial Analysis Coding Agent Index v1.5 的结果及其公布的每任务成本,以及来自公开 Harbor 任务的 Codex(GPT-6 Astra · xhigh)。蓝色的点是 Reason(GPT-6 Astra · xhigh),根据其 Harbor 任务评分。每项成本都是全部 303 个任务的平均值,即 Artificial Analysis 的口径。将鼠标悬停在某个点上可查看数值;点击可查看来源。
核心原则
Reason Agent 1.1 在每一项基准上使用的 token 都比 Codex 少:在 GPT-6 Astra 上,每次尝试的输入 token 少 23%(192 万对 248 万),输出 token 少 15%。2有两条原则塑造了这个 harness;我们尚未测试每条原则各自贡献了多少节省。
并行工具执行Reason Agent 的 codemode 工具运行 JavaScript 来调用其他工具,因此模型可以编写一个程序并行运行它们,只返回重要的内容。一次搜索、五次文件读取和一次测试运行可以只用一次模型调用。
最小的工具集模型看到的是一小组通用编程工具和一段简短的提示词。编程平台需要的其他一切,从编排其他会话和子智能体,到云端计算机、预览 URL 以及带有经过验证的截图和视频的拉取请求,都放在 codemode 按需查找的延迟工具之后。整个 harness 的设计目标是最大化缓存命中资格:提示词和工具在各轮之间从不改变,每个请求只在上一个请求之后追加内容,因此每一轮在新内容之前的部分都完全符合缓存条件。
相同的任务、相同的工具、相同的模型。Reason Agent 在一个程序内并行运行工具,3 次模型调用即可完成。每个工具调用一次的 harness 在每个工具之后都要返回模型,需要 7 次模型调用。
讨论
模型实验室有条件在围绕其 harness 构建的强化学习环境中,把模型和 harness 一起训练。6模型是在这个 harness 的工具和习惯中成长起来的。这就是为什么实验室的 harness 在自家模型上表现最好,也是为什么这种主场优势无法迁移。为所有模型构建的 harness 没有这样的先发优势,所以它必须不挡路。
我们对模型的要求尽可能少:只用每个有能力的模型都已熟悉的通用工具,没有需要遵循的工作流。所有平台专属的能力都放在代码之后,在模型需要时才被找到。Reason Agent 1.1 构建于 Pi 之上。主场优势也比看起来要小:在独立测试中,十二组对比里有九组是另一个 harness 得分最高。3
缓存的重要性超出想象。每一轮都会重新读取之前的全部内容,因此在智能体工作负载中,账单的大头是缓存输入而不是输出,命中率的几个百分点就能让账单出现两位数的变化:从 95% 提高到 98%,使一份模拟账单减少了约 17%。4
正在加载结果…
图 2. GPT-6 Astra · xhigh:相同的模型、相同的任务、相同的评分器。每项基准都运行其全部任务。被提供商拒绝的 Reason 尝试(1 + 10 次)记为 0 分,与 Artificial Analysis 的做法一致。每列的最佳值已标出;每个分数都链接到对应的 Harbor 任务。小字为 95% 区间;Reason 的领先幅度基于相同任务的比较。[2]
−34% 在相同推理强度下相对 Codex 的每任务成本中位数
GPT-6.1 Sol · Reason 对比 Codex
Reason Codex(Artificial Analysis)
图 3. GPT-6.1 Sol 在各推理强度下:Coding Agent Index 与每任务成本(对数刻度)的关系,包括 Reason 运行过的强度,以及 Artificial Analysis 列出的 Codex 的每个强度。将鼠标悬停在某个点上可查看数值;点击可查看其 Artificial Analysis 条目或 Harbor 任务。
评估方法
我们运行 Coding Agent Index 的三项基准,每个任务尝试三次。我们的方法基于 Artificial Analysis 的方法,运行器和评分器位于我们的基准仓库;每个结果都链接到对应的 Harbor 任务。5图 1 和图 3 中的其他 harness 来自 Artificial Analysis 自己的运行和定价,图 1 中的 Codex(GPT-6 Astra · xhigh)除外,它来自公开的 Harbor 任务;图 2 中的其他 harness 是在相同任务上的公开 Harbor 任务。
参考资料
<a id="ref-1"></a> [1] Artificial Analysis。Coding Agents,检索于 2026 年 10 月 3 日。
<a id="ref-2"></a> [2] Harbor Hub。Reason 的运行结果,每个模型和推理强度对应一个任务,包含每次试验和轨迹:GPT-6 Astra xhigh·GPT-6.1 Sol xhigh·GPT-6.1 Sol high·GPT-6.1 Sol medium。分数遵循我们的方法:被提供商拒绝或未通过奖励作弊判定的尝试记为 0 分,因此任务在 Hub 上的分数可能更高。每次尝试的成本和 token 总量与提供商的用量一致;这些运行早于逐步 token 记录,其轨迹会将疑似密钥的词语遮蔽为 [redacted]。图 2 中的其他分数链接到各自的公开任务。
<a id="ref-3"></a> [3] Melissa Z. Pan、Shuo Yang、Negar Arabzadeh、Wei-Lin Chiang、Ion Stoica 和 Matei Zaharia。HarnessTax: How Much Does the Harness Matter for Coding Agents? 文章.
<a id="ref-4"></a> [4] Diogo。(KV) Cache Rules Everything Around Me。Complete Skeptic,2026 年 9 月。文章.
<a id="ref-5"></a> [5] Reason Machines。Reason on the Coding Agent Index:使用 Harbor 在 DeepSWE v1.1、SWE-Atlas QnA 和 Terminal-Bench 4.0 上运行并复现 Reason。仓库.
<a id="ref-6"></a> [6] OpenAI。Introducing upgrades to Codex,2025 年 9 月 15 日。OpenAI 将 GPT‑5‑Codex 描述为针对 Codex 中的智能体编程优化的 GPT‑5 版本。文章.