---
title: "介绍 Reason Agent 1.1"
description: "在 GPT-6 Astra 上，Reason Agent 在 Coding Agent Index 上以 65.1 比 62.5 胜过 Codex，每个已解决任务的成本低 22%。"
url: "https://reasonmachines.com/zh-hans/blog/introducing-reason-agent-1-1"
section: "简体中文"
---

# 介绍 Reason Agent 1.1

_在 GPT-6 Astra 上，Reason Agent 在 Coding Agent Index 上以 65.1 比 62.5 胜过 Codex，每个已解决任务的成本低 22%。_

作者：Reason Machines

2026 年 10 月 10 日

[Reason Agent](/zh-hans)是 Reason Machines 打造的自主软件工程师。

今天我们推出 Reason Agent 1.1。在 GPT-6 Astra 上，使用相同的任务和相同的评分器，它在 Coding Agent Index 上以 65.1 比 62.5 胜过 Codex，并且在每一项基准上每次尝试的成本都比 Codex 低 15–23%。Pi 的得分为 61.4。[2](#ref-2)

模型决定通过率，harness 决定账单。同一个模型在一个 harness 中的成本最高可达另一个的五倍。[3](#ref-3)在 GPT-6 Astra 上，我们的 harness 每次尝试的成本低于 Codex 和 Pi，得分也更高。

## 前沿质量，更低成本

在 GPT-6 Astra 上，Reason Agent 在三个 harness 中拥有最高的 Coding Agent Index 和最低的每个已解决任务成本：比 Codex 低 22%，比 Pi 低 10%。每次尝试的成本是全部 303 个任务的平均值，与 Artificial Analysis 报告每任务成本的方式一致；每个已解决任务的成本是它除以 Index 的结果。讨论之后的图 2 将每个分数链接到对应的 Harbor 任务。[2](#ref-2)

### 质量与成本的帕累托前沿

越靠右上越好

图 1. Coding Agent Index（取整）与每任务成本的关系，越靠右越便宜，因此越靠右上越好。这些点选自 Artificial Analysis Coding Agent Index v1.5 的结果及其公布的每任务成本，以及来自公开 Harbor 任务的 Codex（GPT-6 Astra · xhigh）。蓝色的点是 Reason（GPT-6 Astra · xhigh），根据其 Harbor 任务评分。每项成本都是全部 303 个任务的平均值，即 Artificial Analysis 的口径。将鼠标悬停在某个点上可查看数值；点击可查看来源。

## 核心原则

Reason Agent 1.1 在每一项基准上使用的 token 都比 Codex 少：在 GPT-6 Astra 上，每次尝试的输入 token 少 23%（192 万对 248 万），输出 token 少 15%。[2](#ref-2)有两条原则塑造了这个 harness；我们尚未测试每条原则各自贡献了多少节省。

**并行工具执行**Reason Agent 的 codemode 工具运行 JavaScript 来调用其他工具，因此模型可以编写一个程序并行运行它们，只返回重要的内容。一次搜索、五次文件读取和一次测试运行可以只用一次模型调用。

**最小的工具集**模型看到的是一小组通用编程工具和一段简短的提示词。编程平台需要的其他一切，从编排其他会话和子智能体，到云端计算机、预览 URL 以及带有经过验证的截图和视频的拉取请求，都放在 codemode 按需查找的延迟工具之后。整个 harness 的设计目标是最大化缓存命中资格：提示词和工具在各轮之间从不改变，每个请求只在上一个请求之后追加内容，因此每一轮在新内容之前的部分都完全符合缓存条件。

相同的任务、相同的工具、相同的模型。Reason Agent 在一个程序内并行运行工具，3 次模型调用即可完成。每个工具调用一次的 harness 在每个工具之后都要返回模型，需要 7 次模型调用。

## 讨论

模型实验室有条件在围绕其 harness 构建的强化学习环境中，把模型和 harness 一起训练。[6](#ref-6)模型是在这个 harness 的工具和习惯中成长起来的。这就是为什么实验室的 harness 在自家模型上表现最好，也是为什么这种主场优势无法迁移。为所有模型构建的 harness 没有这样的先发优势，所以它必须不挡路。

我们对模型的要求尽可能少：只用每个有能力的模型都已熟悉的通用工具，没有需要遵循的工作流。所有平台专属的能力都放在代码之后，在模型需要时才被找到。Reason Agent 1.1 构建于 [Pi](https://pi.dev) 之上。主场优势也比看起来要小：在独立测试中，十二组对比里有九组是另一个 harness 得分最高。[3](#ref-3)

缓存的重要性超出想象。每一轮都会重新读取之前的全部内容，因此在智能体工作负载中，账单的大头是缓存输入而不是输出，命中率的几个百分点就能让账单出现两位数的变化：从 95% 提高到 98%，使一份模拟账单减少了约 17%。[4](#ref-4)

正在加载结果…

图 2. GPT-6 Astra · xhigh：相同的模型、相同的任务、相同的评分器。每项基准都运行其全部任务。被提供商拒绝的 Reason 尝试（1 + 10 次）记为 0 分，与 Artificial Analysis 的做法一致。每列的最佳值已标出；每个分数都链接到对应的 Harbor 任务。小字为 95% 区间；Reason 的领先幅度基于相同任务的比较。[[2]](#ref-2)

−34% 在相同推理强度下相对 Codex 的每任务成本中位数

GPT-6.1 Sol · Reason 对比 Codex

Reason Codex（Artificial Analysis）

图 3. GPT-6.1 Sol 在各推理强度下：Coding Agent Index 与每任务成本（对数刻度）的关系，包括 Reason 运行过的强度，以及 Artificial Analysis 列出的 Codex 的每个强度。将鼠标悬停在某个点上可查看数值；点击可查看其 Artificial Analysis 条目或 Harbor 任务。

## 评估方法

我们运行 Coding Agent Index 的三项基准，每个任务尝试三次。我们的[方法](https://github.com/reason-machines/benchmark/blob/main/docs/METHODOLOGY.md)基于 [Artificial Analysis 的方法](https://artificialanalysis.ai/methodology/coding-agents-benchmarking)，运行器和评分器位于我们的[基准仓库](https://github.com/reason-machines/benchmark)；每个结果都链接到对应的 Harbor 任务。[5](#ref-5)图 1 和图 3 中的其他 harness 来自 Artificial Analysis 自己的运行和定价，图 1 中的 Codex（GPT-6 Astra · xhigh）除外，它来自公开的 Harbor 任务；图 2 中的其他 harness 是在相同任务上的公开 Harbor 任务。

## 参考资料

<a id="ref-1"></a>
\[1\] Artificial Analysis。[Coding Agents](https://artificialanalysis.ai/agents/coding-agents)，检索于 2026 年 10 月 3 日。

<a id="ref-2"></a>
\[2\] Harbor Hub。Reason 的运行结果，每个模型和推理强度对应一个任务，包含每次试验和轨迹：[GPT-6 Astra xhigh](https://hub.harborframework.com/jobs/0ac70bbf-10d8-5f45-8077-c428f10cb1a1)·[GPT-6.1 Sol xhigh](https://hub.harborframework.com/jobs/439dab82-597f-539e-9c98-7dde2ddd3072)·[GPT-6.1 Sol high](https://hub.harborframework.com/jobs/6c11b2fe-0dd9-53a7-9fe4-2dec41705472)·[GPT-6.1 Sol medium](https://hub.harborframework.com/jobs/b4405006-b07e-56bc-a427-e0c76c7bee12)。分数遵循我们的方法：被提供商拒绝或未通过奖励作弊判定的尝试记为 0 分，因此任务在 Hub 上的分数可能更高。每次尝试的成本和 token 总量与提供商的用量一致；这些运行早于逐步 token 记录，其轨迹会将疑似密钥的词语遮蔽为 \[redacted\]。图 2 中的其他分数链接到各自的公开任务。

<a id="ref-3"></a>
\[3\] Melissa Z. Pan、Shuo Yang、Negar Arabzadeh、Wei-Lin Chiang、Ion Stoica 和 Matei Zaharia。HarnessTax: How Much Does the Harness Matter for Coding Agents? [文章](https://harnesstax.github.io/).

<a id="ref-4"></a>
\[4\] Diogo。(KV) Cache Rules Everything Around Me。Complete Skeptic，2026 年 9 月。[文章](https://www.completeskeptic.com/p/kv-cache-rules-everything-around).

<a id="ref-5"></a>
\[5\] Reason Machines。Reason on the Coding Agent Index：使用 Harbor 在 DeepSWE v1.1、SWE-Atlas QnA 和 Terminal-Bench 4.0 上运行并复现 Reason。[仓库](https://github.com/reason-machines/benchmark).

<a id="ref-6"></a>
\[6\] OpenAI。Introducing upgrades to Codex，2025 年 9 月 15 日。OpenAI 将 GPT‑5‑Codex 描述为针对 Codex 中的智能体编程优化的 GPT‑5 版本。[文章](https://openai.com/index/introducing-upgrades-to-codex/).
