介绍 Reason Agent 1.0
我们在 DeepSWE v1.1 上的首批结果已能与前沿智能体框架竞争。相较于基准对照,解题时间中位数最多降低 39%。
作者:Reason Machines
2026 年 9 月 14 日
Reason Agent是 Reason Machines 打造的自主软件工程师。
今天,我们推出 Reason Agent 1.0。这是一个旨在帮助模型解决软件工程任务的编程智能体框架。我们在 DeepSWE v1.1 上的首批结果已能与前沿框架竞争,相较于 Codex 基准对照,解题时间中位数最多降低 39%。1
DeepSWE 得分与实际运行时间中位数
DeepSWE 得分
得分更高 · 用时更少 ↗ 配置(60/71)
gpt-6-astra超高高最高中低gemini-3.8-flash高中claude-opus-5最高超高高中低gpt-5.6-sol最高超高高中低claude-fable-5超高ma超高中低gpt-5.6-terra最高超高高中低glm-5.3最高kimi-k3最高grok-4.6中超高高低gpt-5.6-luna最高超高高中低gpt-5.5超高高中低gemini-3.7-flash中高低glm-5.3-flash最高deepseek-v4-pro最高claude-opus-4.8最高超高高中低qwen3.8-max超高muse-spark-1.2超高claude-sonnet-5最高超高高中低grok-4.5高deepseek-v4-flash最高muse-spark-1.1超高gpt-5.4超高gemini-3.6-flash高glm-5.2ma超高gemini-3.5-flash高kimi-k2.7-code默认claude-sonnet-4.6高gemini-3.1-pro-preview高Reason Agent Astra 超高
Reason Agent Astra · 超高 · 我们的运行结果
73.0% DeepSWE 得分
13.80 分钟 实际运行时间中位数
图 1。记录的智能体执行时间中位数,不含环境设置、排队和验证时间,并非任务的端到端延迟。公布的中位数涵盖已评分的尝试,包括失败;Reason 汇总两轮运行中记录了用时的尝试,得分分母保留全部分配任务。模型连线连接的是配置点,并非拟合出的前沿曲线。主机、服务商负载和执行条件不同,因此这些结果仅作描述,并非条件匹配的速度测试。[1] [2]
更早完成成功的解答
Reason 是我们的编程智能体框架,围绕一组精简的通用工具构建。模型决定如何检查仓库、修改代码并测试成果。我们让模型根据问题调整方法,而非规定一套固定的任务专用流程。
我们不认同更好的智能体必然需要更多编排这一假设。随着模型能力增强,我们认为框架应减少对工作流程的限制,更信任模型解决问题时的决策。框架的职责是提供可靠的工具和清晰的执行边界,而不是替模型决定每一步。
我们的目标是减少框架生成的上下文和强制协调调用,让模型能更直接地从调查走向经过测试的变更。这是一项设计假设,而非这些运行结果已证实的机制。工具集小,并不保证模型交互轮数更少。
与已公布的参考结果并列比较
Reason 的 Astra 结果接近 Datacurve 公布的领先 Astra 配置。下表将我们的测量结果与公开参考点并列展示。231
Reason Agent 能与领先框架竞争
DeepSWE v1.1 · 实测成功率
智能体 | 推理强度 | 成功率 |
Reason(Astra) | 超高 | 73%67–78% |
GPT-6 Astra | 超高 | 74%70–78% |
Gemini 3.8 Flash | 高 | 74%70–78% |
Claude Opus 5 | 最高 | 74%69–78% |
GPT-5.6 Sol | 最高 | 73%68–77% |
Claude Fable 5 | 超高 | 70%66–74% |
图 2。Reason(Astra)为我们的测量结果;其余行使用 mini-swe-agent 及已公布的 DeepSWE 结果。区间为 95% Wilson 置信区间,未针对重复任务的相关性进行调整。评估方法存在差异。[1][2][3][6]
智能体框架并排比较
相同的模型和推理强度,不同的框架。在双方均成功的任务中,将 Reason 每个任务的尝试用时取平均后,其平均解题时间减少了 36.7%。Reason 总体解题时间中位数比 Codex 低约 40%(合并两轮运行后为 39%)。1
我们在相同的 113 个任务上比较 Reason 和 Codex,双方均使用 Astra 的超高推理强度。曲线合并了 Reason 的两轮运行和 Codex 的一轮运行。下方逐任务视图比较双方的第一轮运行,包括 Reason 的两次恢复,因此每个点展示双方在同一任务上的表现。
完成曲线展示了实测结果:在总体实测成功率相近的情况下,成功的尝试更早完成。解题进行到 20 分钟时,最终通过的尝试占 Reason 全部分配任务的 59.3%,Codex 为 20.4%。这些是事后统计的完成时间,并非设定了 20 分钟截止时间的实验结果。1
Reason 与 Codex:解题时间
Astra 超高 · Reason 两轮运行,Codex 一轮运行
点击图例项目以显示或隐藏。
已确认成功率(%)
0
20
40
60
80
100
0102030405060
解题时间(分钟)
图 3。按记录的智能体用时统计最终通过的尝试,并非提前终止实验。Reason 和 Codex 的分母均保留全部分配任务。双方均使用 Astra 的超高推理强度;不同的服务商路由和执行条件限制了关于框架因果关系的推断。[1]
Reason 与 Codex:逐任务比较
Astra 超高 · 各框架第一轮运行 · 每个点代表一个任务
左半边:Reason · 右半边:Codex
双方通过 Reason 通过 Codex 通过 双方均未通过
图 4。比较 Reason 第一轮运行与 Codex,包括 Kea 环境设置失败后的重试,以及 Pwntools 未改动补丁的重新评分。蓝色表示通过。悬停或聚焦数据点,可查看双方结果。[1]
下一步
这些结果仍属初步结论。我们认为,编程智能体应围绕精简的通用工具集构建,让能力强的模型有更大自由度解决任务。接下来,我们将在匹配条件下使用新任务检验这一原则,逐项改变工具和编排方式,观察更少的上下文和调用能否在不牺牲正确性的前提下加快结果产出。
评估说明
- 这些测量评估的是提取出的编程框架,而非托管产品。不同的服务商路由和执行基础设施限制了因果推断及严格等同条件的声明。1
- 解题时间不含环境设置、试验前排队和验证。图 4 仅展示 Reason 第一轮运行;汇总图表保留两轮运行。1
- 9 月 14 日更新:Reason 在 226 个分配任务中通过 165 次、失败 61 次,没有未评分结果。Kea 在环境设置失败后的新尝试中失败;Pwntools 的未改动补丁重新评分后通过。没有替换任何已评分的失败结果。JSON 保留了原始结果和恢复详情。公布的得分沿用 Datacurve 的评分规则。123
- 运行结果、汇总得分和解题时间见结果 JSON。1
参考资料
<a id="ref-1"></a>[1] Reason Machines。DeepSWE v1.1。运行结果与汇总数据(JSON).
<a id="ref-2"></a>[2] Datacurve。DeepSWE v1.1。报告方法·已公布排行榜.
<a id="ref-3"></a>[3] Datacurve。DeepSWE v1.1 运行过程数据。试验浏览器·原始试验索引.
<a id="ref-4"></a>[4] Datacurve。DeepSWE:衡量前沿编程智能体。评估方法.
<a id="ref-5"></a>[5] Datacurve / Harbor。DeepSWE v1.1,113 个任务。数据集.
<a id="ref-6"></a>[6] NIST/SEMATECH。《统计方法电子手册》,第 7.2.4.1 节。比例的 Wilson 置信区间.