Cognition SWE-2 高性价比编码智能体模型
Cognition 于 2026 年 9 月 10 日发布,官方称这是其迄今最先进的编码模型:在 FrontierCode 1.1 Main 上取得 50.0%、距 Fable 5.1 不到一个百分点而便宜 64%,推动能力与推理成本的帕累托前沿;SWE-2 基于 2.8 万亿参数的 Kimi K3 后训练而来,官方称首次把强化学习扩展到万亿参数级规模,并用单次 RL 训练同时覆盖全部推理强度档,发布当日起在 Devin Desktop 与 CLI 提供,并陆续登陆 Devin Web 与 Fusion
工具概览
功能、使用步骤与常见问题见下方
功能特点
- ✓ 帕累托前沿:官方称 SWE-2 在 FrontierCode 1.1 Main 上取得 50.0%,距领先的 Fable 5.1 不到一个百分点,而成本低 64%;在 FrontierCode 1.1 Main 与 DeepSWE 1.1 上,SWE-2 在得分与成本上都优于 SWE-1.7 与 Grok 4.6,并与 GPT-5.6 Sol、Fable 5/5.1 在分数上相当而价格低得多
- ✓ 单次 RL 覆盖全部推理强度:官方称 SWE-2 基于 2.8 万亿参数的 Kimi K3 后训练,首次把强化学习扩展到万亿参数级规模,关键新增是可以一次 RL 运行同时训练全部推理强度档、整体推动成本与性能前沿
- ✓ 基准成绩:官方公布的编码基准显示,SWE-2 在 FrontierCode 1.1 Main 为 50.0%、DeepSWE 1.1 为 73.0%、Terminal-Bench 2.1 为 92.8%、Terminal-Bench 4 为 27.3%;对比 Kimi K3 的 44.2%、68.5%、88.3%、21.5%,官方称 RL 在多项基准上再加 5 至 6 个百分点
- ✓ 更聪明也更省:官方称在 FrontierCode 1.1 Main 上,SWE-2 medium 的得分高于 SWE-1.7,却少用 58% 的轮次、平均成本低 81%;效率提升主要来自聚焦式探索,SWE-2 medium 中位仅 18 步就做出首次真实编辑,而 SWE-1.7 为 48 步
- ✓ 工程行为:官方称 SWE-2 更擅长编写端到端检查实现的测试、在用户边界内更有办法寻找替代路径,并在被质疑时重新推导结论而非重复断言,通过运行产物收集证据;medium 档更快行动以服务简单任务,high 与 max 档在复杂任务上更多规划与验证
使用步骤
- 在 Devin Desktop 或 Devin CLI 中直接使用 SWE-2,官方称发布当日起即可用
- 按任务复杂度选择推理强度档:简单与中等任务用 medium 更快更省,复杂任务用 high 或 max 以获得更多规划与验证
- 关注 Devin Web 与 Fusion 的陆续推出,官方称 SWE-2 正逐步登陆这两处
- 以完成任务的总成本而非单一 token 价格来评估性价比,因为 SWE-2 通过 Devin 产品提供、没有独立的 API 价格表
常见问题
SWE-2 是什么?
Cognition 称 SWE-2 是其迄今最先进的编码模型,推动能力与推理成本的帕累托前沿,在 FrontierCode 1.1 Main 上取得 50.0%、距 Fable 5.1 不到一个百分点而便宜 64%。
它是如何训练的?
Cognition 称 SWE-2 基于 2.8 万亿参数的 Kimi K3 后训练而来,官方称首次把强化学习扩展到万亿参数级规模,关键新增是可以一次 RL 运行同时训练全部推理强度档。
它的基准成绩如何?
Cognition 称 SWE-2 在 FrontierCode 1.1 Main 为 50.0%、DeepSWE 1.1 为 73.0%、Terminal-Bench 2.1 为 92.8%、Terminal-Bench 4 为 27.3%,相比 Kimi K3 在多项基准上再提升 5 至 6 个百分点。
它比上一代更省吗?
Cognition 称在 FrontierCode 1.1 Main 上,SWE-2 medium 得分高于 SWE-1.7,却少用 58% 的轮次、平均成本低 81%,中位仅 18 步就做出首次真实编辑,而 SWE-1.7 为 48 步。
我该如何使用 SWE-2?
Cognition 称 SWE-2 发布当日起在 Devin Desktop 与 CLI 提供,并陆续登陆 Devin Web 与 Fusion;它通过 Devin 产品提供,没有公开发布的独立 API 价格表,建议以完成任务的总成本来评估性价比。