AI 快讯Cognition发布SWE-2,编程模型再冲前沿
模型上新

Cognition发布SWE-2,编程模型再冲前沿

2026-09-10T18:04:51.079Z
Cognition发布SWE-2,编程模型再冲前沿

Cognition 发布新一代 SWE-2 编程模型,目标是与 Fable 5.1、GPT-Astra 竞争前沿代码能力。它的真正看点不只是基准分数,而是能否在大型代码库、长任务和 Devin 工作流中减少人工接管。

Cognition 发布 SWE-2:AI 编程模型再战前沿代码能力

Cognition 发布了新一代 SWE-2 编程模型,并把竞争对手直接指向 Fable 5.1 和 GPT-Astra。对开发者来说,这不是一次普通的模型换代:SWE-2 的价值,取决于它能不能在真实代码库里持续完成任务,而不是只在一个排行榜上多拿几分。

**一句话判断:**SWE-2 值得关注,但现阶段更应该把它看成 Cognition 为 Devin 和企业级软件工程场景准备的能力升级,而不是已经被公开数据充分证明的“全能型”前沿模型。

Cognition SWE-2 模型与 Devin AI 编程工作流示意图

SWE-2 是什么?

**SWE-2 是 Cognition 面向软件工程任务训练的新一代闭源 AI 编程模型,重点处理代码理解、仓库检索、修改实现、测试验证和多轮调试。**它服务的不是简单的代码补全,而是更接近“给出目标,模型自己在代码库中完成一项工程工作”。

这类模型与传统 Copilot 式补全的差异,可以用“输入法”和“初级工程师”来类比:前者预测你下一行可能写什么,后者需要理解项目结构、定位相关文件、修改多个模块、运行测试,并在失败后继续排查。SWE-2 面对的正是后一类问题。

从 Cognition 的产品路线看,SWE-2 也并非孤立发布。此前公司已经通过 SWE-1.5、SWE-1.6 和 SWE-1.7 持续优化 Devin 的代码执行能力,包括更快的推理、更高效的工具调用,以及面向大型代码库的检索能力。SWE-2 的发布,意味着 Cognition 正在把模型本身、代码索引和代理工作流进一步绑定。

这次更新,重点不只是“模型更聪明”

**SWE-2 的核心竞争力,是让模型在长链路软件工程任务中更少迷路、更少反复调用工具,并更快收敛到可验证的结果。**对 AI 编程而言,单次生成一段看起来正确的代码并不难,难的是让代码真正适配已有系统。

一个真实任务通常包含以下步骤:

  1. 理解用户需求和现有约束;
  2. 在数十万甚至数百万行代码中找到相关模块;
  3. 判断修改会影响哪些接口和测试;
  4. 生成补丁并运行测试;
  5. 根据错误日志继续修改;
  6. 检查是否引入回归问题。

模型只要在其中一个环节判断错误,后面的工作就可能变成“越修越坏”。因此,SWE-2 的评价不能只看它是否能写出一段漂亮代码,还要看它能否维持任务状态、准确使用工具,并在失败之后有效恢复。

Cognition 此前披露的 SWE-1.6 经验已经说明了这一点:模型通过更多并行工具调用、减少无效循环、更多依靠专用工具而不是反复执行终端命令,改善了代理运行体验。SWE-2 如果延续这条路线,那么它的升级方向更像是“工程流程优化”,而不只是扩大参数规模。

与 Fable 5.1、GPT-Astra 的竞争意味着什么

**SWE-2 被放进 Fable 5.1 和 GPT-Astra 的比较框架,说明 AI 编程模型的竞争已经从代码补全转向完整的软件工程代理能力。**过去开发者会问“哪个模型写 Python 更好”,现在更实际的问题是“哪个模型能在我的仓库里连续工作两个小时,并且最后交付可审查的改动”。

| 模型 | 发布方 | 主要定位 | 当前可确认信息 | 适合关注的指标 | |---|---|---|---|---| | SWE-2 | Cognition | 软件工程与 Devin 代理工作流 | 官方发布新模型,目标对标前沿代码模型 | SWE-Bench Pro、长任务成功率、人工接管次数 | | Fable 5.1 | Fable | 前沿代码与复杂推理 | 被 Cognition 列为对比对象 | 复杂仓库修改、调试稳定性、工具使用效率 | | GPT-Astra | OpenAI | 通用前沿模型与代码任务 | 被 Cognition 列为对比对象 | 综合推理、代码生成、代理执行能力 | | SWE-1.6 | Cognition | SWE-2 的前代技术路线 | SWE-Bench Pro 官方披露为 50.4% | 速度、工具调用、任务完成率 |

需要特别注意的是,目前参考资料没有给出 SWE-2 完整的基准分数、上下文窗口、定价、推理速度和具体开放方式。因此,不能把“对标 Fable 5.1 和 GPT-Astra”直接写成“已经全面超过”。这只是产品定位和竞争对象,不等于独立测试结论。

为什么 SWE-Bench Pro 仍然重要,但不能只看它

**SWE-Bench Pro 是评估 AI 编程模型真实修复软件问题能力的基准之一,但它不能完全代表开发者每天面对的工程工作。**这类基准通常要求模型处理真实项目中的 issue,修改代码并通过测试,比生成孤立函数更接近生产环境。

参考资料显示,Cognition 此前披露 SWE-1.6 在 SWE-Bench Pro 上的成绩为 50.4%,并且通过 Cerebras 推理基础设施实现了最高约 5 倍于 GPU 推理的速度提升。这里有两个值得拆开的维度:

  • **能力维度:**模型能否找到正确文件、理解项目约束并提交通过测试的修改;
  • **效率维度:**模型完成同一任务需要多少时间、多少 token 和多少次工具调用。

一个模型即使成功率更高,如果每个任务都要等待数十秒、反复生成无效补丁,开发者也未必愿意使用。反过来,一个速度很快但经常修改错误文件的模型,同样无法进入严肃生产流程。SWE-2 的真正竞争力,应该是成功率、延迟、成本和人工复核负担的组合,而不是单一跑分。

大型代码库才是 Cognition 的主战场

**大型 monorepo 是 AI 编程代理最容易暴露差距的场景,因为问题不在于“会不会写代码”,而在于能不能快速建立代码库地图。**在一个几千文件的小项目里,普通模型也许可以依靠全文搜索完成任务;但在拥有 50 万个文件、多个服务和复杂依赖关系的企业代码库中,盲目搜索会迅速耗尽上下文。

Cognition 此前介绍过 SWE-grep,这套代码检索层并不是简单的向量数据库,而更接近一个学习型的编译器索引。它的目标是让代理更快回答三个问题:某个功能在哪里实现、哪些文件与当前问题相关、修改一个接口可能影响哪些调用方。

这种检索能力对小型项目的提升可能并不明显,开发者甚至感觉不到差异;但对大型企业仓库,它可能决定代理是几分钟找到正确路径,还是在无关文件中来回尝试。模型能力和检索系统因此不能完全分开看,SWE-2 的效果很可能来自两者的协同。

Cognition 还曾通过 Codemaps 将代码库转换成带有 AI 标注的可视化结构。Codemap 不是普通目录树,而是帮助开发者和代理理解模块关系、入口、调用链与业务边界的导航层。模型如果能在执行任务前获得更可靠的结构信息,就不必把大量上下文浪费在重复探索上。

对 Devin 用户意味着什么

**对 Devin 用户而言,SWE-2 最直接的价值是减少从“提出任务”到“人工接管”之间的中断。**如果模型只能完成单文件修改,它更像高级自动补全;如果它能连续阅读 issue、检索仓库、实现功能、执行测试并解释变更,它才更接近可委派的软件工程代理。

SWE-2 适合优先测试以下任务:

  • 跨多个模块的 API 或数据结构迁移;
  • 根据 issue 定位并修复已有 bug;
  • 为旧代码补充测试并处理测试暴露的问题;
  • 更新依赖后解决兼容性错误;
  • 对大型仓库进行代码搜索、影响面分析和小范围重构。

不适合直接完全放权的任务则包括安全边界修改、支付和权限逻辑、数据库不可逆迁移,以及缺乏自动化测试的核心业务改动。模型再强,也不能替代代码审查、灰度发布和回滚机制。

开发者应该怎样评估 SWE-2

**评估 SWE-2 的正确方法,是用自己的真实仓库建立任务集,而不是只比较宣传页上的最高分。**建议至少记录以下指标:

  1. 一次通过率:第一次提交是否通过测试;
  2. 最终成功率:允许模型修复后,任务能否完成;
  3. 首次有效修改时间:从任务开始到第一次产生正确补丁需要多久;
  4. 人工接管次数:开发者需要介入多少次;
  5. 回归缺陷率:通过原有测试后是否破坏其他功能;
  6. 代码审查成本:人类理解和确认改动需要多少时间;
  7. 复杂任务稳定性:任务持续 30 分钟、1 小时后是否仍能保持目标。

如果一个模型只在简单 issue 上表现出色,但一遇到跨模块依赖就频繁重写,那么它更适合个人开发辅助,而不是团队级自动化。反之,如果它能稳定处理中等复杂度的迁移和调试任务,即使基准分数不是最高,也可能更适合企业落地。

价格、速度和开放方式仍需等待更多信息

**截至 2026 年 9 月 10 日,公开参考资料尚不足以确认 SWE-2 的具体价格、上下文窗口、推理速度、可用地区和独立基准测试结果。**这些信息会直接影响它与 Fable 5.1、GPT-Astra 以及其他代码模型的实际竞争力。

Cognition 过去强调 SWE-1.6 的高速推理和 Devin 内部体验优化,但 SWE-2 是否采用相同基础设施、是否向独立开发者开放、是否只在 Devin 中提供,目前都不能仅凭发布标题推断。开发者在选择之前,应等待官方模型卡、评测方法、限制条件和实际使用条款。

这也是 Cognition 当前叙事中最需要补齐的一块:模型能力可以用演示吸引注意力,但企业采购最终要看可重复的评测、数据安全、权限控制、审计记录、代码不外泄承诺以及出现错误后的责任边界。

OpenAI Hub 观点:SWE-2 的胜负在“完成工作”

SWE-2 的最大看点,不是它能否再造一个更会写代码的聊天机器人,而是 Cognition 能否把模型、代码检索和代理执行整合成稳定的工程生产力。

AI 编程产品已经进入第二阶段。第一阶段比的是谁能生成更像样的代码;第二阶段比的是谁能在真实仓库里持续行动,并把结果交给开发者审查。前者主要是模型能力,后者还涉及上下文管理、工具编排、检索质量、测试闭环和失败恢复。

如果 SWE-2 只带来更高的公开跑分,它会成为又一个值得关注的模型版本;如果它能在大型 monorepo 中减少无效搜索、降低人工接管次数,并让 Devin 更稳定地完成跨文件任务,那么 Cognition 才真正建立起区别于通用大模型的产品壁垒。

目前最稳妥的结论是:SWE-2 值得进入开发团队的候选测试名单,但不应在完整评测之前被视作已经击败 Fable 5.1 或 GPT-Astra。对开发者来说,最有价值的下一步不是追逐发布会上的“前沿”标签,而是把它放进自己的代码库,用真实 issue 测量它到底能替你完成多少工作。

参考来源

注:SWE-2 的完整基准分数、价格、上下文窗口和开放范围,应以 Cognition 后续发布的模型卡与独立评测为准。

相关推荐

查看全部