人工智能 / 新闻摘要

Cognition 发布 SWE-2:用 Kimi K3 做基座,RL 后训练追平 Fable 5.1

Cognition 昨天发布了 SWE-2,一个从 Kimi K3(2.8T 参数)通过 RL 后训练而来的编码 Agent 模型。 它在 FrontierCode 1.1 Main 上拿到 50.0%,距离 Fable 5.1 的 50.9% 只差不到一个百分点,比 GPT-5.6 Sol(47.5%)高 2.5 分。价格比 Fable 5.1 便宜 64%。 FrontierCode 是 Cognition 自家维护的 SWE-bench 升级版。S...

展示SWE-bench基准测试的评估指南,包含软件工程任务量化指标图表
主题资料配图,非新闻现场照片 · 配图:swe-benchmark 综合评估指南:人工智能在软件工程任务中的表现量化

新闻摘要

Cognition 昨天发布了 SWE-2,一个从 Kimi K3(2.8T 参数)通过 RL 后训练而来的编码 Agent 模型。 它在 FrontierCode 1.1 Main 上拿到 50.0%,距离 Fable 5.1 的 50.9% 只差不到一个百分点,比 GPT-5.6 Sol(47.5%)高 2.5 分。价格比 Fable 5.1 便宜 64%。 FrontierCode 是 Cognition 自家维护的 SWE-bench 升级版。S...

来源信息

来源:OSCHINA 开源中国。本文同步 RSS 提供的摘要,完整内容请通过下方链接阅读原文。

原文发布时间:2026-09-11 02:26:50 UTC

资料与延伸阅读

你可以通过以下原始资料核对文中概念,并继续深入阅读。

  1. OSCHINA · 阅读原文
  2. 配图:swe-benchmark 综合评估指南:人工智能在软件工程任务中的表现量化
← 更多人工智能文章返回顶部 ↑