Cognition 把代码模型价格砍到四分之一:写代码这活儿要变水电费了

4次阅读

Cognition 刚刚发布了 SWE-2,在编程模型这块又往前迈了一步。它在 FrontierCode 1.1 Main 基准上拿到 50% 的分数,跟 Fable 5.1 只差一个百分点,但价格便宜 64%。

一个 AI 写代码的工具,凭啥让整个行业紧张?因为它跑出来一个数据:SWE-2 比上一代 SWE-1.7 在多项基准上高出 5-6 分,而且推理成本压到对手的四分之一。它跟 GPT-5.6 Sol 和 Fable 5 在能力上打个平手,价格却只要人家的零头。

便宜不是白来的

SWE-2 背后是一套新的训练思路。Cognition 用的是 Kimi K33 这个 2.8 万亿参数的底座,然后在强化学习阶段做了件事:把所有推理力度(从轻量到深度)在一次训练里全部覆盖。

这意味着你不用为不同任务切换模型。SWE-2 medium 适合简单活,见招拆招;SWE-2 high 适合中等复杂度,会先做规划;SWE-2 max 留给硬骨头,花多少资源走多少推理。

关键的数据是:SWE-2 medium 在 FrontierCode 上比 SWE-1.7 分数更高,但读的代码少了 58%。它在动手写之前就想明白了,所以少绕弯路。

强化学习的边界

这套训练法核心是给模型发「工资」时加上成本惩罚。模型每多读一行代码、多调一次工具,工资就被扣一笔。强化学习的目标函数长这样:R = 成功奖励 - 推理成本 × 成本系数。

听起来反直觉——明明是要把代码写对,为啥要把成本塞进奖励里?原因很简单:你能跑得起的智能,才是真智能。

Cognition 的做法更精细。他们算出了每个推理力度对应的「帕累托斜率」,然后把成本系数 λ 设为这个斜率。这样模型在不同档位上,会自动在「算得更准」和「算得更省」之间找最优解。

AI 写代码的赛点

Cognition 这家公司的核心产品是 Devin,一个能独立完成编程任务的 AI 工程师。SWE-2 已经接入到 Devin Desktop、命令行、网页版、还有他们的代码评审工具 Fusion 里。

你想想看:以前一个企业想养一支软件工程师团队,招人、买工位、发工资,几十万美元起步。现在同样的活,AI 干得可能更快、更便宜,而且不请假、不摸鱼、不跳槽。

当然,AI 写代码目前还做不到 100% 准确。SWE-2 高分归高分,真到了大型生产代码库,该翻车还是翻车。但价格摆在这里,差距缩到四分之一,大部分企业会先用起来再说。

写代码不再稀缺

这件事最直接的影响是:初级程序员的需求会开始萎缩。

不是说初级岗位消失,而是原本需要 5 个初级干的活,现在可能 2 个高级加 AI 就能搞定。那些「写写测试、改改 bug」的活,正在被模型消化。

相反,能定义清楚问题、设计架构、把 AI 输出整合进生产环境的人,会更值钱。

Cognition 把 SWE-2 当作「把模型推到前沿」的尝试。50% 的基准分不是终点,但四分之一的价格是行业拐点。当模型能力和价格同时跨过某条线,剩下的就是规模问题了。

你不需要懂强化学习,只需要知道一件事:写代码这件事,正在从手艺活变成水电费——按量计费,人人用得起。

正文完
 0