聊天AI之父跑出来"砸场子":不会写一句话的新模型,把ChatGPT打趴了

7次阅读

一个造ChatGPT的人,出来做了一个不会写一句话的AI。

这事听起来像个冷笑话,但它是真的。

上周,OpenAI前研究员保罗·阿尔梅达(Paulo Almeida)带着他的新模型Jev回归。这个人当年在OpenAI一手打造了ChatGPT,还顺手发明了RLHF——就是现在所有大模型都在用的"人类反馈强化学习"。

结果他离开OpenAI两年后,做出的产品不是更大、更能聊的AI,而是一个彻底不聊天的AI。

Jev不输出文字,只输出概率。它告诉你的是"这件事有87%的概率是A,13%是B",而不是给你写一段漂亮的回答。听起来很反直觉对吧?但Vercel和Bryo AI用它替换了ChatGPT和Gemini,跑得更快、花钱更少、结果还更准。

Vercel的工程师普拉尼特·夏尔马实测,把原本跑在ChatGPT Luna上的安全审查分类器换成Jev,速度直接快了5到18倍。Bryo AI的CTO尼基尔·穆德霍尔卡测了一个邮件分类场景,Gemini准确率稍高一丢丢,但价格贵了10到20倍。

最让他兴奋的还不是价格,是Jev会老老实实告诉你"我有80%的把握"。穆德霍尔卡原话:"它是唯一一个会真的给你返回概率的模型,做自动化工作流简直绝了。"

换句话说,ChatGPT花50块钱干的事,Jev花1块钱干得差不多,告诉你"嗯,我觉得是这样"。

为什么要做一个"哑巴"AI?

阿尔梅达给TechCrunch的原话很扎心:"我们把闪电装进了瓶子里,结果发现它根本没用。我花了几年才想明白,问题在于我们一直在优化人类语言——人类语言对计算机来说是外语。"

这是一个造了ChatGPT的人,反过来否定ChatGPT的底层逻辑。

他把Jev叫做"系统一模型"——心理学里那个不用思考、凭直觉判断的脑区。系统一不写小作文,不解释前因后果,只做一件事:这个是A还是B。

具体怎么做到的,阿尔梅达没说。但外界普遍猜测它是在某个开源大模型基础上改造的,训练方法被他叫做"基于校准决策的强化学习"。他训练Jev只用了合成数据,没有任何真实抓来的内容。这一点他很自豪:"我们公司一半人就是一个专门搞合成数据的实验室。这是我这辈子最成功的赌注之一,比RLHF还成功。"

Jev这个名字也很有意思。它来自19世纪经济学家威廉·斯坦利·杰文斯(William Stanley Jevons),杰文斯悖论讲的是:煤炭用得越省,反而消耗得越多,因为省下来的成本让更多地方用上了煤。

阿尔梅达想表达的逻辑一样:当AI的决策成本暴跌,会被部署到所有需要判断的地方,而不是只用在最贵的那几个场景里。

开发者为啥挤爆了门

Jev刚上线那天,TypeSafe的API被涌进来的请求挤崩了,临时挂了。原因很简单:

(1) 输出免费,输入按十亿token计量,不是百万

(2) 因为用户提前定义了输出选项,它永远不会胡说八道

(3) 同样的分类任务,速度比ChatGPT快5到18倍

这三个特点加在一起,做企业自动化的人眼睛都亮了。

开发者社区还发现了一个隐藏用法:Jev可以当LLM的"监工"。大模型之间互相监督成本太高,用Jev做这个角色就便宜到可以常驻后台。阿尔梅达说,已经有客户用Jev盯着大模型代理的调用记录,防止越狱。

开源模型工具Pi的CTO阿尔明·罗纳彻还提了一个方向:模型路由。让Jev先看一眼任务,决定这个活儿该派给便宜的小模型还是贵的大模型。他说:"以前大模型补贴得太狠,大家懒得动脑子想这事。"

潜台词是:等Jev这种便宜决策模型普及,AI应用的成本结构会被彻底改写。

AI圈的下一个爆点

Jev不是第一个跳出"语言模型"框架的产品,但它是第一个把这事做对的产品。

过去几年,AI公司都在比谁的模型更大、谁的话更多、谁更像人。结果呢?90%的企业付费场景根本不需要AI陪聊,需要的是快速、便宜、可靠的判断。这部分市场一直没人正经做。

TypeSafe的赌注是:未来不会是一个超级AI统治所有人,而是无数个便宜、专一的小决策模型,像早年的互联网一样,长在每个角落。

阿尔梅达说:"前沿实验室卖的是恐惧和炒作。我们的产品想卖的是智能本身。"

这话从一个亲手打造了ChatGPT的人嘴里说出来,分量不一样。

他赌的是,AI的下半场不在聊天里,而在判断里。

而判断这件事,人类语言天生就干不好——计算机用的是概率和数字,不是句子的逻辑。

那个靠堆参数、堆数据、堆显卡就能赢的时代,可能真的要结束了。

正文完
 0