AI评测正在成为一门大生意:市场规模10年涨8倍,10个人半年做出60亿ARR

5次阅读

以前,AI评测就是个副业。实验室发个榜单,开发者瞄两眼,没人靠这个赚钱。

现在不一样了。

根据市场研究机构Precedence Research的数据,2025年全球AI模型评测和基准测试工具市场规模为11.5亿美元。到2035年,这个数字将膨胀到95.7亿美元——十年涨8倍。

钱已经开始流动了。

2026年1月,LMArena(就是以前的Chatbot Arena)宣布完成1.5亿美元A轮融资,估值17亿美元。这家从加州大学伯克利分校剥离出来的公司,成立不到一年,估值就已经翻了三倍。它的模式很简单:用户输入一个提示词,两个匿名AI模型同时作答,用户投票选出哪个更好。数百万次对比投票喂出一个类似国际象棋排名的Elo评分系统,成了全球AI实验室、企业采购和媒体引用最多的排行榜。

LMArena的付费产品上线四个月,就产生了3000万美元的年经常性收入,月活跃用户覆盖150个国家,超过500万人。

8月3日,类似的故事又在另一个垂直领域重演。DesignArena背后的公司Intelligence宣布完成790万美元种子轮融资,由Index Ventures领投,Conviction、a*和Y Combinator跟投。这家10人团队的公司,半年内把年经常性收入从500万美元做到了6000万美元,用户覆盖190多个国家,550万人。DesignArena的玩法跟LMArena类似,但针对的是视觉和设计输出——企业端才是真正的金矿,前沿实验室愿意为用户生成的偏好数据付费。

但不是所有玩家都能活下来。Yupp.ai在2026年3月关门了。这家公司从a16z crypto拿了3300万美元,最终因为找不到产品市场契合点而倒闭。

与此同时,传统基准测试正在失去公信力。"Benchmaxxing"已经成为AI行业的专有名词——实验室不再真正提升模型能力,而是针对评测数据微调、在评估节点上挑拣拣拣、利用评分格式的漏洞来刷榜。

2025年底,一项研究分析了LMArena的280万条对比记录,发现Meta、OpenAI、Google、亚马逊等公司都在钻空子:它们在内部运行私人测试,然后只提交表现最强的模型版本。这种做法人为地把分数推高了最多100个Elo积分。

更离谱的是,2026年4月,一个AI智能体在八项主流基准测试中的七项拿到了100%或接近满分——但它实际上连一道题都没真正解决,而是利用了评测基础设施本身的漏洞。

AI评测行业正在从学术游戏变成资本战场,但这场游戏的规则还没有被真正建立起来。

正文完
 0