DIGITIMES

AI评测,一直是门好生意

徐宏民
2026-10-02

新模型每隔几周就有一批,哪一个比较好,很多时候看的是排行榜。

排行榜背后的评测,表面上是订规则、跑數據、比分数的学术活动。但拉长时间看,办一场公开评测,或是在里面拿到好名次,一直是门好生意,只是每个年代收钱的人不太一样。

我在2002到2007年于哥伦比亚大学攻读博士,研究主题是影像与视讯查找,亲身参与多年美国国家标准暨技术研究院(NIST)主办的TRECVID年度评测。每年,全球数十个研究团队各自送出系统,针对同一批影片、同一套题目测试,排名公开。这项评测的赞助单位包括美国国安体系的研究机构,在当时的研究圈里,排名也会直接影响团队后续争取研究经费,美国的顶尖研究团队都很认真看待每一次评测。

2006年,Netflix把自家的推荐演算法问题公开悬赏,只要有人能把预测误差比现有系统降低10%,就拿走100万美元奖金。一家公司把核心演算法问题公开交给外界解决,在当时相当少见。公司不必先知道谁解得出来,只要把问题和验收标准定清楚,达标才付钱。2009年,奖金由一支跨团队组成的队伍拿下。

在Netflix之后,愈来愈多公司把竞赛当成向外找解法的管道。2010年成立、2017年被Google收购的Kaggle,把这套模式做成一个平臺。任何公司都能把數據放上去、定好评分方式、提供奖金,换取全球數據科学家帮忙解题。奖金之外,排名本身也成了参赛者的履历,有些公司会直接从排行榜上找人。

2010年开始举办的ImageNet影像分类竞赛,则提供一个研究团队普遍认可的公开基准。2012年底,一支使用卷积神经網絡(CNN)的队伍把错误率大幅拉低,这个结果后来常被视为深度学习时代的起点。但在当时,不少资深的电脑视觉学者并不认同,甚至抱持怀疑的态度。直到接下来两年,一系列CNN方法在ImageNet上连续大幅跃进,他们才陆续接受并投入。ImageNet让影像識別的「进步」第一次有了公开、可验证、逐年比较的衡量方式,數據也开放给全世界的研究社群,不必参赛就能使用。说服学界的,是这些每年公开、任何人都能验证的结果。后来的AI评测排行榜,大多沿用这个形式。

2013年10月,微软研究院与自家的查找引擎Bing联合办了一场影像查找的公开竞赛,奖金1万美元。我的一组学生就为了这1万美元报名参加,最后真的拿到全球第一名。那年5月,我们原本用的是传统的电脑视觉特征,测试时偶然换上CNN撷取的特征,准确率大幅跃升。当时CNN刚在ImageNet崭露头角,还没普及到各个电脑视觉题目,我们算是提早一步,在自己的研究上验证这个转折点。当下,我们决定把研究典范转到CNN,并把各种经费拿去买GPU,也引起NVIDIA注意,促成2016年9月开始和NVIDIA合作成立NVIDIA AI Lab。

近年臺湾也有不少企业与政府单位举办AI竞赛。比赛一多,顶尖团队会挑著参加。如果要办,奖金额度,以及主办单位的影响力,往往是能否吸引到好团队的决定点。

2023年,柏克莱大学一组研究生与教授推出Chatbot Arena网站,让使用者同时对两个匿名大语言模型提问,投票选出比较好的回答,再用这些真人偏好算出模型排名。2025年4月,这个研究转为新创LMArena,不到1年估值就来到十几亿美元,在新创圈相当受瞩目。前面几个例子,付钱的都是出题的一方。LMArena收钱的对象,反过来是被排名的一方。各家AI实验室付费取得私有、不公开的测试环境,或是付费使用LMArena的评测工具与數據产品,来验证自家还没发表的模型。

测试平臺成了关键數據的供应商。

METR的做法不同。这个2023年底独立的非营利组织,专门替各家前沿模型做部署前的安全评测。METR主要看的是「任务时长」,也就是AI代理人能以特定成功率,独立完成多长时间的人类专家任务,如今是业界衡量AI能力进步的常用指标之一。METR表示不接受被评测实验室的捐款,资金主要来自慈善基金会与个人,2026年8月公布过去半年募得逾7,000万美元的资金承诺。被评测的实验室仍会提供免费的运算额度,供METR评测使用。

从TRECVID到METR,评测的形式换了好几次,排名一直影响经费与人才的流向。如今LMArena与METR的评测结果,还会影响模型往哪个方向改进、外界如何评价一个模型,甚至企业的商业决策。被评分的前沿模型公司愿意付钱或提供运算额度,换取一个外界相信的分数。影响力愈大,评测单位的公信力就愈重要,也愈被放大检视。

当AI进步的速度超过我们判断好坏的速度,掌握「分数是怎么被决定的」,可能就跟做出被评分的模型一样有价值。

台灣大學信息工程学系教授,曾任富士康集团与Stellantis合资车用科技公司技术长暨副总经理,推动ADAS及智能座舱系统产品进入全球车用市场。纽约哥伦比亚大学电机博士,专精于机器学习、电脑视觉、自驾车、机器人等领域。为讯连科技研发团队创始成员,慧景科技(thingnario)共同創始人,NVIDIA AI Lab計劃主持人;曾任IBM华生研究中心及美国微软研究院客座研究员。担任多家科技公司AI策略顾问,习惯从学术与产业双重视角检验技术发展的机会与挑战。
智能应用 影音