程世嘉:点亮主权AI落地关键 iKala推繁中评测TMMLU+
生成式AI竞赛进入下半场。当模型能力快速拉近,真正的竞争正从「谁有最大的模型」,转向「谁能让AI 真正落地」。iKala共同创始人暨董事长程世嘉(Sega)认为,台湾谈主权AI,不能只停留在打造自己的 Foundation Model,而应重新思考:从算力、模型、数据到应用,我们究竟掌握了多少自主能力?
程世嘉将主权AI拆成四个环节:算力、模型、数据、应用。算力决定AI能否运转,模型决定能力边界,数据决定AI如何理解我们,而应用则决定技术最终能否创造价值。
2023年台湾产官学界纷纷投入Foundation Model,程世嘉带领iKala从另一个问题出发:如果每个人都在造模型,谁来定义模型究竟好不好?
这个问题在AI走向垂直化后更加重要。Gartner预测,到2030年,高达90%的生成式AI解决方案,都将采用领域特定模型(Domain-Specific Models;DxM)。企业未来面对的,不再是少数大型模型,而是大量针对不同产业、任务与场景打造的AI。
对程世嘉而言,这正是主权AI的关键:台湾不只要使用全球最先进的模型,更要有能力用自己的数据与标准,判断模型懂不懂我们的语言?理解我们的产业吗?能不能完成我们要它做的事?
从「造模型」到「造尺」,把AI的定义权留在台湾
这也是TMMLU+出现的背景。当市场竞逐繁体中文模型,iKala选择「不做选手,先做量尺」。TMMLU+ v1收录22,690道题目、横跨66个科目,规模是前代TMMLU的6倍,研究成果正式发表于COLM 2024,后续也被Google、Meta等国际研究团队纳入繁体中文模型评测。「我们把它开源,其实就是希望无私地开放给大家使用。」
程世嘉认为,一个健全的AI生态系需要共同遵循的规则。TMMLU+因此不只服务iKala,更希望让产业与学界共同使用、验证与改善,让一套从台湾出发的评测标准成为生态系共享的基础。
这也让「原生数据」成为关键。TMMLU+并非单纯搬运或重新包装网络内容,而是投入时间理解在地情境、萃取内容、校正框架,并持续检查数据品质。因为模型「会说中文」,不代表真正理解台湾的法律制度、文化脉络与生活经验。
尤其当AI逐渐成为查找、决策与信息取得的新入口,繁体中文在全球AI生态中的相对弱势,也不再只是语言问题,更关乎台湾的数据自主。唯有持续累积可信的在地原生数据,台湾才有能力建立自己的评测标准,定义什麽是适合台湾的AI。
从「会回答」到「会做事」,企业要的是能落地的AI
当AI从聊天走向Agent,评测的问题也从「答得对不对」,变成「事情做不做得成」。
企业真正头痛的不是没有模型可用,而是投入时间与花费数百万预算完成PoC后,才发现模型不理解繁中语境、不符合在地规范,或实际工作流程的表现与公开Benchmark高分存在落差。因此,iKala也将评测从 LLM Evaluation延伸至Agent Evaluation。
下一阶段iKala不只测AI「会不会回答」,更要测它「会不会做事」——能否理解意图、正确使用工具、处理文字、图片、声音等多模态信息,并完成企业交付的任务。
这也让评测从技术跑分走向企业决策。当市场从「一个通用模型」走向「多个垂直模型」,企业真正需要的,不见得是全球跑分最高的AI,而是在自己的数据、场景与成本条件下,最适合自己的AI。
程世嘉表示:「我们希望TMMLU+成为台湾定义AI能力、建立产业信任的共同基础。」TMMLU+也已推出v1.1(Huggingface/Github),重新审视既有66个领域,更新具有时效性的法律、社会与政令题目,持续维持评测有效性。
当世界的模型不断改变,台湾真正需要留在手上的,是自己的数据与标准,以及选择、衡量与定义AI的能力。更多信息。








