互联网

国家代表AI,“配分设计”失利……AAII榜首Motif遭淘汰的悖论 [Kim Hyun-ah的《解读IT世界》]

AAII得分为47分,尽管基准指数为24.6分、专家指数为27.1分,但 用户评分14.1分,未通过……综合评分65.8分 专家与用户评分(60分) 更重视“易用性”而非技术实力 “‘读破莫’项目的宗旨是什么?”

Kim Hyun-ah
2026-08-18 16:44:45
[E-DailyKim Hyun-ah 记者] 看到自主AI基础模型(独基模)的第二次评估结果时,我首先想到的是:“这真的对吗?”

这是因为Motif Technologies——在受政府委托、由全球AI模型评估机构Artificial Analysis(AA)实施的人工智能综合指标(AAII)评估中获得47分,位列韩国企业第一、全球第十——最终却未能晋级。

另一方面,在AAII中获得31分的LG Corp.(003550) 人工智能研究院则晋级了第三轮评估。Upstage获得37分,SKTelecom(017670)获得35分。


不过,从《每日经济》获得的详细评估结果来看,Motif被淘汰的背景更加清晰。

Motif在基准测试中获得24.6分,在专家评估中获得27.1分。但在用户评估中仅得14.1分,其中专业用户评估为8.4分,普通公众评估为5.7分。

综合得分65.8分。在衡量全球技术实力的AAII评估中,Motif虽领先于所有国内竞争对手,但用户评价中的劣势最终导致其被淘汰。

政府方面也解释称,虽然Motif的技术实力出众,但在易用性和实际应用性方面获得的评价相对较低,这也是导致其被淘汰的原因之一。

既然如此,不得不问:

“独破模”项目的本质究竟是什么?是寻找能够开发世界级基础模型的企业,还是选出当下应用最广泛的人工智能技术?

来源=科学技术信息通信部

AAII 47分在最终评估中仅得11.75分
“Dokpamo”评估由基准测试40分、专家评估35分、用户评估25分组成,总分100分。其中,AAII在基准测试40分中占25分。

AAII原始分数分别为:Motif 47分、Upstage 37分、SK电信 35分、LG AI研究院 31分。

按25分满分换算,Motif得11.75分,Upstage得9.25分,SK电信得8.75分,LG得7.75分。

在AAII原始得分中,Motif与LG的差距为16分。但在最终评估中,这一分差缩小至4分。加上NIA评估的15分,基准评估总分即为40分。

这种机制使得即使在全球技术实力评估中存在较大差距,在最终评估中该差距也会大幅缩小。

另一方面,专家评估35分和用户评估25分等共计60分,不仅取决于模型本身的性能,实际应用价值和影响力等因素也起着重要作用。

此次Motif的案例充分展示了这种评分结构对结果的影响之大。

一位AI专家针对此次评估结果表示:“结果完全取决于实际可用性得分,这难道是应该这样吗?”并由此质疑了“独破莫”项目的初衷。

他特别指出:“如果要提高易用性,直接使用开放权重模型就行了”,并强调易用性只是在模型性能达到一定水平后才需额外考虑的因素。

[E-Daily 文承勇 记者]

“易用性”是模型开发的核心吗
? 当然,这并非意味着易用性与实用性评估本身有错。

验证技术能力能否真正应用于实际服务和产业现场,在国家AI项目中也至关重要。问题在于其权重。

“易用性”好并不一定意味着模型本身的性能就出色。因为这取决于在模型之上构建了什么样的服务环境和工具,即所谓的“harness”。

反过来说,如果基础模型的性能已达到世界级水平,那么如何将其服务化,也可以视为后续的课题。

特别是像Motif这样仅凭30余名员工就打造出全球级模型性能的初创企业,与拥有大规模组织和客户基础的竞争对手,是否应以同一标准来评估其应用性,这一点也值得探讨。

在本次第二轮评估中,影响力和贡献计划的分值也从原来的10分提高到了15分。

关键在于,这并非要得出“Motif被淘汰不公”的结论。

在AAII评估中,即便是全球顶尖模型也难以超过50分,而Motif以47分证明了其全球竞争力,但其模型却因用户评估仅得14.1分而被淘汰——这种评分结构究竟是否符合“解码模拟”项目的初衷?

更何况,在总分100分中,专家评估35分和用户评估25分等共计60分,属于受定性判断影响较大的领域。

既然权重如此之高,就应当公开评估标准、具体项目、各评委的评分以及最终换算方式。只有这样,才能验证在哪些项目上“Motif”与竞争对手的分数拉开差距,以及这一差距对最终淘汰结果产生了多大影响。

当务之急不是“企业救济”,而是评估验证
科学技术信息通信部已将第二轮评估结果通知各企业,并计划开展异议申诉和说明程序。

Motif同样需要通过这一程序,核查基准测试、NIA、专家及用户评估的原始分数和详细计算公式。

如果评估没有问题,政府直接公开即可。反之,如果存在企业难以预先预测的评分细则或评估标准,则应予以改进。

也没有必要将此次争议仅视为Motif与LG的胜负问题。

在今后将投入数百亿韩元乃至数万亿韩元税款的国家AI项目中,究竟应多大程度上重视技术实力,又应在多大程度上体现易用性和实用性,这属于政策层面的选择。

不过,评分标准直接决定了项目的方向。

如果一边声称要打造世界级的基础模型,实际却形成了一种结构——即使用体验的评估比模型性能对结果产生更大的影响,那么就必须重新审视:这项国家AI项目究竟是为了什么。

企业必须能够相信评估标准并据此制定开发战略,而在结果出炉后,任何人都能对结果进行验证。

国家代表级AI项目所需要的,是让致力于打造世界级模型的企业能够信任并参与竞争的评估机制。

在此次“独破模”争议中,真正需要反思的并非Motif被淘汰这件事本身,而是导致其淘汰的“评分设计”是否真的符合“独破模”的初衷。

Economy

Corporation

IT·Science

Economy

“要让代币证券真正运作……机构应发挥提供流动性和应对监管的作用”

有观点指出,要使代币证券发行市场在制度建设的基础上真正运转起来,金融机构必须作为负责流动性、结算及应对监管的主体挺身而出。据解释,即使法律通过了,证券也不会自动在链上进行交易。 Heski RWA首席执行官安娜·刘(Anna Liu)于2日在首尔汝矣岛韩国交易所举行的“2026 E-Daily STO峰会”上,以“构建代币证券生态系统:从制度框架到实际市场”为主题发表演讲。(照片=金泰亨记者…
2026-10-05 23:11:04

Corporation

“5万家便利店时代”……凭借特色门店一决高下

便利店行业正在扩大各公司针对特定商品类别进行强化后的特色门店。鉴于韩国国内便利店数量已超过5万家,市场已趋于饱和,因此各企业不再单纯追求增加门店数量,而是以主打消费者需求旺盛的特色商品的特色门店为中心,展开开店战略。 CU健康功能食品主题门店。(图片来源:BGF零售) 据产业通商部5日公布的数据,截至今年8月,韩国便利店行业的总门店数达到5万3475家。与去年年底的5万3266家相比,增长了…
2026-10-05 11:05:53

IT·Science

三星、SK、韩美成为亚太制药与生物科技领域“大交易”的主角

(图表来源:Chat GPT) 在今年亚太地区制药与生物技术市场最具影响力的10笔交易中,有3笔涉及韩国企业。三星生物制药和SK生物制药作为收购方从海外企业手中获取了资产,而韩美制药则作为技术供应商,因出口新药候选物质而榜上有名。据韩国生物协会生物经济研究中心5日透露,生物制药专业媒体BioPharma APAC从今年1月1日至9月23日期间达成的交易中,评选出了对亚太市场影响最大的10宗…
2026-10-05 17:19:01