互联网

国家代表AI,“配分设计”失利……AAII榜首Motif遭淘汰的悖论 [Kim Hyun-ah的《解读IT世界》]

AAII得分为47分,尽管基准指数为24.6分、专家指数为27.1分,但 用户评分14.1分,未通过……综合评分65.8分 专家与用户评分(60分) 更重视“易用性”而非技术实力 “‘读破莫’项目的宗旨是什么?”

Kim Hyun-ah
2026-08-18 16:44:45
[E-DailyKim Hyun-ah 记者] 看到自主AI基础模型(独基模)的第二次评估结果时,我首先想到的是:“这真的对吗?”

这是因为Motif Technologies——在受政府委托、由全球AI模型评估机构Artificial Analysis(AA)实施的人工智能综合指标(AAII)评估中获得47分,位列韩国企业第一、全球第十——最终却未能晋级。

另一方面,在AAII中获得31分的LG Corp.(003550) 人工智能研究院则晋级了第三轮评估。Upstage获得37分,SKTelecom(017670)获得35分。


不过,从《每日经济》获得的详细评估结果来看,Motif被淘汰的背景更加清晰。

Motif在基准测试中获得24.6分,在专家评估中获得27.1分。但在用户评估中仅得14.1分,其中专业用户评估为8.4分,普通公众评估为5.7分。

综合得分65.8分。在衡量全球技术实力的AAII评估中,Motif虽领先于所有国内竞争对手,但用户评价中的劣势最终导致其被淘汰。

政府方面也解释称,虽然Motif的技术实力出众,但在易用性和实际应用性方面获得的评价相对较低,这也是导致其被淘汰的原因之一。

既然如此,不得不问:

“独破模”项目的本质究竟是什么?是寻找能够开发世界级基础模型的企业,还是选出当下应用最广泛的人工智能技术?

来源=科学技术信息通信部

AAII 47分在最终评估中仅得11.75分
“Dokpamo”评估由基准测试40分、专家评估35分、用户评估25分组成,总分100分。其中,AAII在基准测试40分中占25分。

AAII原始分数分别为:Motif 47分、Upstage 37分、SK电信 35分、LG AI研究院 31分。

按25分满分换算,Motif得11.75分,Upstage得9.25分,SK电信得8.75分,LG得7.75分。

在AAII原始得分中,Motif与LG的差距为16分。但在最终评估中,这一分差缩小至4分。加上NIA评估的15分,基准评估总分即为40分。

这种机制使得即使在全球技术实力评估中存在较大差距,在最终评估中该差距也会大幅缩小。

另一方面,专家评估35分和用户评估25分等共计60分,不仅取决于模型本身的性能,实际应用价值和影响力等因素也起着重要作用。

此次Motif的案例充分展示了这种评分结构对结果的影响之大。

一位AI专家针对此次评估结果表示:“结果完全取决于实际可用性得分,这难道是应该这样吗?”并由此质疑了“独破莫”项目的初衷。

他特别指出:“如果要提高易用性,直接使用开放权重模型就行了”,并强调易用性只是在模型性能达到一定水平后才需额外考虑的因素。

[E-Daily 文承勇 记者]

“易用性”是模型开发的核心吗
? 当然,这并非意味着易用性与实用性评估本身有错。

验证技术能力能否真正应用于实际服务和产业现场,在国家AI项目中也至关重要。问题在于其权重。

“易用性”好并不一定意味着模型本身的性能就出色。因为这取决于在模型之上构建了什么样的服务环境和工具,即所谓的“harness”。

反过来说,如果基础模型的性能已达到世界级水平,那么如何将其服务化,也可以视为后续的课题。

特别是像Motif这样仅凭30余名员工就打造出全球级模型性能的初创企业,与拥有大规模组织和客户基础的竞争对手,是否应以同一标准来评估其应用性,这一点也值得探讨。

在本次第二轮评估中,影响力和贡献计划的分值也从原来的10分提高到了15分。

关键在于,这并非要得出“Motif被淘汰不公”的结论。

在AAII评估中,即便是全球顶尖模型也难以超过50分,而Motif以47分证明了其全球竞争力,但其模型却因用户评估仅得14.1分而被淘汰——这种评分结构究竟是否符合“解码模拟”项目的初衷?

更何况,在总分100分中,专家评估35分和用户评估25分等共计60分,属于受定性判断影响较大的领域。

既然权重如此之高,就应当公开评估标准、具体项目、各评委的评分以及最终换算方式。只有这样,才能验证在哪些项目上“Motif”与竞争对手的分数拉开差距,以及这一差距对最终淘汰结果产生了多大影响。

当务之急不是“企业救济”,而是评估验证
科学技术信息通信部已将第二轮评估结果通知各企业,并计划开展异议申诉和说明程序。

Motif同样需要通过这一程序,核查基准测试、NIA、专家及用户评估的原始分数和详细计算公式。

如果评估没有问题,政府直接公开即可。反之,如果存在企业难以预先预测的评分细则或评估标准,则应予以改进。

也没有必要将此次争议仅视为Motif与LG的胜负问题。

在今后将投入数百亿韩元乃至数万亿韩元税款的国家AI项目中,究竟应多大程度上重视技术实力,又应在多大程度上体现易用性和实用性,这属于政策层面的选择。

不过,评分标准直接决定了项目的方向。

如果一边声称要打造世界级的基础模型,实际却形成了一种结构——即使用体验的评估比模型性能对结果产生更大的影响,那么就必须重新审视:这项国家AI项目究竟是为了什么。

企业必须能够相信评估标准并据此制定开发战略,而在结果出炉后,任何人都能对结果进行验证。

国家代表级AI项目所需要的,是让致力于打造世界级模型的企业能够信任并参与竞争的评估机制。

在此次“独破模”争议中,真正需要反思的并非Motif被淘汰这件事本身,而是导致其淘汰的“评分设计”是否真的符合“独破模”的初衷。

Economy

Corporation

IT·Science

Economy

扣除关税退税后仍实现5千亿盈余……LG电子美国子公司“高端化·本土化”策略奏效

LG电子美国子公司时隔一年大幅恢复盈利能力。去年受美国高关税影响,对美出口成本激增导致公司出现亏损;但今年通过生产基地多元化等供应链重组措施,有效降低了关税负担,业绩得以恢复正常。分析认为,扩大当地生产和强化高端产品销售等以盈利为中心的业务战略,也为业绩改善起到了推动作用。据21日LG电子半年度报告显示,LG电子美国分公司(LGEUS)今年上半年累计净利润达8024亿韩元。较去年同期的68亿韩元净…
2026-08-21 14:44:42

Corporation

尽管称“是利好,并非利空”……但Kakao的人事分拆仍令股市一片哗然

“如果把KakaoTalk从Kakao身上剥离,那到底还剩下什么?”“Kakao X是什么东西,你以为是SpaceX吗?”“这是利好消息,不是利空。请仔细查看公告内容。” 随着Kakao决定将核心业务KakaoTalk和人工智能(AI)业务拆分成立独立公司,散户投资者们正议论纷纷。加之此前Kakao曾接连将旗下子公司拆分上市所带来的“学习效应”,股票讨论区里“又要拆分了吗”的抱怨声与…
2026-08-21 10:50:09

IT·Science

Kakao AI,目标2030年营收达6万亿……仅AI业务就将创收1万亿

通过Kakao(035720) 的人事分拆新成立的Kakao AI宣布,目标是在2030年实现6万亿韩元以上的营收,其中人工智能(AI)业务营收将超过1万亿韩元。其构想是将子公司管理职能移交给Kakao X,并以KakaoTalk为中心,集中力量发展AI、广告和电商业务,以此开拓新的收入来源。 Kakao代表郑真雅于21日在Kakao业务分拆新闻说明会上发言。(图片来源:Kakao业务分拆新…
2026-08-21 15:01:41