互联网

Motif 47分·Upstage 37分·SKT 35分·LG 31分……AAII 指出“基准指标的局限性”(综合报道)

AAII公布进入第三轮评估的“读破模”结果 Motif 位居韩国第一、全球LLM前十 难以全面反映AI代理时代的实际应用能力 NIA非公开评估等最终结果备受关注

Kim Hyun-ah
2026-08-13 14:15:22
[E-DailyKim Hyun-ah 记者] 作为韩国“AI国家队”选拔赛的“自主AI基础模型项目”(简称“独基模”),参与该项目的4家企业的全球AI评估结果已公布。Motif Technologies的“Motif 3”以47分位居榜首,随后依次为Upstage(37分)、SKTelecom(017670) (35分)和LG Corp.(003550) AI研究院(31分)。

虽然全球评估机构采用统一标准对韩国本土AI模型进行比较具有重要意义,但也有观点指出,仅凭AAII分数来判断模型的综合竞争力或实际应用能力仍存在局限性。

特别是随着AI从简单的问答发展为能够自主执行复杂任务的代理AI,现有基准测试在多大程度上能够反映实际工作能力,正成为新的评估课题。


Motif以47分位居榜首……Upstage、SKT、LG紧随其后
据13日全球AI分析机构Artificial Analysis发布的“Artificial Analysis Intelligence Index(AAII)v4.1.1”显示,Motif的Motif 3获得了47分。

Upstage的“Solar Open 2 250B”以37分位居第二,SK电信的“A.X K2”以35分位居第三,LG AI研究院的“K-EXAONE 2.0 0803”以31分紧随其后。

AAII是一项综合数学、科学、编程、推理等多个领域评估结果,将AI模型性能以单一分数呈现的指标。本次评估采用了9个项目,涵盖金融业务、编程、科学与数学问题、长文推理、信息准确性等。

Motif 3在全球大型语言模型(LLM)中排名第10位,在OpenWeight模型中位列第4位。特别是在执行金融业务的AI代理以及评估编程能力的部分项目中表现突出。

Motif当天不仅公开了Motif 3的模型权重,还公开了训练代码和库,着手扩大模型生态系统。
AAII 25分计入……与“独破模”最终排名无关
此次结果备受关注的原因在于,它与科学技术信息通信部的“独破模”第三轮评估直接相关。

在第三轮评估中,LG AI研究院、Upstage、SK电讯、Motif Technologies等4家企业中将有1家被淘汰。

在“独破模”评估中,基准测试部分总分40分,其中AAII占25分,韩国智能信息社会振兴院(NIA)的自主基准测试占15分。剩余的60分由专家评估35分和用户评估25分组成。

鉴于AAII占整体评估的25%,此次分数差异可能会对最终结果产生相当大的影响。但这并不意味着AAII将决定“独破摩”的最终排名。

特别是由于NIA的非公开评估以及专家和用户评估尚未完成,因此不能认为AAII的排名必然与“独破模”的最终排名完全一致。

“AAII在评估代理AI实际业务能力方面存在局限”
针对此次结果,专家们在认可AAII实用性的同时,也指出了其评估方式的局限性。

国家AI战略委员会技术创新与基础设施分委会的一位委员表示:“像‘人工分析(Artificial Analysis)’这样的评估,在于能够快速比较多种模型的性能,这一点很有意义”,但他同时指出:“仅凭目前的评估方式,要全面评估代理AI的实际工作能力还是存在局限的。”

这是因为AI已超越单纯回答问题的层面,正发展到能够进行多轮对话、通过检索网站或参考资料核实信息,进而执行实际工作的阶段。

他解释道:“代理AI在执行一项任务的过程中,也需要经过多个阶段的推理和执行”,“仅靠现有的基准测试很难充分评估这种复合能力。”

由于评估实际业务执行能力需要验证整个问题解决过程,因此评估所需的时间和成本也会增加。正因如此,虽然目前广泛使用能够快速比较多种模型性能的现有基准测试,但这可能与实际的AI服务环境存在差异。

不过,他表示:“这并非意味着AAII是毫无意义的指标”,并指出:“虽然它能以统一标准比较多种模型的性能,因此很有用,但不应将其视为展示代理AI时代模型性能的唯一指标。”
Upstage·SKT:“难以仅凭单一指标判断模型成熟度”
在AAII评分中落后于Motif的Upstage和SK电讯也持相同立场,认为不应
仅凭
AAII分数来
判断
模型的
成熟度
。LG AI研究院未发表单独声明。

SK电信表示:“AAII只是‘独破模’评估标准的一部分,专家评估和用户评估尚未进行”,并称:“请考虑到仅凭单一指标难以代表模型的成熟度。”

随后该公司表示:“模型的竞争力不仅取决于指标,还应综合评估其在实际应用环境中的性能、成本和稳定性”,并称“计划在完善指标上需要改进的领域的同时,并行提升实际应用环境中的性能”。

Upstage同样表示:“AAII基准测试结果虽非毫无意义,但不应将其视为模型性能的绝对标准。”

“AAII第一名”能否延续至“独破模”最终排名第一
? 此次AAII结果的意义在于,它以相同的全球标准对韩国AI模型进行了比较。特别是Motif 3在全球模型中取得了较高排名(第10名),这一成绩被韩国AI业界视为值得关注的成果。

然而,仅凭AAII分数来判断模型的综合竞争力显然存在局限性。由于AAII是将多项评估结果综合为单一分数的指标,因此根据所包含的评估项目不同,结果可能会有所差异。韩语能力、特定行业的业务执行能力,以及实际服务中的成本、速度、稳定性等因素,也很难仅凭一个分数充分体现。

实际上,Artificial Analysis除了综合智能指数外,还单独提供了模型的响应速度、使用成本、编码代理性能等多种指标。这意味着仅凭一个综合分数很难全面说明AI模型的所有竞争力。

目前已公布的全球评估排名中,Motif位列第一,Upstage第二,SK电讯第三,LG AI研究院第四。但这一排名并不等同于“独破莫”的最终排名。

鉴于AAII评分占25分、NIA评估占15分,再加上专家和用户评估,最终结果中的排名仍有可能发生变化。

此次AAII结果作为衡量韩国AI模型相对性能的重要参考指标,意义重大。不过,要让AI在实际产业和服务现场得到应用,除了基准测试分数外,还需综合考量其业务执行能力、成本、速度及稳定性等因素。

预计“独破模”第三轮评估的最终关注点也将超越“AAII第一名是谁”这一层面,转向如何综合评估全球基准测试成绩与实际AI应用能力。

Economy

Corporation

IT·Science

Economy

扣除关税退税后仍实现5千亿盈余……LG电子美国子公司“高端化·本土化”策略奏效

LG电子美国子公司时隔一年大幅恢复盈利能力。去年受美国高关税影响,对美出口成本激增导致公司出现亏损;但今年通过生产基地多元化等供应链重组措施,有效降低了关税负担,业绩得以恢复正常。分析认为,扩大当地生产和强化高端产品销售等以盈利为中心的业务战略,也为业绩改善起到了推动作用。据21日LG电子半年度报告显示,LG电子美国分公司(LGEUS)今年上半年累计净利润达8024亿韩元。较去年同期的68亿韩元净…
2026-08-21 14:44:42

Corporation

尽管称“是利好,并非利空”……但Kakao的人事分拆仍令股市一片哗然

“如果把KakaoTalk从Kakao身上剥离,那到底还剩下什么?”“Kakao X是什么东西,你以为是SpaceX吗?”“这是利好消息,不是利空。请仔细查看公告内容。” 随着Kakao决定将核心业务KakaoTalk和人工智能(AI)业务拆分成立独立公司,散户投资者们正议论纷纷。加之此前Kakao曾接连将旗下子公司拆分上市所带来的“学习效应”,股票讨论区里“又要拆分了吗”的抱怨声与…
2026-08-21 10:50:09

IT·Science

Kakao AI,目标2030年营收达6万亿……仅AI业务就将创收1万亿

通过Kakao(035720) 的人事分拆新成立的Kakao AI宣布,目标是在2030年实现6万亿韩元以上的营收,其中人工智能(AI)业务营收将超过1万亿韩元。其构想是将子公司管理职能移交给Kakao X,并以KakaoTalk为中心,集中力量发展AI、广告和电商业务,以此开拓新的收入来源。 Kakao代表郑真雅于21日在Kakao业务分拆新闻说明会上发言。(图片来源:Kakao业务分拆新…
2026-08-21 15:01:41