互联网

Motif 47分·Upstage 37分·SKT 35分·LG 31分……AAII 指出“基准指标的局限性”(综合报道)

AAII公布进入第三轮评估的“读破模”结果 Motif 位居韩国第一、全球LLM前十 难以全面反映AI代理时代的实际应用能力 NIA非公开评估等最终结果备受关注

Kim Hyun-ah
2026-08-13 14:15:22
[E-DailyKim Hyun-ah 记者] 作为韩国“AI国家队”选拔赛的“自主AI基础模型项目”(简称“独基模”),参与该项目的4家企业的全球AI评估结果已公布。Motif Technologies的“Motif 3”以47分位居榜首,随后依次为Upstage(37分)、SKTelecom(017670) (35分)和LG Corp.(003550) AI研究院(31分)。

虽然全球评估机构采用统一标准对韩国本土AI模型进行比较具有重要意义,但也有观点指出,仅凭AAII分数来判断模型的综合竞争力或实际应用能力仍存在局限性。

特别是随着AI从简单的问答发展为能够自主执行复杂任务的代理AI,现有基准测试在多大程度上能够反映实际工作能力,正成为新的评估课题。


Motif以47分位居榜首……Upstage、SKT、LG紧随其后
据13日全球AI分析机构Artificial Analysis发布的“Artificial Analysis Intelligence Index(AAII)v4.1.1”显示,Motif的Motif 3获得了47分。

Upstage的“Solar Open 2 250B”以37分位居第二,SK电信的“A.X K2”以35分位居第三,LG AI研究院的“K-EXAONE 2.0 0803”以31分紧随其后。

AAII是一项综合数学、科学、编程、推理等多个领域评估结果,将AI模型性能以单一分数呈现的指标。本次评估采用了9个项目,涵盖金融业务、编程、科学与数学问题、长文推理、信息准确性等。

Motif 3在全球大型语言模型(LLM)中排名第10位,在OpenWeight模型中位列第4位。特别是在执行金融业务的AI代理以及评估编程能力的部分项目中表现突出。

Motif当天不仅公开了Motif 3的模型权重,还公开了训练代码和库,着手扩大模型生态系统。
AAII 25分计入……与“独破模”最终排名无关
此次结果备受关注的原因在于,它与科学技术信息通信部的“独破模”第三轮评估直接相关。

在第三轮评估中,LG AI研究院、Upstage、SK电讯、Motif Technologies等4家企业中将有1家被淘汰。

在“独破模”评估中,基准测试部分总分40分,其中AAII占25分,韩国智能信息社会振兴院(NIA)的自主基准测试占15分。剩余的60分由专家评估35分和用户评估25分组成。

鉴于AAII占整体评估的25%,此次分数差异可能会对最终结果产生相当大的影响。但这并不意味着AAII将决定“独破摩”的最终排名。

特别是由于NIA的非公开评估以及专家和用户评估尚未完成,因此不能认为AAII的排名必然与“独破模”的最终排名完全一致。

“AAII在评估代理AI实际业务能力方面存在局限”
针对此次结果,专家们在认可AAII实用性的同时,也指出了其评估方式的局限性。

国家AI战略委员会技术创新与基础设施分委会的一位委员表示:“像‘人工分析(Artificial Analysis)’这样的评估,在于能够快速比较多种模型的性能,这一点很有意义”,但他同时指出:“仅凭目前的评估方式,要全面评估代理AI的实际工作能力还是存在局限的。”

这是因为AI已超越单纯回答问题的层面,正发展到能够进行多轮对话、通过检索网站或参考资料核实信息,进而执行实际工作的阶段。

他解释道:“代理AI在执行一项任务的过程中,也需要经过多个阶段的推理和执行”,“仅靠现有的基准测试很难充分评估这种复合能力。”

由于评估实际业务执行能力需要验证整个问题解决过程,因此评估所需的时间和成本也会增加。正因如此,虽然目前广泛使用能够快速比较多种模型性能的现有基准测试,但这可能与实际的AI服务环境存在差异。

不过,他表示:“这并非意味着AAII是毫无意义的指标”,并指出:“虽然它能以统一标准比较多种模型的性能,因此很有用,但不应将其视为展示代理AI时代模型性能的唯一指标。”
Upstage·SKT:“难以仅凭单一指标判断模型成熟度”
在AAII评分中落后于Motif的Upstage和SK电讯也持相同立场,认为不应
仅凭
AAII分数来
判断
模型的
成熟度
。LG AI研究院未发表单独声明。

SK电信表示:“AAII只是‘独破模’评估标准的一部分,专家评估和用户评估尚未进行”,并称:“请考虑到仅凭单一指标难以代表模型的成熟度。”

随后该公司表示:“模型的竞争力不仅取决于指标,还应综合评估其在实际应用环境中的性能、成本和稳定性”,并称“计划在完善指标上需要改进的领域的同时,并行提升实际应用环境中的性能”。

Upstage同样表示:“AAII基准测试结果虽非毫无意义,但不应将其视为模型性能的绝对标准。”

“AAII第一名”能否延续至“独破模”最终排名第一
? 此次AAII结果的意义在于,它以相同的全球标准对韩国AI模型进行了比较。特别是Motif 3在全球模型中取得了较高排名(第10名),这一成绩被韩国AI业界视为值得关注的成果。

然而,仅凭AAII分数来判断模型的综合竞争力显然存在局限性。由于AAII是将多项评估结果综合为单一分数的指标,因此根据所包含的评估项目不同,结果可能会有所差异。韩语能力、特定行业的业务执行能力,以及实际服务中的成本、速度、稳定性等因素,也很难仅凭一个分数充分体现。

实际上,Artificial Analysis除了综合智能指数外,还单独提供了模型的响应速度、使用成本、编码代理性能等多种指标。这意味着仅凭一个综合分数很难全面说明AI模型的所有竞争力。

目前已公布的全球评估排名中,Motif位列第一,Upstage第二,SK电讯第三,LG AI研究院第四。但这一排名并不等同于“独破莫”的最终排名。

鉴于AAII评分占25分、NIA评估占15分,再加上专家和用户评估,最终结果中的排名仍有可能发生变化。

此次AAII结果作为衡量韩国AI模型相对性能的重要参考指标,意义重大。不过,要让AI在实际产业和服务现场得到应用,除了基准测试分数外,还需综合考量其业务执行能力、成本、速度及稳定性等因素。

预计“独破模”第三轮评估的最终关注点也将超越“AAII第一名是谁”这一层面,转向如何综合评估全球基准测试成绩与实际AI应用能力。

Economy

Corporation

IT·Science

Economy

LG电子为雷诺首款商用SDV供应“集成驾驶舱”……拓展车载电子业务

LG电子将为雷诺集团在欧洲推出的首款商用软件定义汽车(SDV)提供将仪表盘和车载娱乐系统整合为一体的集成驾驶舱解决方案。该方案的特点在于通过集成控制各独立系统,在提升驾驶员便利性的同时,简化了整车制造商的零部件和设计。 LG电子将为欧洲首款商用SDV——雷诺集团的“New Trafic E-Tech Electric”提供可对仪表盘和车载娱乐系统进行集成控制的驾驶舱解决方案。(图片来源:LG…
2026-10-06 10:00:07

Corporation

教村炸鸡进军日本……明年将在东京开设首家门店

教村炸鸡将进军日本市场。该公司计划与当地食品流通企业“新井商事”携手,将日本打造为全球业务的新增长引擎。KYOCHON FOOD&BEVERAGE(339770)该公司于6日宣布,上月29日在板桥总部与日本企业新井商事(Arai Shoji)签署了进军日本市场的战略合作备忘录(MOU)。 上月29日,在教村F&B板桥总部举行的合作协议签署仪式上,教村F&B株式会社代表董事宋钟和(左)与新井…
2026-10-06 10:26:10

IT·Science

[独家]FineMedix首席执行官全成宇:“即将与美国前十医疗保健公司签署合作协议……销售额将突破150亿”

“我们正在筹备与一家全球性公司签订合同。现在,我们不再专注于‘如何制造优质产品’,而是将重心放在‘如何销售’上。”FineMedix首席执行官全成宇在上月30日接受《Pharm E-Daily》采访时如是说。他解释称,公司正在与一家计划进军美国市场的全球医疗保健企业推进合作伙伴协议。预计签约时间定于本月。不过,由于目前仍处于谈判阶段,因此未公开与对方公司的合同规模。 FineMedix首席执…
2026-10-06 11:02:02