[E-DailyKim Hyun-ah 记者] 作为韩国“AI国家队”选拔赛的“自主AI基础模型项目”(简称“独基模”),参与该项目的4家企业的全球AI评估结果已公布。Motif Technologies的“Motif 3”以47分位居榜首,随后依次为Upstage(37分)、SKTelecom(017670) (35分)和LG Corp.(003550) AI研究院(31分)。
虽然全球评估机构采用统一标准对韩国本土AI模型进行比较具有重要意义,但也有观点指出,仅凭AAII分数来判断模型的综合竞争力或实际应用能力仍存在局限性。
特别是随着AI从简单的问答发展为能够自主执行复杂任务的代理AI,现有基准测试在多大程度上能够反映实际工作能力,正成为新的评估课题。
Upstage的“Solar Open 2 250B”以37分位居第二,SK电信的“A.X K2”以35分位居第三,LG AI研究院的“K-EXAONE 2.0 0803”以31分紧随其后。
AAII是一项综合数学、科学、编程、推理等多个领域评估结果,将AI模型性能以单一分数呈现的指标。本次评估采用了9个项目,涵盖金融业务、编程、科学与数学问题、长文推理、信息准确性等。
Motif 3在全球大型语言模型(LLM)中排名第10位,在OpenWeight模型中位列第4位。特别是在执行金融业务的AI代理以及评估编程能力的部分项目中表现突出。
Motif当天不仅公开了Motif 3的模型权重,还公开了训练代码和库,着手扩大模型生态系统。
在第三轮评估中,LG AI研究院、Upstage、SK电讯、Motif Technologies等4家企业中将有1家被淘汰。
在“独破模”评估中,基准测试部分总分40分,其中AAII占25分,韩国智能信息社会振兴院(NIA)的自主基准测试占15分。剩余的60分由专家评估35分和用户评估25分组成。
鉴于AAII占整体评估的25%,此次分数差异可能会对最终结果产生相当大的影响。但这并不意味着AAII将决定“独破摩”的最终排名。
特别是由于NIA的非公开评估以及专家和用户评估尚未完成,因此不能认为AAII的排名必然与“独破模”的最终排名完全一致。
国家AI战略委员会技术创新与基础设施分委会的一位委员表示:“像‘人工分析(Artificial Analysis)’这样的评估,在于能够快速比较多种模型的性能,这一点很有意义”,但他同时指出:“仅凭目前的评估方式,要全面评估代理AI的实际工作能力还是存在局限的。”
这是因为AI已超越单纯回答问题的层面,正发展到能够进行多轮对话、通过检索网站或参考资料核实信息,进而执行实际工作的阶段。
他解释道:“代理AI在执行一项任务的过程中,也需要经过多个阶段的推理和执行”,“仅靠现有的基准测试很难充分评估这种复合能力。”
由于评估实际业务执行能力需要验证整个问题解决过程,因此评估所需的时间和成本也会增加。正因如此,虽然目前广泛使用能够快速比较多种模型性能的现有基准测试,但这可能与实际的AI服务环境存在差异。
不过,他表示:“这并非意味着AAII是毫无意义的指标”,并指出:“虽然它能以统一标准比较多种模型的性能,因此很有用,但不应将其视为展示代理AI时代模型性能的唯一指标。”
SK电信表示:“AAII只是‘独破模’评估标准的一部分,专家评估和用户评估尚未进行”,并称:“请考虑到仅凭单一指标难以代表模型的成熟度。”
随后该公司表示:“模型的竞争力不仅取决于指标,还应综合评估其在实际应用环境中的性能、成本和稳定性”,并称“计划在完善指标上需要改进的领域的同时,并行提升实际应用环境中的性能”。
Upstage同样表示:“AAII基准测试结果虽非毫无意义,但不应将其视为模型性能的绝对标准。”
然而,仅凭AAII分数来判断模型的综合竞争力显然存在局限性。由于AAII是将多项评估结果综合为单一分数的指标,因此根据所包含的评估项目不同,结果可能会有所差异。韩语能力、特定行业的业务执行能力,以及实际服务中的成本、速度、稳定性等因素,也很难仅凭一个分数充分体现。
实际上,Artificial Analysis除了综合智能指数外,还单独提供了模型的响应速度、使用成本、编码代理性能等多种指标。这意味着仅凭一个综合分数很难全面说明AI模型的所有竞争力。
目前已公布的全球评估排名中,Motif位列第一,Upstage第二,SK电讯第三,LG AI研究院第四。但这一排名并不等同于“独破莫”的最终排名。
鉴于AAII评分占25分、NIA评估占15分,再加上专家和用户评估,最终结果中的排名仍有可能发生变化。
此次AAII结果作为衡量韩国AI模型相对性能的重要参考指标,意义重大。不过,要让AI在实际产业和服务现场得到应用,除了基准测试分数外,还需综合考量其业务执行能力、成本、速度及稳定性等因素。
预计“独破模”第三轮评估的最终关注点也将超越“AAII第一名是谁”这一层面,转向如何综合评估全球基准测试成绩与实际AI应用能力。
虽然全球评估机构采用统一标准对韩国本土AI模型进行比较具有重要意义,但也有观点指出,仅凭AAII分数来判断模型的综合竞争力或实际应用能力仍存在局限性。
特别是随着AI从简单的问答发展为能够自主执行复杂任务的代理AI,现有基准测试在多大程度上能够反映实际工作能力,正成为新的评估课题。
Motif以47分位居榜首……Upstage、SKT、LG紧随其后据13日全球AI分析机构Artificial Analysis发布的“Artificial Analysis Intelligence Index(AAII)v4.1.1”显示,Motif的Motif 3获得了47分。
Upstage的“Solar Open 2 250B”以37分位居第二,SK电信的“A.X K2”以35分位居第三,LG AI研究院的“K-EXAONE 2.0 0803”以31分紧随其后。
AAII是一项综合数学、科学、编程、推理等多个领域评估结果,将AI模型性能以单一分数呈现的指标。本次评估采用了9个项目,涵盖金融业务、编程、科学与数学问题、长文推理、信息准确性等。
Motif 3在全球大型语言模型(LLM)中排名第10位,在OpenWeight模型中位列第4位。特别是在执行金融业务的AI代理以及评估编程能力的部分项目中表现突出。
Motif当天不仅公开了Motif 3的模型权重,还公开了训练代码和库,着手扩大模型生态系统。
AAII 25分计入……与“独破模”最终排名无关此次结果备受关注的原因在于,它与科学技术信息通信部的“独破模”第三轮评估直接相关。
在第三轮评估中,LG AI研究院、Upstage、SK电讯、Motif Technologies等4家企业中将有1家被淘汰。
在“独破模”评估中,基准测试部分总分40分,其中AAII占25分,韩国智能信息社会振兴院(NIA)的自主基准测试占15分。剩余的60分由专家评估35分和用户评估25分组成。
鉴于AAII占整体评估的25%,此次分数差异可能会对最终结果产生相当大的影响。但这并不意味着AAII将决定“独破摩”的最终排名。
特别是由于NIA的非公开评估以及专家和用户评估尚未完成,因此不能认为AAII的排名必然与“独破模”的最终排名完全一致。
“AAII在评估代理AI实际业务能力方面存在局限”针对此次结果,专家们在认可AAII实用性的同时,也指出了其评估方式的局限性。
国家AI战略委员会技术创新与基础设施分委会的一位委员表示:“像‘人工分析(Artificial Analysis)’这样的评估,在于能够快速比较多种模型的性能,这一点很有意义”,但他同时指出:“仅凭目前的评估方式,要全面评估代理AI的实际工作能力还是存在局限的。”
这是因为AI已超越单纯回答问题的层面,正发展到能够进行多轮对话、通过检索网站或参考资料核实信息,进而执行实际工作的阶段。
他解释道:“代理AI在执行一项任务的过程中,也需要经过多个阶段的推理和执行”,“仅靠现有的基准测试很难充分评估这种复合能力。”
由于评估实际业务执行能力需要验证整个问题解决过程,因此评估所需的时间和成本也会增加。正因如此,虽然目前广泛使用能够快速比较多种模型性能的现有基准测试,但这可能与实际的AI服务环境存在差异。
不过,他表示:“这并非意味着AAII是毫无意义的指标”,并指出:“虽然它能以统一标准比较多种模型的性能,因此很有用,但不应将其视为展示代理AI时代模型性能的唯一指标。”
Upstage·SKT:“难以仅凭单一指标判断模型成熟度”在AAII评分中落后于Motif的Upstage和SK电讯也持相同立场,认为不应
仅凭AAII分数来
判断模型的
成熟度。LG AI研究院未发表单独声明。
SK电信表示:“AAII只是‘独破模’评估标准的一部分,专家评估和用户评估尚未进行”,并称:“请考虑到仅凭单一指标难以代表模型的成熟度。”
随后该公司表示:“模型的竞争力不仅取决于指标,还应综合评估其在实际应用环境中的性能、成本和稳定性”,并称“计划在完善指标上需要改进的领域的同时,并行提升实际应用环境中的性能”。
Upstage同样表示:“AAII基准测试结果虽非毫无意义,但不应将其视为模型性能的绝对标准。”
“AAII第一名”能否延续至“独破模”最终排名第一? 此次AAII结果的意义在于,它以相同的全球标准对韩国AI模型进行了比较。特别是Motif 3在全球模型中取得了较高排名(第10名),这一成绩被韩国AI业界视为值得关注的成果。
然而,仅凭AAII分数来判断模型的综合竞争力显然存在局限性。由于AAII是将多项评估结果综合为单一分数的指标,因此根据所包含的评估项目不同,结果可能会有所差异。韩语能力、特定行业的业务执行能力,以及实际服务中的成本、速度、稳定性等因素,也很难仅凭一个分数充分体现。
实际上,Artificial Analysis除了综合智能指数外,还单独提供了模型的响应速度、使用成本、编码代理性能等多种指标。这意味着仅凭一个综合分数很难全面说明AI模型的所有竞争力。
目前已公布的全球评估排名中,Motif位列第一,Upstage第二,SK电讯第三,LG AI研究院第四。但这一排名并不等同于“独破莫”的最终排名。
鉴于AAII评分占25分、NIA评估占15分,再加上专家和用户评估,最终结果中的排名仍有可能发生变化。
此次AAII结果作为衡量韩国AI模型相对性能的重要参考指标,意义重大。不过,要让AI在实际产业和服务现场得到应用,除了基准测试分数外,还需综合考量其业务执行能力、成本、速度及稳定性等因素。
预计“独破模”第三轮评估的最终关注点也将超越“AAII第一名是谁”这一层面,转向如何综合评估全球基准测试成绩与实际AI应用能力。