[E-DailyKim Hyun-ah 记者] 政府突然公布了“自主人工智能(AI)基础模型(独基模)”项目第二阶段评估的详细分数。这是因为Motif Technologies要求公开评估结果的详细信息,其他精英团队也对此表示同意。
此次公布的评估结果显示,SKTelecom(017670)以70.6分位居综合榜首,Upstage(69.9分)、LG AI研究院(69.0分)、Motif Technologies(65.8分)依次紧随其后。
值得注意的是,Motif在环球AI评估机构Artificial Analysis的AAII基准测试中,虽在4支精英团队中获得最高分,但在专家评估、AI专业用户评估以及普通民众评估中,均仅位列第四。
政府表示,最初为了将因公开评估结果而给企业造成的直接或间接损害降至最低,同时确保评估过程的公正性和透明度,一直审慎决定公开范围。
然而,当天Motif Technologies通过声明要求公开详细评估结果,其他精英团队也表示赞同,因此决定公开全部详细分数。
科技信息通信部表示:“‘独破摩’并非旨在进行单纯的排名竞争或筛选淘汰团队的项目”,并强调“其宗旨在于推动国内AI企业超越竞争实现成长,进而引领AI生态系统的质量提升与扩展”。
基准测试又细分为△AAII基准测试△韩国智能信息社会振兴院(NIA)基准测试。用户评估由△AI专业用户组评估△普通民众评估组成。
总分设定为100分,其中基准测试占40分,专家评估占35分,用户评估占25分。
科技信息通信部考虑到AI技术日新月异,正采用每6个月调整开发目标的“移动目标”方式。据此,该部解释称,每次阶段性评估的标准和方式都是与精锐团队协商后制定的。
政府表示,本次第二轮评估标准同样经过与精英团队多次协商后确定,并在评估前正式公布最终方案,确认无异议后才进行评估。
在采用Artificial Analysis于6月底公布的标准进行的AAII基准测试中,Motif以47.4分的原始分数位居榜首。将其换算为满分25分的评分体系后,得分为11.9分。
Upstage以原始分37.4分、换算分9.4分位列第二,SK电信以35.0分、8.8分位列第三。LG AI研究院以31.0分、7.8分位列第四。
Motif在GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、AA-LCR、AA-Omniscience Accuracy、HLE等多项指标中均取得了相对较高的分数。特别是在Terminal-Bench v2.1中,其得分达到74.9分,大幅领先其他3支队伍。
NIA评估涵盖了数学、知识、长文理解、指令执行、韩语、可靠性、安全性、社会安全性等8个领域。
按原始分数计算,Upstage以732.4分位居首位,SK电信728.7分,LG AI研究院705.8分,Motif702.8分。随后将这些分数换算为满分15分的评分体系。
具体来看,Upstage在数学、指令执行和可靠性等方面表现突出;SK电信在知识和韩语等方面取得了高分;LG AI研究院则在长文理解和安全性方面获得了相对较高的分数。
专家评估由10名外部专家(包括产业界3人、学术界5人、研究界2人)组成的评估委员会进行。基于各精英团队提交的评估材料,评估委员会在约5天内同步进行了书面评估和问答(Q&A)环节。
评估项目包括:△开发战略及技术10分、△开发成果及计划10分、△辐射效应及贡献计划15分。同时还对独创性的最低标准进行了核查。
最终分数并非简单地将各评估委员的评分全部相加,而是剔除最高分和最低分后,对剩余分数计算算术平均值得出。
结果显示,LG AI研究院在开发战略与技术、开发成果与计划、辐射效应与贡献计划等各个方面均获得了均衡且较高的评价。
另一方面,Motif虽然获得部分评委的高分,但总分仅为27.1分。
LG AI研究院以11.3分位列第二,Upstage以10.8分位列第三,Motif以8.4分位列第四。
科技部解释称,AI专业评审团的成员是从具备AI专业见解和经验、并在实际各类AI开发过程中广泛使用过AI模型的AI初创企业CEO中遴选出来的。
虽然最初选定了50人,但实际参与评估的有49人。同时还确认了是否存在利益冲突。
评估以各精英团队提供的AI应用网站为基础,针对其易用性等进行评估。评审团采用1分至5分的评分标准,并将其换算为满分15分。
原始分数总和方面,SK电信以189分位居首位,LG AI研究院184分,Upstage 176分,Motif 137分。
为提高普通民众的代表性,政府在充分的时间内招募了评估小组,随后以国内居民登记人口统计数据为基准,按性别和年龄设定配额,并随机选出200人。其中实际参与评估的人数为185人。
评估团成员同样在确认是否存在利益冲突后才最终确定。针对各模型进行了1至5分的绝对评分,并将其换算为10分制。
原始分数总和分别为:LG AI研究院701分、SK电讯698分、Upstage 675分、Motif 528分。
对此,Motif对用户评估的公正性提出了异议。其理由是,当普通用户对知名大企业与知名度相对较低的初创企业开发的模型进行评估时,如果事先知晓开发公司,就很难排除品牌知名度或先入为主的观念对结果产生影响的可能性。
Motif Technologies主张:“如果AAII基准测试中显现的性能差异在普通用户评估中发生了显著变化,就需要提供令人信服的解释,说明究竟是哪种评估方式和条件影响了这一结果。”
此外,该公司还强调,用户评估的详细结果不应仅作为决定入选或淘汰的依据,而应作为切实可行的反馈,帮助参与企业改进模型的易用性。
Upstage以69.9分位列第二,LG AI研究院以69.0分位列第三,Motif Technologies以65.8分位列第四。
最终,Motif在总分100分中获得24.6分,在基准测试中位居第一。但在专家评估中获得27.1分,用户评估中获得14.1分,因此在最终排名中降至第四位。
另一方面,SK电信虽然在AAII中排名第3,但在NIA中位列第1,专家评估中位列第2,AI专业用户评估中位列第1,普通民众评估中位列第2,从而登顶综合排名榜首。
Upstage同样在基准测试中位列第2名,专家评估和用户评估均位列第3名,以69.9分位居第2名。
LG Corp.(003550) AI研究院在AAII中虽位列第4,但在专家评估和普通民众评估中分别夺得第1名,最终排名第3。
科学技术信息通信部强调,希望企业以此次详细结果的公布为契机,不要仅拘泥于简单的分数和排名,而应基于各自的技术实力和能力,为国内外AI生态系统做出贡献。
科技信息通信部一位相关人士表示:“我们期待韩国企业能够凭借自身蕴藏的潜力和实力,为国内外AI生态系统做出广泛贡献,并发展成为一个充满活力、不断有新颖且具竞争力的AI企业持续挑战的生态系统。”
此次公布的评估结果显示,SKTelecom(017670)以70.6分位居综合榜首,Upstage(69.9分)、LG AI研究院(69.0分)、Motif Technologies(65.8分)依次紧随其后。
值得注意的是,Motif在环球AI评估机构Artificial Analysis的AAII基准测试中,虽在4支精英团队中获得最高分,但在专家评估、AI专业用户评估以及普通民众评估中,均仅位列第四。
应Motif要求公开详细分数……“兼顾公平性与透明度”科学技术信息通信部(副总理兼部长裴景勋)于27日公开了“独破莫”项目第二阶段评估结果的详细分数。
政府表示,最初为了将因公开评估结果而给企业造成的直接或间接损害降至最低,同时确保评估过程的公正性和透明度,一直审慎决定公开范围。
然而,当天Motif Technologies通过声明要求公开详细评估结果,其他精英团队也表示赞同,因此决定公开全部详细分数。
科技信息通信部表示:“‘独破摩’并非旨在进行单纯的排名竞争或筛选淘汰团队的项目”,并强调“其宗旨在于推动国内AI企业超越竞争实现成长,进而引领AI生态系统的质量提升与扩展”。
五大领域评估……基准测试·专家·用户评估并行“独破模”第二阶段评估主要分为△基准测试评估 △专家评估 △用户评估三个部分。
基准测试又细分为△AAII基准测试△韩国智能信息社会振兴院(NIA)基准测试。用户评估由△AI专业用户组评估△普通民众评估组成。
总分设定为100分,其中基准测试占40分,专家评估占35分,用户评估占25分。
科技信息通信部考虑到AI技术日新月异,正采用每6个月调整开发目标的“移动目标”方式。据此,该部解释称,每次阶段性评估的标准和方式都是与精锐团队协商后制定的。
政府表示,本次第二轮评估标准同样经过与精英团队多次协商后确定,并在评估前正式公布最终方案,确认无异议后才进行评估。
在AAII评估中,Motif位列第一……原始得分47.4分最引人注目的是AAII评估。
在采用Artificial Analysis于6月底公布的标准进行的AAII基准测试中,Motif以47.4分的原始分数位居榜首。将其换算为满分25分的评分体系后,得分为11.9分。
Upstage以原始分37.4分、换算分9.4分位列第二,SK电信以35.0分、8.8分位列第三。LG AI研究院以31.0分、7.8分位列第四。
Motif在GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、AA-LCR、AA-Omniscience Accuracy、HLE等多项指标中均取得了相对较高的分数。特别是在Terminal-Bench v2.1中,其得分达到74.9分,大幅领先其他3支队伍。
NIA基准测试中SKT位居榜首……四支队伍分数差距不大 在NIA基准测试中,SK电信以13.4分位居榜首。Upstage以13.3分紧随其后,LG AI研究院12.8分,Motif 12.7分。
NIA评估涵盖了数学、知识、长文理解、指令执行、韩语、可靠性、安全性、社会安全性等8个领域。
按原始分数计算,Upstage以732.4分位居首位,SK电信728.7分,LG AI研究院705.8分,Motif702.8分。随后将这些分数换算为满分15分的评分体系。
具体来看,Upstage在数学、指令执行和可靠性等方面表现突出;SK电信在知识和韩语等方面取得了高分;LG AI研究院则在长文理解和安全性方面获得了相对较高的分数。
专家评估中LG AI研究院位居第一……Motif以27.1分排名第四 在专家评估中,LG AI研究院以29.
5分位居榜首。随后依次为SK电信29.3分、Upstage 29.1分、Motif 27.1分。
专家评估由10名外部专家(包括产业界3人、学术界5人、研究界2人)组成的评估委员会进行。基于各精英团队提交的评估材料,评估委员会在约5天内同步进行了书面评估和问答(Q&A)环节。
评估项目包括:△开发战略及技术10分、△开发成果及计划10分、△辐射效应及贡献计划15分。同时还对独创性的最低标准进行了核查。
最终分数并非简单地将各评估委员的评分全部相加,而是剔除最高分和最低分后,对剩余分数计算算术平均值得出。
结果显示,LG AI研究院在开发战略与技术、开发成果与计划、辐射效应与贡献计划等各个方面均获得了均衡且较高的评价。
另一方面,Motif虽然获得部分评委的高分,但总分仅为27.1分。
49位AI初创企业代表参与评估……SKT位列第一,Motif位列第四在AI专业用户组的评估中,SK电信以11.6分位居
榜首。
LG AI研究院以11.3分位列第二,Upstage以10.8分位列第三,Motif以8.4分位列第四。
科技部解释称,AI专业评审团的成员是从具备AI专业见解和经验、并在实际各类AI开发过程中广泛使用过AI模型的AI初创企业CEO中遴选出来的。
虽然最初选定了50人,但实际参与评估的有49人。同时还确认了是否存在利益冲突。
评估以各精英团队提供的AI应用网站为基础,针对其易用性等进行评估。评审团采用1分至5分的评分标准,并将其换算为满分15分。
原始分数总和方面,SK电信以189分位居首位,LG AI研究院184分,Upstage 176分,Motif 137分。
普通民众评估中LG AI研究院也位居
榜首……Motif得5.7分 在普通
民众评估中,LG AI研究院以7.6分位居榜首。SK电信得7.5分,Upstage得7.3分,Motif得5.
7分。
为提高普通民众的代表性,政府在充分的时间内招募了评估小组,随后以国内居民登记人口统计数据为基准,按性别和年龄设定配额,并随机选出200人。其中实际参与评估的人数为185人。
评估团成员同样在确认是否存在利益冲突后才最终确定。针对各模型进行了1至5分的绝对评分,并将其换算为10分制。
原始分数总和分别为:LG AI研究院701分、SK电讯698分、Upstage 675分、Motif 528分。
对此,Motif对用户评估的公正性提出了异议。其理由是,当普通用户对知名大企业与知名度相对较低的初创企业开发的模型进行评估时,如果事先知晓开发公司,就很难排除品牌知名度或先入为主的观念对结果产生影响的可能性。
Motif Technologies主张:“如果AAII基准测试中显现的性能差异在普通用户评估中发生了显著变化,就需要提供令人信服的解释,说明究竟是哪种评估方式和条件影响了这一结果。”
此外,该公司还强调,用户评估的详细结果不应仅作为决定入选或淘汰的依据,而应作为切实可行的反馈,帮助参与企业改进模型的易用性。
综合排名第一的SKT……Motif虽获AAII第一,但总排名第四 综合5个评估领域的得分,SK电信以70.6分最终夺得第一名。
Upstage以69.9分位列第二,LG AI研究院以69.0分位列第三,Motif Technologies以65.8分位列第四。
最终,Motif在总分100分中获得24.6分,在基准测试中位居第一。但在专家评估中获得27.1分,用户评估中获得14.1分,因此在最终排名中降至第四位。
另一方面,SK电信虽然在AAII中排名第3,但在NIA中位列第1,专家评估中位列第2,AI专业用户评估中位列第1,普通民众评估中位列第2,从而登顶综合排名榜首。
Upstage同样在基准测试中位列第2名,专家评估和用户评估均位列第3名,以69.9分位居第2名。
LG Corp.(003550) AI研究院在AAII中虽位列第4,但在专家评估和普通民众评估中分别夺得第1名,最终排名第3。
科学技术信息通信部强调,希望企业以此次详细结果的公布为契机,不要仅拘泥于简单的分数和排名,而应基于各自的技术实力和能力,为国内外AI生态系统做出贡献。
科技信息通信部一位相关人士表示:“我们期待韩国企业能够凭借自身蕴藏的潜力和实力,为国内外AI生态系统做出广泛贡献,并发展成为一个充满活力、不断有新颖且具竞争力的AI企业持续挑战的生态系统。”