[E-DailyKim Hyun-ah 记者] 科学技术信息通信部指出,在自主AI基础模型(独基模)项目的第二轮评估中,Motif Technologies虽在AAII(人工智能分析指数)排名中位居榜首,但因“可用性与实用性评估”未达标而被淘汰。
在“独基模”第二轮评估中,Upstage、SKTelecom(017670) 和LG Corp.(003550) AI研究院通过了评估。
科学技术信息通信部第二副部长柳济明在18日举行的“读破摩”第二轮评估结果简报会上表示: 表示:“Motif的AAII得分确实非常高,表现出了卓越的成果”,但同时指出:“在100分满分中,AAII仅占25分;综合其他评估来看,虽然其技术实力出众,但在占75分且权重较大的‘易用性·实用性’部分,其评分低于其他企业。”
柳次长还表示:“基准匹配相关问题并未反映在评估中”,并指出:“通过AAII的官方答复和专家评估,我们得出结论认为不存在不公平的技术支持等情况。”所谓基准匹配,是指针对特定的测试集或评估方式对模型进行过度优化的行为。
科技信息通信部第二副部长柳济明。照片来源:E-Daily 记者Kim Hyun-ah
Motif在AAII评分中表现非常出色。在当时的评估中,它确实展现出了引人注目的卓越成绩,这是不争的事实。
不过,在100分的总分中,AAII仅占25分。综合其他评估来看,虽然其技术实力出众,但在评估中占75分且权重较大的易用性与实用性方面,相较于其他企业获得了较低的评分——这便是最终可以得出的结论。
希望您能这样理解。
Q. Motif在易用性方面获得较低评分,这一情况是否同时适用于专家评估和AI专业用户评估?
关于企业的排名或具体分数,如果属于有意义的信息,我们本会尽可能公开,但我们担心因分数差异可能引发其他解读,或导致该企业遭受意想不到的不利影响。
鉴于上一轮评估中也曾出现过类似情况,因此很难详细公开具体在哪些项目上获得了怎样的评价。
再次重申,Motif已在技术实力方面证明了其世界级水平,这一点在评估中也得到了充分体现。
不过,若能说明其在易用性及实用性方面相较于其他机型评分较低这一点,我们将不胜感激。
Q. 政府层面是否会对Motif提供单独支持或后续措施?
Motif Technologies通过此次结果,在AAII全球基准排行榜上获得了全球关注。我们认为,从极具独创性的算法模型设计到展现出AI技术的全球竞争力,这都是一项非常重大的成果。
不过,我们是一家依靠少数研究人员、以研发为核心积累技术实力的科技企业。此前我们已表示,在第一轮之后进行的第二轮评估中,将扩大对易用性及实用性的评估范围,此次结果也反映了这一调整。
未来,我们的AI模型将在多个产业现场及公共领域得到应用,从这一角度来看,可以认为Motif已经奠定了坚实的基础。
至于具体如何支持Motif这一问题,除了Motif通过参与政府未来推进的项目来获得支持外,我认为目前讨论专门针对Motif的特别措施等内容并不合适。
来源:Artificial Analysis
问:将Motif淘汰是否因为其与大企业相比,在合作与生态系统贡献方面有所欠缺?毕竟这属于专家评估的考核项目之一。
很难说某个具体项目起到了决定性作用,希望您能理解这是各项目第一名企业,以及第二、第三名企业之间差距等因素综合形成的结果。
无论是基准评估、专家评估还是用户评估,各项之间的差距都非常微小。
总体来看,基准评估中第一名与第四名之间的差距为4分,用户评估中为5分,因此可以理解为结果在两者之间波动。
Q. 基准测试争议是否影响了Motif的淘汰结果?
总而言之,基准测试相关问题并未反映在评估中。
我们以AAII的官方答复为依据,并通过专家评估对各项事宜进行了验证,最终得出结论:评估竞争中不存在不公平的技术支持等情况。
据我们所知,基准测试方面确实存在一些争议。我们已就基准测试评估事宜正式委托Artificial Analysis公司进行分析,并收到了官方答复。
Artificial Analysis在解释其如何阻止模型为取得高分而进行的各种优化尝试时,针对此次我们委托审查的事项,回复称经审查未发现足以证明存在系统性死记硬背或过拟合问题的线索。
因此,我们收到回复称该部分不存在重大问题。关于基准测试的问题,鉴于已收到该评估机构的正式答复,此处不再赘述。
Q. 基准测试40分的评分比例今后是否有调整的可能性?
关于分数分配,这是我们在第一阶段综合考虑了主要基准、与参赛精英团队达成共识制定的共同基准,以及参赛精英团队表示将进行对比的个别基准后得出的结果。
鉴于该方式存在优缺点,因此在第二阶段,经讨论决定统一采用具有全球公信力的AAII基准进行评估。
虽然在评分问题等方面存在不同观点,但总体而言,我们最终在听取了参与企业的意见并经专家讨论后,确定了评分评估方式和分数分配方案。
请理解,这是在充分听取参与企业异议,并经过形成共识直至异议消除这一过程后得出的结果。
[E-Daily 文承勇 记者]
“自主AI基础模型开发项目”作为最终赢家,表面上的目标原本是:通过三轮评选最终选定两家企业,由这两家企业在2027年这一年内,推进具备全球水平约95%能力的AI模型开发。
不过,正如我们在第一次简报会上所说,这次也要重申:该项目的目的并非仅仅是为了选出一两家获胜企业,而是希望通过这种竞争,为我国AI生态系统向全球水平发展提供直接或间接的推动力。
其核心在于提升AI生态系统本身的竞争力。
关于第三轮评估,政府预算将于近期确定,届时我们将安排具体说明会。
问:是新设立一个补充“独破模”的“前沿模型”项目,还是将现有的“独破模”重组为“前沿”竞争模式?
目前尚无法提供更具体的说明,敬请谅解。
关于整体的问题意识,我再次强调一下。
全球前沿企业的模型性能正呈几何级数增长,而通过这些模型扩展全球服务生态系统的进程也在以极快的速度展开。
参与“独帕莫”项目的企业也一致认同,需要建立一个新的竞争格局。
为了在我国国内生态系统中打造出可与全球前沿企业比肩的模型,并确保国内外AI生态系统的可持续性及持续保持竞争力,我们需要采取新的方法。
关于资源是像以往那样分散配置,还是集中配置,以及企业应组建何种形式的联盟等,我们正与作为直接当事方的企业进行广泛讨论。
政府内部也在讨论财政支持的可能性及实效性等问题。待方案具体化后,我们将再次向大家说明。
问:"独破模"第三次评估与前沿AI项目之间有何关系?
随着本次“独破模”项目下半年第三阶段的推进,如果按照我们讨论的计划在2027年实施,将形成新的竞争格局;至于如何处理二者之间的关系,待政府预算确定后,我们将尽快向大家通报讨论的具体内容。
目前已形成共识,即应摆脱当前的竞争模式,以我们力所能及的方式,重新构建实质上可与全球前沿企业模型相媲美的模型竞争格局。
问:第三轮评估的时间安排和具体评估方式是怎样的?
关于第三阶段评估,我们已于今日向各企业通报了结果。目前尚有异议申诉程序,若收到异议,我们将进行说明,之后将立即推进后续工作。
关于第三阶段的具体评估方案,我们将结合本次第一、二阶段评估的经验,审视是否需要进一步完善,并与参与的3家企业协商后,计划尽快确定并公布。
Q. 通过第三轮评估的3支团队将获得多少GPU支持?
(崔东元局长)关于GPU费用,假设租赁GPU 6个月,我们估算大约需要400亿韩元。
由于共有3支团队,若将本次第三阶段期间向这3支团队提供的GPU支持换算成金额,预计约为1,200亿韩元。
国民评价最初以组建200人普通国民评价团为目标进行招募。当时约有1,400人报名,从中随机选出200人作为评价团成员。
我们认为民众的参与热情非常高。最终共有185名民众参与了评估。
经最终审查,普通民众评估并未对当选结果产生影响。
Q. 用户评分普遍偏低的原因是
最终共有185人参与。
我们从1,400名报名者中随机选出,为了排查利益冲突,要求大家签署关于与所属公司是否存在利益冲突的声明,并填写当前所属机构等信息,对每一位参与者进行了逐一核查。
其中确实存在利益冲突的情况,而且在实际参与者中,也有部分人未提交答复。
至于评估结果是否可以形容为“苛刻”,我不敢断言。各指标之间的偏差并不大。
由于共有4家企业,各指标的内部差异不大,评估分数的差距也大同小异。
特别是在用户评价环节,我们还对那些将所有票数集中投给特定企业,或给予高分、满分、最低分的情况进行了筛除。
综合这些因素,最终结果的偏差并不能说比其他指标更大。
Q. 与Artificial Analysis将开展何种合作?
AAII在本次评估中也持续展现了对韩国自主AI基础模型项目的关注。
为了本次评估,他们专门搭建了平台,并通过具体合作确保评估能在短期内准确、公正地进行。
今后,在AAII的评估方面,我们也计划在第三轮评估中继续保持合作关系,进行专业意见交流或咨询。
该项目并非为了选出一家或两家胜出企业,而是旨在通过这种竞争,为我国AI生态系统向全球水平发展提供直接或间接的推动力。
在AAII全球基准测试中注册的AI开发公司约有58家。想必大家也知道,这58家企业中绝大多数来自美国和中国。
不过,若观察孕育这58家竞争企业的国家,包括美国、中国以及我国在内,共有12个国家正在开发AI模型。其中,韩国企业有7家入选。
在全球AI生态系统正被中美两国垄断的背景下,我们特别关注到,韩国正逐渐成长为构建其他国家所不具备的坚实AI生态系统的核心力量。
正如第一轮未被选中的Motif在第二轮中参与并展现出卓越性能一样,即便在政府支持不足的情况下,这家仅有30余名员工的小型AI初创企业,也通过政府项目创造了令人瞩目的成果。
我们认为,这一过程本身就表明,韩国的AI生态系统正在全球AI生态系统中成长为仅次于美国和中国的第三大力量,并且正朝着这一目标稳步前进。
问:在第二轮评估中,是否有团队在三个领域均夺得第一名?
是的,三个领域各不相同。各领域结果各异,没有哪家企业能始终保持第一名。
在“独基模”第二轮评估中,Upstage、SKTelecom(017670) 和LG Corp.(003550) AI研究院通过了评估。
科学技术信息通信部第二副部长柳济明在18日举行的“读破摩”第二轮评估结果简报会上表示: 表示:“Motif的AAII得分确实非常高,表现出了卓越的成果”,但同时指出:“在100分满分中,AAII仅占25分;综合其他评估来看,虽然其技术实力出众,但在占75分且权重较大的‘易用性·实用性’部分,其评分低于其他企业。”
柳次长还表示:“基准匹配相关问题并未反映在评估中”,并指出:“通过AAII的官方答复和专家评估,我们得出结论认为不存在不公平的技术支持等情况。”所谓基准匹配,是指针对特定的测试集或评估方式对模型进行过度优化的行为。
以下是刘济明第二副部长等科技信息通信部相关人员与记者的问答环节。Q. AAII排名第一的Motif为何在“独破模”第二轮评估中被淘汰?
Motif在AAII评分中表现非常出色。在当时的评估中,它确实展现出了引人注目的卓越成绩,这是不争的事实。
不过,在100分的总分中,AAII仅占25分。综合其他评估来看,虽然其技术实力出众,但在评估中占75分且权重较大的易用性与实用性方面,相较于其他企业获得了较低的评分——这便是最终可以得出的结论。
希望您能这样理解。
Q. Motif在易用性方面获得较低评分,这一情况是否同时适用于专家评估和AI专业用户评估?
关于企业的排名或具体分数,如果属于有意义的信息,我们本会尽可能公开,但我们担心因分数差异可能引发其他解读,或导致该企业遭受意想不到的不利影响。
鉴于上一轮评估中也曾出现过类似情况,因此很难详细公开具体在哪些项目上获得了怎样的评价。
再次重申,Motif已在技术实力方面证明了其世界级水平,这一点在评估中也得到了充分体现。
不过,若能说明其在易用性及实用性方面相较于其他机型评分较低这一点,我们将不胜感激。
Q. 政府层面是否会对Motif提供单独支持或后续措施?
Motif Technologies通过此次结果,在AAII全球基准排行榜上获得了全球关注。我们认为,从极具独创性的算法模型设计到展现出AI技术的全球竞争力,这都是一项非常重大的成果。
不过,我们是一家依靠少数研究人员、以研发为核心积累技术实力的科技企业。此前我们已表示,在第一轮之后进行的第二轮评估中,将扩大对易用性及实用性的评估范围,此次结果也反映了这一调整。
未来,我们的AI模型将在多个产业现场及公共领域得到应用,从这一角度来看,可以认为Motif已经奠定了坚实的基础。
至于具体如何支持Motif这一问题,除了Motif通过参与政府未来推进的项目来获得支持外,我认为目前讨论专门针对Motif的特别措施等内容并不合适。
问:将Motif淘汰是否因为其与大企业相比,在合作与生态系统贡献方面有所欠缺?毕竟这属于专家评估的考核项目之一。
很难说某个具体项目起到了决定性作用,希望您能理解这是各项目第一名企业,以及第二、第三名企业之间差距等因素综合形成的结果。
无论是基准评估、专家评估还是用户评估,各项之间的差距都非常微小。
总体来看,基准评估中第一名与第四名之间的差距为4分,用户评估中为5分,因此可以理解为结果在两者之间波动。
Q. 基准测试争议是否影响了Motif的淘汰结果?
总而言之,基准测试相关问题并未反映在评估中。
我们以AAII的官方答复为依据,并通过专家评估对各项事宜进行了验证,最终得出结论:评估竞争中不存在不公平的技术支持等情况。
据我们所知,基准测试方面确实存在一些争议。我们已就基准测试评估事宜正式委托Artificial Analysis公司进行分析,并收到了官方答复。
Artificial Analysis在解释其如何阻止模型为取得高分而进行的各种优化尝试时,针对此次我们委托审查的事项,回复称经审查未发现足以证明存在系统性死记硬背或过拟合问题的线索。
因此,我们收到回复称该部分不存在重大问题。关于基准测试的问题,鉴于已收到该评估机构的正式答复,此处不再赘述。
Q. 基准测试40分的评分比例今后是否有调整的可能性?
关于分数分配,这是我们在第一阶段综合考虑了主要基准、与参赛精英团队达成共识制定的共同基准,以及参赛精英团队表示将进行对比的个别基准后得出的结果。
鉴于该方式存在优缺点,因此在第二阶段,经讨论决定统一采用具有全球公信力的AAII基准进行评估。
虽然在评分问题等方面存在不同观点,但总体而言,我们最终在听取了参与企业的意见并经专家讨论后,确定了评分评估方式和分数分配方案。
请理解,这是在充分听取参与企业异议,并经过形成共识直至异议消除这一过程后得出的结果。
“独破模”第三轮评估按计划进行……正考虑重组前沿级模型竞争体系Q. “独破模”第三轮评估中,最终选定一两家企业的原有计划是否可能改变?
“自主AI基础模型开发项目”作为最终赢家,表面上的目标原本是:通过三轮评选最终选定两家企业,由这两家企业在2027年这一年内,推进具备全球水平约95%能力的AI模型开发。
不过,正如我们在第一次简报会上所说,这次也要重申:该项目的目的并非仅仅是为了选出一两家获胜企业,而是希望通过这种竞争,为我国AI生态系统向全球水平发展提供直接或间接的推动力。
其核心在于提升AI生态系统本身的竞争力。
关于第三轮评估,政府预算将于近期确定,届时我们将安排具体说明会。
问:是新设立一个补充“独破模”的“前沿模型”项目,还是将现有的“独破模”重组为“前沿”竞争模式?
目前尚无法提供更具体的说明,敬请谅解。
关于整体的问题意识,我再次强调一下。
全球前沿企业的模型性能正呈几何级数增长,而通过这些模型扩展全球服务生态系统的进程也在以极快的速度展开。
参与“独帕莫”项目的企业也一致认同,需要建立一个新的竞争格局。
为了在我国国内生态系统中打造出可与全球前沿企业比肩的模型,并确保国内外AI生态系统的可持续性及持续保持竞争力,我们需要采取新的方法。
关于资源是像以往那样分散配置,还是集中配置,以及企业应组建何种形式的联盟等,我们正与作为直接当事方的企业进行广泛讨论。
政府内部也在讨论财政支持的可能性及实效性等问题。待方案具体化后,我们将再次向大家说明。
问:"独破模"第三次评估与前沿AI项目之间有何关系?
随着本次“独破模”项目下半年第三阶段的推进,如果按照我们讨论的计划在2027年实施,将形成新的竞争格局;至于如何处理二者之间的关系,待政府预算确定后,我们将尽快向大家通报讨论的具体内容。
目前已形成共识,即应摆脱当前的竞争模式,以我们力所能及的方式,重新构建实质上可与全球前沿企业模型相媲美的模型竞争格局。
问:第三轮评估的时间安排和具体评估方式是怎样的?
关于第三阶段评估,我们已于今日向各企业通报了结果。目前尚有异议申诉程序,若收到异议,我们将进行说明,之后将立即推进后续工作。
关于第三阶段的具体评估方案,我们将结合本次第一、二阶段评估的经验,审视是否需要进一步完善,并与参与的3家企业协商后,计划尽快确定并公布。
Q. 通过第三轮评估的3支团队将获得多少GPU支持?
(崔东元局长)关于GPU费用,假设租赁GPU 6个月,我们估算大约需要400亿韩元。
由于共有3支团队,若将本次第三阶段期间向这3支团队提供的GPU支持换算成金额,预计约为1,200亿韩元。
公众评估不影响最终结果……与AAII合作开展第三轮评估Q. 普通公众评估的反应及其对最终结果的影响如何?
国民评价最初以组建200人普通国民评价团为目标进行招募。当时约有1,400人报名,从中随机选出200人作为评价团成员。
我们认为民众的参与热情非常高。最终共有185名民众参与了评估。
经最终审查,普通民众评估并未对当选结果产生影响。
Q. 用户评分普遍偏低的原因是
最终共有185人参与。
我们从1,400名报名者中随机选出,为了排查利益冲突,要求大家签署关于与所属公司是否存在利益冲突的声明,并填写当前所属机构等信息,对每一位参与者进行了逐一核查。
其中确实存在利益冲突的情况,而且在实际参与者中,也有部分人未提交答复。
至于评估结果是否可以形容为“苛刻”,我不敢断言。各指标之间的偏差并不大。
由于共有4家企业,各指标的内部差异不大,评估分数的差距也大同小异。
特别是在用户评价环节,我们还对那些将所有票数集中投给特定企业,或给予高分、满分、最低分的情况进行了筛除。
综合这些因素,最终结果的偏差并不能说比其他指标更大。
Q. 与Artificial Analysis将开展何种合作?
AAII在本次评估中也持续展现了对韩国自主AI基础模型项目的关注。
为了本次评估,他们专门搭建了平台,并通过具体合作确保评估能在短期内准确、公正地进行。
今后,在AAII的评估方面,我们也计划在第三轮评估中继续保持合作关系,进行专业意见交流或咨询。
“像Motif一样的新兴初创企业崭露头角……这是提升国内AI生态系统竞争力的过程”Q. “独破模”项目的最终目的难道不是选出一个或两个国家代表级AI吗?
该项目并非为了选出一家或两家胜出企业,而是旨在通过这种竞争,为我国AI生态系统向全球水平发展提供直接或间接的推动力。
在AAII全球基准测试中注册的AI开发公司约有58家。想必大家也知道,这58家企业中绝大多数来自美国和中国。
不过,若观察孕育这58家竞争企业的国家,包括美国、中国以及我国在内,共有12个国家正在开发AI模型。其中,韩国企业有7家入选。
在全球AI生态系统正被中美两国垄断的背景下,我们特别关注到,韩国正逐渐成长为构建其他国家所不具备的坚实AI生态系统的核心力量。
正如第一轮未被选中的Motif在第二轮中参与并展现出卓越性能一样,即便在政府支持不足的情况下,这家仅有30余名员工的小型AI初创企业,也通过政府项目创造了令人瞩目的成果。
我们认为,这一过程本身就表明,韩国的AI生态系统正在全球AI生态系统中成长为仅次于美国和中国的第三大力量,并且正朝着这一目标稳步前进。
问:在第二轮评估中,是否有团队在三个领域均夺得第一名?
是的,三个领域各不相同。各领域结果各异,没有哪家企业能始终保持第一名。