[E-DailyKim Hyun-ah 记者] 看到自主AI基础模型(独基模)的第二次评估结果时,我首先想到的是:“这真的对吗?”
这是因为Motif Technologies——在受政府委托、由全球AI模型评估机构Artificial Analysis(AA)实施的人工智能综合指标(AAII)评估中获得47分,位列韩国企业第一、全球第十——最终却未能晋级。
另一方面,在AAII中获得31分的LG Corp.(003550) 人工智能研究院则晋级了第三轮评估。Upstage获得37分,SKTelecom(017670)获得35分。
不过,从《每日经济》获得的详细评估结果来看,Motif被淘汰的背景更加清晰。
Motif在基准测试中获得24.6分,在专家评估中获得27.1分。但在用户评估中仅得14.1分,其中专业用户评估为8.4分,普通公众评估为5.7分。
综合得分65.8分。在衡量全球技术实力的AAII评估中,Motif虽领先于所有国内竞争对手,但用户评价中的劣势最终导致其被淘汰。
政府方面也解释称,虽然Motif的技术实力出众,但在易用性和实际应用性方面获得的评价相对较低,这也是导致其被淘汰的原因之一。
既然如此,不得不问:
“独破模”项目的本质究竟是什么?是寻找能够开发世界级基础模型的企业,还是选出当下应用最广泛的人工智能技术?
来源=科学技术信息通信部
AAII原始分数分别为:Motif 47分、Upstage 37分、SK电信 35分、LG AI研究院 31分。
按25分满分换算,Motif得11.75分,Upstage得9.25分,SK电信得8.75分,LG得7.75分。
在AAII原始得分中,Motif与LG的差距为16分。但在最终评估中,这一分差缩小至4分。加上NIA评估的15分,基准评估总分即为40分。
这种机制使得即使在全球技术实力评估中存在较大差距,在最终评估中该差距也会大幅缩小。
另一方面,专家评估35分和用户评估25分等共计60分,不仅取决于模型本身的性能,实际应用价值和影响力等因素也起着重要作用。
此次Motif的案例充分展示了这种评分结构对结果的影响之大。
一位AI专家针对此次评估结果表示:“结果完全取决于实际可用性得分,这难道是应该这样吗?”并由此质疑了“独破莫”项目的初衷。
他特别指出:“如果要提高易用性,直接使用开放权重模型就行了”,并强调易用性只是在模型性能达到一定水平后才需额外考虑的因素。
[E-Daily 文承勇 记者]
验证技术能力能否真正应用于实际服务和产业现场,在国家AI项目中也至关重要。问题在于其权重。
“易用性”好并不一定意味着模型本身的性能就出色。因为这取决于在模型之上构建了什么样的服务环境和工具,即所谓的“harness”。
反过来说,如果基础模型的性能已达到世界级水平,那么如何将其服务化,也可以视为后续的课题。
特别是像Motif这样仅凭30余名员工就打造出全球级模型性能的初创企业,与拥有大规模组织和客户基础的竞争对手,是否应以同一标准来评估其应用性,这一点也值得探讨。
在本次第二轮评估中,影响力和贡献计划的分值也从原来的10分提高到了15分。
关键在于,这并非要得出“Motif被淘汰不公”的结论。
在AAII评估中,即便是全球顶尖模型也难以超过50分,而Motif以47分证明了其全球竞争力,但其模型却因用户评估仅得14.1分而被淘汰——这种评分结构究竟是否符合“解码模拟”项目的初衷?
更何况,在总分100分中,专家评估35分和用户评估25分等共计60分,属于受定性判断影响较大的领域。
既然权重如此之高,就应当公开评估标准、具体项目、各评委的评分以及最终换算方式。只有这样,才能验证在哪些项目上“Motif”与竞争对手的分数拉开差距,以及这一差距对最终淘汰结果产生了多大影响。
Motif同样需要通过这一程序,核查基准测试、NIA、专家及用户评估的原始分数和详细计算公式。
如果评估没有问题,政府直接公开即可。反之,如果存在企业难以预先预测的评分细则或评估标准,则应予以改进。
也没有必要将此次争议仅视为Motif与LG的胜负问题。
在今后将投入数百亿韩元乃至数万亿韩元税款的国家AI项目中,究竟应多大程度上重视技术实力,又应在多大程度上体现易用性和实用性,这属于政策层面的选择。
不过,评分标准直接决定了项目的方向。
如果一边声称要打造世界级的基础模型,实际却形成了一种结构——即使用体验的评估比模型性能对结果产生更大的影响,那么就必须重新审视:这项国家AI项目究竟是为了什么。
企业必须能够相信评估标准并据此制定开发战略,而在结果出炉后,任何人都能对结果进行验证。
国家代表级AI项目所需要的,是让致力于打造世界级模型的企业能够信任并参与竞争的评估机制。
在此次“独破模”争议中,真正需要反思的并非Motif被淘汰这件事本身,而是导致其淘汰的“评分设计”是否真的符合“独破模”的初衷。
这是因为Motif Technologies——在受政府委托、由全球AI模型评估机构Artificial Analysis(AA)实施的人工智能综合指标(AAII)评估中获得47分,位列韩国企业第一、全球第十——最终却未能晋级。
另一方面,在AAII中获得31分的LG Corp.(003550) 人工智能研究院则晋级了第三轮评估。Upstage获得37分,SKTelecom(017670)获得35分。
不过,从《每日经济》获得的详细评估结果来看,Motif被淘汰的背景更加清晰。
Motif在基准测试中获得24.6分,在专家评估中获得27.1分。但在用户评估中仅得14.1分,其中专业用户评估为8.4分,普通公众评估为5.7分。
综合得分65.8分。在衡量全球技术实力的AAII评估中,Motif虽领先于所有国内竞争对手,但用户评价中的劣势最终导致其被淘汰。
政府方面也解释称,虽然Motif的技术实力出众,但在易用性和实际应用性方面获得的评价相对较低,这也是导致其被淘汰的原因之一。
既然如此,不得不问:
“独破模”项目的本质究竟是什么?是寻找能够开发世界级基础模型的企业,还是选出当下应用最广泛的人工智能技术?
AAII 47分在最终评估中仅得11.75分“Dokpamo”评估由基准测试40分、专家评估35分、用户评估25分组成,总分100分。其中,AAII在基准测试40分中占25分。
AAII原始分数分别为:Motif 47分、Upstage 37分、SK电信 35分、LG AI研究院 31分。
按25分满分换算,Motif得11.75分,Upstage得9.25分,SK电信得8.75分,LG得7.75分。
在AAII原始得分中,Motif与LG的差距为16分。但在最终评估中,这一分差缩小至4分。加上NIA评估的15分,基准评估总分即为40分。
这种机制使得即使在全球技术实力评估中存在较大差距,在最终评估中该差距也会大幅缩小。
另一方面,专家评估35分和用户评估25分等共计60分,不仅取决于模型本身的性能,实际应用价值和影响力等因素也起着重要作用。
此次Motif的案例充分展示了这种评分结构对结果的影响之大。
一位AI专家针对此次评估结果表示:“结果完全取决于实际可用性得分,这难道是应该这样吗?”并由此质疑了“独破莫”项目的初衷。
他特别指出:“如果要提高易用性,直接使用开放权重模型就行了”,并强调易用性只是在模型性能达到一定水平后才需额外考虑的因素。
“易用性”是模型开发的核心吗? 当然,这并非意味着易用性与实用性评估本身有错。
验证技术能力能否真正应用于实际服务和产业现场,在国家AI项目中也至关重要。问题在于其权重。
“易用性”好并不一定意味着模型本身的性能就出色。因为这取决于在模型之上构建了什么样的服务环境和工具,即所谓的“harness”。
反过来说,如果基础模型的性能已达到世界级水平,那么如何将其服务化,也可以视为后续的课题。
特别是像Motif这样仅凭30余名员工就打造出全球级模型性能的初创企业,与拥有大规模组织和客户基础的竞争对手,是否应以同一标准来评估其应用性,这一点也值得探讨。
在本次第二轮评估中,影响力和贡献计划的分值也从原来的10分提高到了15分。
关键在于,这并非要得出“Motif被淘汰不公”的结论。
在AAII评估中,即便是全球顶尖模型也难以超过50分,而Motif以47分证明了其全球竞争力,但其模型却因用户评估仅得14.1分而被淘汰——这种评分结构究竟是否符合“解码模拟”项目的初衷?
更何况,在总分100分中,专家评估35分和用户评估25分等共计60分,属于受定性判断影响较大的领域。
既然权重如此之高,就应当公开评估标准、具体项目、各评委的评分以及最终换算方式。只有这样,才能验证在哪些项目上“Motif”与竞争对手的分数拉开差距,以及这一差距对最终淘汰结果产生了多大影响。
当务之急不是“企业救济”,而是评估验证科学技术信息通信部已将第二轮评估结果通知各企业,并计划开展异议申诉和说明程序。
Motif同样需要通过这一程序,核查基准测试、NIA、专家及用户评估的原始分数和详细计算公式。
如果评估没有问题,政府直接公开即可。反之,如果存在企业难以预先预测的评分细则或评估标准,则应予以改进。
也没有必要将此次争议仅视为Motif与LG的胜负问题。
在今后将投入数百亿韩元乃至数万亿韩元税款的国家AI项目中,究竟应多大程度上重视技术实力,又应在多大程度上体现易用性和实用性,这属于政策层面的选择。
不过,评分标准直接决定了项目的方向。
如果一边声称要打造世界级的基础模型,实际却形成了一种结构——即使用体验的评估比模型性能对结果产生更大的影响,那么就必须重新审视:这项国家AI项目究竟是为了什么。
企业必须能够相信评估标准并据此制定开发战略,而在结果出炉后,任何人都能对结果进行验证。
国家代表级AI项目所需要的,是让致力于打造世界级模型的企业能够信任并参与竞争的评估机制。
在此次“独破模”争议中,真正需要反思的并非Motif被淘汰这件事本身,而是导致其淘汰的“评分设计”是否真的符合“独破模”的初衷。