[E-DailyKim Hyun-ah 记者] 在全球基准机构Artificial Analysis的AI模型评估(AAII)中曾位列韩国第一、全球第十的Motif Technologies,其自主AI基础模型项目(独帕莫)在第二阶段评估中被淘汰的具体原因已公布。
Motif虽在全球基准测试中获得最高分,但在NIA基准测试、专家评估及实际用户评估中,均落后于SKTelecom(017670)和LG Corp.(003550) AI研究院。
科学技术信息通信部一位高级官员在接受《E-Daily》电话采访时,就Motif被淘汰一事解释道:“这不仅仅是因为实用性较低,而是在专业性和易用性方面,整体得分都偏低”,并表示“性能未达标是事实”。
科技信息通信部于20日公布了“独破模”第二阶段评估的详细评估标准及各项目排名第一的企业。由于此前公布评估结果时未公开详细分数,引发了关于评估透明度的争议,因此此次参照第一阶段评估的标准,公开了各评估项目的排名第一的企业及其得分。
本次评估总分100分,由基准测试40分、专家评估35分、用户评估25分组成。
最引人注目的是,各评估领域的榜首企业各不相同。在AAII全球基准测试中,Motif位居榜首;在NIA基准测试及AI专业用户评估中,SK电信位居榜首;而在专家评估和普通公众评估中,LG AI研究院则分别夺得第一名。
在25分的全球AAII基准测试中,Motif以11.9分位居榜首。而15分的NIA基准测试中,SK电讯以13.4分排名第一。
在35分的专家评估中,LG AI研究院以29.5分位居榜首。在15分的AI专业用户评估中,SK电信以11.6分排名第一;而在10分的普通民众评估中,LG AI研究院以7.6分夺得第一。
虽然Motif在全球公开基准测试中表现突出,但在韩国国内自主基准测试以及专家和实际用户评估中,SK电信和LG AI研究院则占据了领先地位。
韩国科学技术信息通信部一位高级官员就Motif的评估结果表示:“这并非应用性问题,而是专业性和易用性两方面都稍显不足”,并指出:“性能确实未达预期,但分差并不大。”
Motif在AAII中获得11.9分,在满分25分的评分体系中创下最高分,但在NIA基准测试中,SK电信以13.4分位居榜首。
NIA基准测试涵盖数学、知识、长文理解、安全性、可靠性、韩语及指令执行等7个领域。这是针对国内环境下模型性能的单独验证,仅凭单一全球公开指标难以全面反映。
在专家评估中,Motif也落后于LG AI研究院。专家评估由来自产业界3人、学术界5人、研究界2人的外部专家组成,历时约5天通过书面评估和问答环节,对开发战略与技术、开发成果与计划、生态系统波及效应及贡献计划等进行了评估。
其中,35分中的10分分配给“开发战略及技术”部分。该部分涵盖了开发技术的卓越性与创新性、技术独创性、性能提升程度、资源利用及处理效率,以及安全可靠的AI模型开发技术等。
其余10分分配给开发成果与计划,15分分配给生态系统及全球影响。
LG AI研究院在此次专家评估中以29.5分位居榜首。4支精英团队的平均分为28.75分。
在用户评估中,Motif也未能夺得第一。由AI初创企业代表等组成的AI专业用户评估中,SK电讯以11.6分位居第一;而在普通民众评估中,LG AI研究院以7.6分获得最高分。
科技信息通信部解释称,在用户评估中,并非单纯评估网站的设计或UI·UX,而是指导评估者以AI模型生成的内容及其质量为核心进行评估。
49名AI专业用户和185名普通民众通过实际使用AI服务,以绝对评分方式进行了评分。
这一结果表明,本次评估并非仅凭特定的基准测试性能来决定最终排名。即便是Motif在全球基准测试中位居榜首,但在综合国内性能验证、专家的技术与商业可行性评估以及实际用户评估后的最终结果中,仍有可能被淘汰。
科学技术信息通信部在此次第二轮评估中,还单独审查了自主性的最低标准。评估范围还包括该模型在技术、政策及伦理层面是否满足作为自主AI模型的标准。
针对Motif,考虑到其作为新参与团队的特殊性,在生态系统波及效应评估中,甚至将其现有AI模型的实际应用推广业绩和计划也纳入了评估范围。科技信息通信部解释称,此前3支精英团队的评估仅针对自主AI模型及其衍生模型的实际应用推广业绩和计划,而Motif的评估则将现有AI模型的实际应用推广业绩和计划一并纳入了考量。
[由生成式AI撰写]
Motif虽在全球基准测试中获得最高分,但在NIA基准测试、专家评估及实际用户评估中,均落后于SKTelecom(017670)和LG Corp.(003550) AI研究院。
科学技术信息通信部一位高级官员在接受《E-Daily》电话采访时,就Motif被淘汰一事解释道:“这不仅仅是因为实用性较低,而是在专业性和易用性方面,整体得分都偏低”,并表示“性能未达标是事实”。
科技信息通信部于20日公布了“独破模”第二阶段评估的详细评估标准及各项目排名第一的企业。由于此前公布评估结果时未公开详细分数,引发了关于评估透明度的争议,因此此次参照第一阶段评估的标准,公开了各评估项目的排名第一的企业及其得分。
本次评估总分100分,由基准测试40分、专家评估35分、用户评估25分组成。
最引人注目的是,各评估领域的榜首企业各不相同。在AAII全球基准测试中,Motif位居榜首;在NIA基准测试及AI专业用户评估中,SK电信位居榜首;而在专家评估和普通公众评估中,LG AI研究院则分别夺得第一名。
在25分的全球AAII基准测试中,Motif以11.9分位居榜首。而15分的NIA基准测试中,SK电讯以13.4分排名第一。
在35分的专家评估中,LG AI研究院以29.5分位居榜首。在15分的AI专业用户评估中,SK电信以11.6分排名第一;而在10分的普通民众评估中,LG AI研究院以7.6分夺得第一。
虽然Motif在全球公开基准测试中表现突出,但在韩国国内自主基准测试以及专家和实际用户评估中,SK电信和LG AI研究院则占据了领先地位。
韩国科学技术信息通信部一位高级官员就Motif的评估结果表示:“这并非应用性问题,而是专业性和易用性两方面都稍显不足”,并指出:“性能确实未达预期,但分差并不大。”
Motif在AAII中获得11.9分,在满分25分的评分体系中创下最高分,但在NIA基准测试中,SK电信以13.4分位居榜首。
NIA基准测试涵盖数学、知识、长文理解、安全性、可靠性、韩语及指令执行等7个领域。这是针对国内环境下模型性能的单独验证,仅凭单一全球公开指标难以全面反映。
在专家评估中,Motif也落后于LG AI研究院。专家评估由来自产业界3人、学术界5人、研究界2人的外部专家组成,历时约5天通过书面评估和问答环节,对开发战略与技术、开发成果与计划、生态系统波及效应及贡献计划等进行了评估。
其中,35分中的10分分配给“开发战略及技术”部分。该部分涵盖了开发技术的卓越性与创新性、技术独创性、性能提升程度、资源利用及处理效率,以及安全可靠的AI模型开发技术等。
其余10分分配给开发成果与计划,15分分配给生态系统及全球影响。
LG AI研究院在此次专家评估中以29.5分位居榜首。4支精英团队的平均分为28.75分。
在用户评估中,Motif也未能夺得第一。由AI初创企业代表等组成的AI专业用户评估中,SK电讯以11.6分位居第一;而在普通民众评估中,LG AI研究院以7.6分获得最高分。
科技信息通信部解释称,在用户评估中,并非单纯评估网站的设计或UI·UX,而是指导评估者以AI模型生成的内容及其质量为核心进行评估。
49名AI专业用户和185名普通民众通过实际使用AI服务,以绝对评分方式进行了评分。
这一结果表明,本次评估并非仅凭特定的基准测试性能来决定最终排名。即便是Motif在全球基准测试中位居榜首,但在综合国内性能验证、专家的技术与商业可行性评估以及实际用户评估后的最终结果中,仍有可能被淘汰。
科学技术信息通信部在此次第二轮评估中,还单独审查了自主性的最低标准。评估范围还包括该模型在技术、政策及伦理层面是否满足作为自主AI模型的标准。
针对Motif,考虑到其作为新参与团队的特殊性,在生态系统波及效应评估中,甚至将其现有AI模型的实际应用推广业绩和计划也纳入了评估范围。科技信息通信部解释称,此前3支精英团队的评估仅针对自主AI模型及其衍生模型的实际应用推广业绩和计划,而Motif的评估则将现有AI模型的实际应用推广业绩和计划一并纳入了考量。