[E-DailyKim Hyun-ah 记者] 针对“独立AI基础模型(独基模)”项目第二阶段评估中,LG Corp.(003550) AI研究院获得专家评估最高分一事,AI业界指出应更具体地公开评估依据。
鉴于AAII基准测试与专家评估结果存在较大差异,业界认为应明确专家评估中哪些技术要素获得了高分,以及评估委员们依据何种标准进行评判。
科学技术信息通信部解释称,此次评估并非仅依据特定基准测试成绩来确定排名,而是综合评估了专业性、可用性及产业影响等各方面因素。
科技信息通信部在20日《每日经济》提出质疑后,进一步公开了“独破模”第二阶段评估的标准和结果。据此,在满分35分的专家评估中,LG AI研究院以29.5分在4支精英团队中获得最高分。4支团队的平均分为28.75分。
另一方面,在作为全球AI基准的人工智能指数(AAII)评估中,Motif Technologies以25分满分中的11.9分位居榜首,而LG AI研究院在4支团队中排名垫底。AAII排名依次为Motif Technologies、Upstage、SK电讯、LG AI研究院。
AAII排名第一的Motif Technologies被淘汰,而AAII排名垫底的LG AI研究院却在专家评估中跃居榜首,各评估领域的结果呈现出显著差异。
AI业界有观点认为,比起结果本身,更应能够确认评估过程和判断依据。
一位专家表示:“关键在于专家评估中是否由具备专业能力、能够准确判断AI模型开发方法论和技术成果的评估委员参与”,并指出:“有必要确认是谁根据什么标准对模型的技术成果和开发战略进行评估的。”
他进一步指出:“由于与各精英团队存在利益冲突的问题,最深入理解实际AI模型开发和技术情况的专家可能被排除在评审之外”,并强调:“如果是这样,就需要查明评估委员们是基于何种专业能力来判断技术成果的。”
另一位专家则主张,有必要根据LG AI研究院公开的技术资料,更具体地说明其在专家评估中获得最高分的背景。
该专家指出:“从LG技术报告来看,虽然模型规模扩大了,但SFT(监督微调)并未做好。那么,这究竟算什么创新?”并表示:“专家评估中排名第一的结果必然与基准测试结果有关,这令人难以理解。” 其意在指出,仅凭扩大模型规模这一因素,很难解释其在专家评估中获得高技术分数的背景。SFT(Supervised Fine-Tuning,监督微调)是一种利用人类提供标准答案的数据,对AI模型的回答能力进行额外训练的监督微调方法。
评估项目包括开发战略及技术10分、开发成果及计划10分、影响及贡献计划15分,总分35分。这一分数高于全球基准AAII的25分。
在“开发战略及技术”方面,评估内容包括开发技术的优秀性与创新性、技术独创性、性能提升程度、资源利用及处理效率,以及安全可靠的人工智能模型开发技术等。此外,“开发成果及计划”以及“生态系统与全球辐射效应”也纳入了评估范围。
各团队的得分是通过计算每位评委给出的分数中,剔除最高分和最低分后剩余分数的算术平均值得出的。
不过,评估委员具体提出了哪些问题、企业如何作答,以及哪些技术要素获得了高分等详细评判依据并未公开。
业界认为,即使不要求公开评估委员个人的个人信息,也有必要公开各团队的详细得分、各评估项目的得分以及主要判断依据等。
一位专家表示:“既然评估的是开发战略和技术成果,就应当能够确认提出了哪些问题、企业是如何回答的,以及评委们是基于什么依据给出分数的。”他补充道:“否则,就只是名义上的专家评估,实际上很难验证评估究竟是基于何种专业性进行的。”
第二轮评估总分100分,其中基准测试占40分、专家评估占35分、用户评估占25分。
在全球AAII基准测试中,Motif Technologies以11.9分位居榜首,但在NIA基准测试中,SK电讯以13.4分排名第一。在AI专业用户评估中,SK电讯以11.6分位居榜首;而在普通民众评估中,LG AI研究院以7.6分获得最高分。
科技信息通信部解释称,各评估领域中表现突出的团队各不相同。
针对Motif Technologies的淘汰,科技信息通信部解释称,这并非仅仅因为实用性较低,而是其专业性和易用性方面的整体得分均较低,并表示“性能未达标确实是事实”。
该部解释称,除了Motif Technologies展现优势的全球公开基准测试外,综合考虑反映国内环境的NIA基准测试、专家评估以及实际用户评估等因素,最终结果必然会有所不同。
科技信息通信部还解释称,用户评估并非仅针对简单的网站设计或UI·UX,而是以AI模型生成的内容及其质量为核心展开的。共有49名AI专业用户和185名普通民众通过实际使用AI服务进行了评估。
从科技信息通信部的立场来看,不能仅凭一项全球基准测试就选定国家代表AI,还需综合考量其在国内环境中的性能、技术开发能力、实际可用性以及产业影响等。
另一方面,业界部分人士虽认同这一初衷,但鉴于专家评估占整体评估的35%,他们主张应当能够确认LG AI研究院获得29.5分的具体原因,以及与其他团队的分数差距究竟有多大。
科技信息通信部虽然公开了各项目第一名、最高分以及4支队伍的平均分等信息,但并未公布各队的详细得分及分数差距。有观点指出,鉴于这是动用国家预算的“国家代表AI”选拔过程,有必要公开足以验证“为何会出现这一结果”的评估信息,而不仅仅是简单地公布哪支队伍获得了第一名。
鉴于AAII基准测试与专家评估结果存在较大差异,业界认为应明确专家评估中哪些技术要素获得了高分,以及评估委员们依据何种标准进行评判。
科学技术信息通信部解释称,此次评估并非仅依据特定基准测试成绩来确定排名,而是综合评估了专业性、可用性及产业影响等各方面因素。
科技信息通信部在20日《每日经济》提出质疑后,进一步公开了“独破模”第二阶段评估的标准和结果。据此,在满分35分的专家评估中,LG AI研究院以29.5分在4支精英团队中获得最高分。4支团队的平均分为28.75分。
另一方面,在作为全球AI基准的人工智能指数(AAII)评估中,Motif Technologies以25分满分中的11.9分位居榜首,而LG AI研究院在4支团队中排名垫底。AAII排名依次为Motif Technologies、Upstage、SK电讯、LG AI研究院。
AAII排名第一的Motif Technologies被淘汰,而AAII排名垫底的LG AI研究院却在专家评估中跃居榜首,各评估领域的结果呈现出显著差异。
AI业界有观点认为,比起结果本身,更应能够确认评估过程和判断依据。
一位专家表示:“关键在于专家评估中是否由具备专业能力、能够准确判断AI模型开发方法论和技术成果的评估委员参与”,并指出:“有必要确认是谁根据什么标准对模型的技术成果和开发战略进行评估的。”
他进一步指出:“由于与各精英团队存在利益冲突的问题,最深入理解实际AI模型开发和技术情况的专家可能被排除在评审之外”,并强调:“如果是这样,就需要查明评估委员们是基于何种专业能力来判断技术成果的。”
另一位专家则主张,有必要根据LG AI研究院公开的技术资料,更具体地说明其在专家评估中获得最高分的背景。
该专家指出:“从LG技术报告来看,虽然模型规模扩大了,但SFT(监督微调)并未做好。那么,这究竟算什么创新?”并表示:“专家评估中排名第一的结果必然与基准测试结果有关,这令人难以理解。” 其意在指出,仅凭扩大模型规模这一因素,很难解释其在专家评估中获得高技术分数的背景。SFT(Supervised Fine-Tuning,监督微调)是一种利用人类提供标准答案的数据,对AI模型的回答能力进行额外训练的监督微调方法。
专家评估,LG得29.5分……依据何种标准进行评估? 据科学技术信息通信部透露,专家评估由10名外部专家(包括产业界3人、学术界5人、研究界2人)参与,通过书面评估和问答形式进行。
评估项目包括开发战略及技术10分、开发成果及计划10分、影响及贡献计划15分,总分35分。这一分数高于全球基准AAII的25分。
在“开发战略及技术”方面,评估内容包括开发技术的优秀性与创新性、技术独创性、性能提升程度、资源利用及处理效率,以及安全可靠的人工智能模型开发技术等。此外,“开发成果及计划”以及“生态系统与全球辐射效应”也纳入了评估范围。
各团队的得分是通过计算每位评委给出的分数中,剔除最高分和最低分后剩余分数的算术平均值得出的。
不过,评估委员具体提出了哪些问题、企业如何作答,以及哪些技术要素获得了高分等详细评判依据并未公开。
业界认为,即使不要求公开评估委员个人的个人信息,也有必要公开各团队的详细得分、各评估项目的得分以及主要判断依据等。
一位专家表示:“既然评估的是开发战略和技术成果,就应当能够确认提出了哪些问题、企业是如何回答的,以及评委们是基于什么依据给出分数的。”他补充道:“否则,就只是名义上的专家评估,实际上很难验证评估究竟是基于何种专业性进行的。”
政府:“并非仅凭AAII就做出的评估”科学技术信息通信部解释称,此次评估并非仅凭特定的全球基准测试就确定最终排名。
第二轮评估总分100分,其中基准测试占40分、专家评估占35分、用户评估占25分。
在全球AAII基准测试中,Motif Technologies以11.9分位居榜首,但在NIA基准测试中,SK电讯以13.4分排名第一。在AI专业用户评估中,SK电讯以11.6分位居榜首;而在普通民众评估中,LG AI研究院以7.6分获得最高分。
科技信息通信部解释称,各评估领域中表现突出的团队各不相同。
针对Motif Technologies的淘汰,科技信息通信部解释称,这并非仅仅因为实用性较低,而是其专业性和易用性方面的整体得分均较低,并表示“性能未达标确实是事实”。
该部解释称,除了Motif Technologies展现优势的全球公开基准测试外,综合考虑反映国内环境的NIA基准测试、专家评估以及实际用户评估等因素,最终结果必然会有所不同。
科技信息通信部还解释称,用户评估并非仅针对简单的网站设计或UI·UX,而是以AI模型生成的内容及其质量为核心展开的。共有49名AI专业用户和185名普通民众通过实际使用AI服务进行了评估。
“为何会出现这样的结果?”此次争议的焦点,与其说是AAII排名第一的Motif Technologies被淘汰,或是LG AI研究院在专家评估中位列第一这一事实本身,不如说在于能否透明地解释:在不同评估中各显优势的模型,究竟是依据何种标准和评分细则进行综合评定的。
从科技信息通信部的立场来看,不能仅凭一项全球基准测试就选定国家代表AI,还需综合考量其在国内环境中的性能、技术开发能力、实际可用性以及产业影响等。
另一方面,业界部分人士虽认同这一初衷,但鉴于专家评估占整体评估的35%,他们主张应当能够确认LG AI研究院获得29.5分的具体原因,以及与其他团队的分数差距究竟有多大。
科技信息通信部虽然公开了各项目第一名、最高分以及4支队伍的平均分等信息,但并未公布各队的详细得分及分数差距。有观点指出,鉴于这是动用国家预算的“国家代表AI”选拔过程,有必要公开足以验证“为何会出现这一结果”的评估信息,而不仅仅是简单地公布哪支队伍获得了第一名。