[朴容厚/观点设计师] 科学技术信息通信部18日公布的“自主人工智能(AI)基础模型”(独基模)开发项目第二轮评估结果,表面上看来十分明确。LG Corp.(003550) AI研究院、SKTelecom(017670) 、Upstage成功晋级下一阶段,而Motif Technologies则被淘汰。然而,若深入剖析公布的内容,唯一明确的只有“谁留了下来”。 “为何会如此”仍难以通过数据加以验证。
本次评估综合了基准测试(40分)、专家评估(35分)和用户评估(25分)三项指标。在基准测试中,4支队伍的平均分为22.5分,第一名与第四名的差距为4.0分。 专家评估平均分为28.8分,差距为2.4分;用户评估平均分为17.6分,差距为5.0分。在三个项目中,差距最大的是用户评估。
[朴容厚/观点设计师]
尽管如此,Motif仍被淘汰。分析认为,这是因为该团队在韩国国内基准测试以及专家和用户评估中,未能超越通过第一轮评估的3支团队。政府解释称,三个评估领域的第一名各不相同,且没有哪家企业能始终保持第一。 拥有全球顶尖基准测试性能的团队,却因受阻于“易用性”和“实用性”这两道壁垒而遭淘汰。这便是本次第二轮评估的实质性故事。
其中的奥秘在于基准评分40分的内部构成。基准评分是AAII(25分)与韩国智能信息社会振兴院(NIA)自主评估(15分)的总和。 如果说AAII是衡量代理、编码、通用及科学推理等全球性性能的指标,那么NIA则侧重于数学、知识、长文理解、韩语、安全性及可靠性等维度的评估。这相当于将性质截然不同的两套标准混为一谈。 如果Motif在AAII中获得第一名,但综合基准分差距却缩小了4分,那么它在全球性能方面建立的领先优势,很可能在NIA的国内语言和安全性领域被大幅蚕食。政府自己也表示“三个评估领域的第一名各不相同”,这也暗示了在AAII中排名第一的Motif,在综合基准分中可能并非第一。
问题在于,无法验证这种“从16分到4分的缩小”究竟发生在哪个具体项目上,又是通过何种计算公式得出的。政府并未公开各团队的详细分数,也未公布将AAII原始分数换算为25分制得分的换算公式。虽然透露了基准测试的分差有多小,却阻断了通过数字来判断该分差究竟是源于NIA的评分,还是换算公式特性的途径。
这种非公开的做法虽可能是为了避免异议或争议,但在动用国家预算的项目中,阻断了通过数据验证淘汰理由的途径,这一点本身就值得报道。不过,若仅将问题归咎于公平性,政府方面也有所说明。 科学技术信息通信部表示,针对部分参与企业涉嫌“基准模型优化(Benchmaxing)”的质疑,已向AAII运营方Artificial Analysis正式寻求确认,并收到“未发现能证明存在系统性死记硬背或过度拟合问题的线索”的答复。所谓“基准模型优化”,是指针对特定的测试集或评估方式对模型进行过度优化。
政府进一步解释称,各项目之间的差距微乎其微,难以认定特定项目起到了决定性作用。虽然围绕分数不公开的批评有其合理之处,但必须结合其背景综合考量,才能做到客观公正。
举报人表示:“这并非意在推翻结果,而是希望确认这一耗费国民税金的国家代表AI选拔过程的可重现性及说明责任。”从所要求项目的性质来看,这一言论的分量不言而喻。此处提到的九个项目并非为了推翻特定结果,而是为了验证科学实验中“可重现性(reproducibility)”而设定的最低条件。
若公开原始分数和换算公式,外界便能对本文指出的“AAII 16分→基准测试4分”的压缩机制进行验证;评估委员利益冲突排除程序及是否采用盲评,则可验证专家和用户评估的可靠性; 模型披露顺序及防止重复参与的机制则有助于验证用户评价的偏见控制,而第3名与第4名实际总分的差异则可验证淘汰标准的权重。只要公开其中任意一项,迄今为止“平均分与差距”这种模糊的表述,都将被更为扎实的数字所取代。
换言之,目前尚未公开的这九项内容正是本次评估的“黑匣子”。政府虽有依据声称“公平”,但只有当这份清单公开后,国民才有依据自行确认其“是否公平”。
其中,实际直接评估“模型本身性能”的部分,仅限于SK电讯的“在数学推理和韩语领域表现为对照组中最佳”这一条。 其余内容则多为平台联动、硬件本土化、产业实证、全球合作战略、安全与信任体系等,更接近于“业务扩展战略”。实际上,专家评估的评分项目已明确设定为“开发战略及技术、开发成果及计划、波及效应及贡献计划”。这意味着,这并非衡量性能的基准测试,而是考察开发战略和业务计划的项目。
这让人不得不重新思考所谓“模型竞赛”的本质。在总分100分的评分体系中,纯粹考察模型性能的仅有基准测试的40分,其余60分(专家35分+用户25分)则分配给了战略、推广和实际体验。 AAII性能排名第一的Motif被淘汰,也与这一结构不无关系。因为尽管比赛名义上是“AI模型”竞赛,但评估的半数以上分项并非考察模型的能力,而是关注“如何推广、与谁合作、应用到哪些行业”等问题。
正是在这一点上,评分结构出现了直接矛盾。本次第二轮评估中的用户评价(25分)是49名AI专业用户和185名普通民众亲身体验服务后给出的分数。 如果政府真的如此重视用户的反馈和实际可用性,就应该允许与客户触点最多的Kakao合作,像KT与Motif、Upstage合作那样,将联合体扩大为两家公司体制,这样才合乎逻辑。让没有拥有大规模用户基础的合作伙伴参与评估,却又用高达25分的权重来评判其可用性和实际体验质量,这是一种相互冲突的标准。
在未能 확보大型客户接触点的情况下参与用户评估的Motif因此落后,而其与基准(4.0分)和专家(2.4分)之间的差距(5.0分)是三项评估中唯一超过基准和专家评分且差距最大的,这一事实与这种结构性劣势完全吻合。 在仅凭基准性能无法保证通过的评估设计中,如果制度上从一开始就阻断了扩大用户接触点的机会,却又以“用户评价”作为淘汰标准,那么很难将淘汰的责任完全归咎于Motif的技术问题。这一点同样,只要此前提到的“要求公开详细资料”未能落实,仅凭政府的解释是无法消除疑虑的。
在详细评分标准、换算公式、评委遴选程序、申诉渠道以及资金重新分配方式均未公开的当下,唯一剩下的只有一个问题。 政府声称“差距微乎其微”,而业界和国民则要求“请证明这种微小差距是可以重现的”。此次公告究竟会作为国家代表AI选拔的“结果”留存,还是成为国家预算如何接受审查的“质疑起点”,将取决于政府对此要求的下一次回应。
本次评估综合了基准测试(40分)、专家评估(35分)和用户评估(25分)三项指标。在基准测试中,4支队伍的平均分为22.5分,第一名与第四名的差距为4.0分。 专家评估平均分为28.8分,差距为2.4分;用户评估平均分为17.6分,差距为5.0分。在三个项目中,差距最大的是用户评估。
基准测试第一名被淘汰了若进一步深入分析数据,本次发布中最引人注目的并非“差距”,而是“逆转”。 Motif Technologies的“Motif 3”在全球AI性能指数AAII(人工分析智能指数)中获得47分,在4支团队中排名第一,在全球模型中位列第10名。这一成绩远超Upstage(37分)、SK电信(35分)和LG AI研究院(31分)。
尽管如此,Motif仍被淘汰。分析认为,这是因为该团队在韩国国内基准测试以及专家和用户评估中,未能超越通过第一轮评估的3支团队。政府解释称,三个评估领域的第一名各不相同,且没有哪家企业能始终保持第一。 拥有全球顶尖基准测试性能的团队,却因受阻于“易用性”和“实用性”这两道壁垒而遭淘汰。这便是本次第二轮评估的实质性故事。
AAII 16分的差距是如何缩小到基准测试中仅4分的? 然而,这里有一个难以理解的数字。在AAII原始分数中,排名第一的Motif(47分)与排名第四的LG(31分)之间差距高达16分,但基准评估(40分)中第一名与第四名的差距却仅为4.0分。这意味着16分的性能差距被急剧压缩到了4分。
其中的奥秘在于基准评分40分的内部构成。基准评分是AAII(25分)与韩国智能信息社会振兴院(NIA)自主评估(15分)的总和。 如果说AAII是衡量代理、编码、通用及科学推理等全球性性能的指标,那么NIA则侧重于数学、知识、长文理解、韩语、安全性及可靠性等维度的评估。这相当于将性质截然不同的两套标准混为一谈。 如果Motif在AAII中获得第一名,但综合基准分差距却缩小了4分,那么它在全球性能方面建立的领先优势,很可能在NIA的国内语言和安全性领域被大幅蚕食。政府自己也表示“三个评估领域的第一名各不相同”,这也暗示了在AAII中排名第一的Motif,在综合基准分中可能并非第一。
问题在于,无法验证这种“从16分到4分的缩小”究竟发生在哪个具体项目上,又是通过何种计算公式得出的。政府并未公开各团队的详细分数,也未公布将AAII原始分数换算为25分制得分的换算公式。虽然透露了基准测试的分差有多小,却阻断了通过数字来判断该分差究竟是源于NIA的评分,还是换算公式特性的途径。
只有差距,没有分数值得注意的是,科学技术信息通信部并未公开各团队的实际综合得分。由于仅提供了平均分以及第1名与第4名之间的差距,因此无法得知Motif是仅以微弱差距落后于第3名团队,还是被远远甩在后面。 虽然像AAII原始分数一样,部分指标已被公开,但决定淘汰结果的综合评分权重却无法通过数字来确认。“综合评估垫底”这一表述仅透露了名次,却未说明差距究竟有多小。
这种非公开的做法虽可能是为了避免异议或争议,但在动用国家预算的项目中,阻断了通过数据验证淘汰理由的途径,这一点本身就值得报道。不过,若仅将问题归咎于公平性,政府方面也有所说明。 科学技术信息通信部表示,针对部分参与企业涉嫌“基准模型优化(Benchmaxing)”的质疑,已向AAII运营方Artificial Analysis正式寻求确认,并收到“未发现能证明存在系统性死记硬背或过度拟合问题的线索”的答复。所谓“基准模型优化”,是指针对特定的测试集或评估方式对模型进行过度优化。
政府进一步解释称,各项目之间的差距微乎其微,难以认定特定项目起到了决定性作用。虽然围绕分数不公开的批评有其合理之处,但必须结合其背景综合考量,才能做到客观公正。
“请确认可重复性和解释责任”——媒体正式提出的公开要求业界也出现了
正式要求公开详细评估资料的声音。据《Edaily》报道,有举报称仅凭政府“微小差距”的解释无法验证结果的计算过程,因此要求公开以下九项内容。 ① 4支团队各细分项目的得分及最终排名,② AAII·NIA原始分数的换算公式, ③ 专家评审委员遴选及利益冲突排除程序,④ 匿名化后的专家评分分布,⑤ 专业用户及公众评估是否采用盲评,⑥ 评估题目与模型展示顺序,⑦ 防止重复参与的措施,⑧ 第3名与第4名实际总分差,⑨ 异议申诉程序。
举报人表示:“这并非意在推翻结果,而是希望确认这一耗费国民税金的国家代表AI选拔过程的可重现性及说明责任。”从所要求项目的性质来看,这一言论的分量不言而喻。此处提到的九个项目并非为了推翻特定结果,而是为了验证科学实验中“可重现性(reproducibility)”而设定的最低条件。
若公开原始分数和换算公式,外界便能对本文指出的“AAII 16分→基准测试4分”的压缩机制进行验证;评估委员利益冲突排除程序及是否采用盲评,则可验证专家和用户评估的可靠性; 模型披露顺序及防止重复参与的机制则有助于验证用户评价的偏见控制,而第3名与第4名实际总分的差异则可验证淘汰标准的权重。只要公开其中任意一项,迄今为止“平均分与差距”这种模糊的表述,都将被更为扎实的数字所取代。
换言之,目前尚未公开的这九项内容正是本次评估的“黑匣子”。政府虽有依据声称“公平”,但只有当这份清单公开后,国民才有依据自行确认其“是否公平”。
虽被称为“模型竞赛”,但专家评估实际上是项目评估质量争议的另一焦点在于专家评估(35分)。 从政府通过新闻稿公开的评估委员会意见来看,Upstage因“为使国民切实感受到开发成果,与门户网站‘Daum’及‘Timely’平台联动推进”以及“通过与Furiosa AI在NPU领域的合作,缓解了对进口硬件的依赖”而获得好评;SK电讯则因“提供国防领域专用A.X K1模型、制造业专用智能代理的实证、 以及在法律·税务领域的演示”,LG AI研究院则因“制定与全球国际组织的合作战略”及“代理式AI的差异化优势”分别获得了高度评价。
其中,实际直接评估“模型本身性能”的部分,仅限于SK电讯的“在数学推理和韩语领域表现为对照组中最佳”这一条。 其余内容则多为平台联动、硬件本土化、产业实证、全球合作战略、安全与信任体系等,更接近于“业务扩展战略”。实际上,专家评估的评分项目已明确设定为“开发战略及技术、开发成果及计划、波及效应及贡献计划”。这意味着,这并非衡量性能的基准测试,而是考察开发战略和业务计划的项目。
这让人不得不重新思考所谓“模型竞赛”的本质。在总分100分的评分体系中,纯粹考察模型性能的仅有基准测试的40分,其余60分(专家35分+用户25分)则分配给了战略、推广和实际体验。 AAII性能排名第一的Motif被淘汰,也与这一结构不无关系。因为尽管比赛名义上是“AI模型”竞赛,但评估的半数以上分项并非考察模型的能力,而是关注“如何推广、与谁合作、应用到哪些行业”等问题。
用户评估25分,然而客户接触点的门却紧闭着要理解Motif的出局
,还需审视评估设计与联盟构成的错综复杂关系。据笔者所知,在组建“全民AI”联盟的过程中,Motif曾试图与Kakao联手以确保客户接触点。 其判断是,将韩国最大即时通讯软件KakaoTalk所拥有的压倒性用户基础,作为AI服务的实际用户基础加以利用。然而,据称政府限制Motif只能与一家企业组建联盟。Motif不得不放弃最初希望合作的两家企业,转而仅与KT一家合作,而Kakao这一最大的客户接触点则被排在了联盟之外。··
正是在这一点上,评分结构出现了直接矛盾。本次第二轮评估中的用户评价(25分)是49名AI专业用户和185名普通民众亲身体验服务后给出的分数。 如果政府真的如此重视用户的反馈和实际可用性,就应该允许与客户触点最多的Kakao合作,像KT与Motif、Upstage合作那样,将联合体扩大为两家公司体制,这样才合乎逻辑。让没有拥有大规模用户基础的合作伙伴参与评估,却又用高达25分的权重来评判其可用性和实际体验质量,这是一种相互冲突的标准。
在未能 확보大型客户接触点的情况下参与用户评估的Motif因此落后,而其与基准(4.0分)和专家(2.4分)之间的差距(5.0分)是三项评估中唯一超过基准和专家评分且差距最大的,这一事实与这种结构性劣势完全吻合。 在仅凭基准性能无法保证通过的评估设计中,如果制度上从一开始就阻断了扩大用户接触点的机会,却又以“用户评价”作为淘汰标准,那么很难将淘汰的责任完全归咎于Motif的技术问题。这一点同样,只要此前提到的“要求公开详细资料”未能落实,仅凭政府的解释是无法消除疑虑的。
“晋级”的实质是什么? 最后,还必须厘清LG、SKT和Upstage所说的“将在下一阶段继续进行最终角逐”这句话究竟意味着什么。政府表示,计划通过第三轮评估,于明年年初选出最终的两支团队。最终入选的团队数量已公开。 然而,预算如何在各团队间分配、原分配给被淘汰的Motif团队的资源将如何重新分配给剩余团队等资金流向的详细结构,至今仍未得到说明。在性能竞赛的聚光灯背后,国民税款将以何种方式流向剩余团队的问题,至今仍无答案。只有报道三方角逐的新闻能追问到这一点,“国家代表AI”这一说法才算名副其实。
在详细评分标准、换算公式、评委遴选程序、申诉渠道以及资金重新分配方式均未公开的当下,唯一剩下的只有一个问题。 政府声称“差距微乎其微”,而业界和国民则要求“请证明这种微小差距是可以重现的”。此次公告究竟会作为国家代表AI选拔的“结果”留存,还是成为国家预算如何接受审查的“质疑起点”,将取决于政府对此要求的下一次回应。