[E-DailyKim Hyun-ah 记者] 韩国科学技术信息通信部自主研发的AI基础模型(独基模)第二轮评估结果即将公布。
在此次评估中,将从4个模型中淘汰1个,最终选定3个模型。其中,在全球AI评估机构Artificial Analysis(AA)综合指标中排名第一的Motif能否跻身最终3个模型之列,正备受关注。
不过,Motif能否最终夺冠则是另一回事。这是因为虽然在全球基准测试中它大幅领先于竞争对手,但在实际服务环境所要求的易用性、韩语完成度以及一般对话能力等方面,竞争对手可能具有相对优势。
Motif 3在AA的人工智能综合指标AAII中获得47分,领先于Upstage(37分)、SK电讯(35分)和LG AI研究院(31分)。特别是在评估实际业务执行能力的GDPval-AA、考察金融工具运用能力的τ³-Banking、评估开发与编码能力的Terminal-Bench等9项细分评估中,有6项位居榜首。 据评价,该模型在编程和基于代理的业务执行等实务领域也展现出了竞争力。
因此,业界普遍认为Motif有很大可能跻身最终三强之列。不过,也有预测指出,由于数据训练量不足导致的使用性问题将成为变数,要最终夺冠恐怕并不容易。
◇基准测试的悖论……“实战可用性”决定最终排名
在此次“独破模”评估中,基准测试在总分100分中占40分。其中AAII占25分,韩国智能信息社会振兴院(NIA)自主基准测试占15分,其余为专家评估35分和用户评估25分。这种结构使得AAII的分数差距无法直接反映在最终结果中。
实际上,在之前的评估中,模型的可用性问题曾引发争议。今年7月,Motif公开测试版模型中被发现将《爱国歌》歌词中的“ 길이 보전하세”标注为“ 길이 보전hase”,或是在部分歌词中混入了毫无意义的英文单词。在《爱国歌》第四节中,错误也持续出现。
Upstage的“Solar Open 2 Beta”在公开测试中也发现了国歌错误。当要求“齐唱国歌第四节”时,系统生成了与实际国歌无关的内容,将其当作新歌词。这不仅涉及简单的词汇错误,更因误解了提问意图并生成与事实不符的内容而引发争议。
这两个案例表明,全球基准测试成绩并不一定与实际服务中的韩语准确性及真实性成正比。预计在本次评估中,实际使用稳定性也将成为主要变量。
◇基准测试优化与数据争议……评估公平性比“分数”更关键
围绕基准测试的公平性争议也是一个变量。这涉及所谓“基准优化(Benchmaxing)”问题,即针对特定测试集或评估方式对模型进行过度优化。
近期,网上有观点称LG AI研究院的K-ExaOne是针对特定韩语测试集进行调优的。不过,这仅是网络上的说法,并不意味着模型开发过程中存在舞弊行为。
Motif也因购买AAII相关数据集而引发争议。Motif方面虽承认购买事实,但表示并非为了提高评估分数而接受所谓的“补习”,且在无需使用该数据集的多个项目中均取得了均衡的高分,因此认为并无问题。
◇“独破模”之后才是真正的胜负关键……能否直通“前沿AI”项目
业界目光已超越第二轮评估结果,转向“‘独破模’之后”的动向。这是因为有传言称,政府在选定最终3个模型后,可能不再进行额外选拔,而是从明年起直接推进“前沿级”AI开发项目。
一位业界高层人士表示:“听说科学技术信息通信部在选定3个模型后,将不进行额外选拔,直接过渡到前沿级项目,”并称“明年是启动单独项目,还是以选定的3家公司为核心推进,这需要仔细斟酌。”
最终入选的3个模型极有可能继续获得包括1000张GPU在内的计算资源及政府研发支持。不过,也有观点指出,由于前沿AI不仅需要计算能力,还需具备云计算、半导体、数据及服务能力,因此需要构建一个涵盖最终入选的3家企业、落选企业及相关产业的开放式合作生态系统。
◇直至“全民AI”……超越模型的生态系统竞争
随着政府的人工智能政策从单一模型扩展到以多模型、多智能体结构为导向的“全民AI”,生态系统竞争预计也将全面展开。在预计将出现人工智能模型企业与通信、平台企业之间联盟竞争的背景下,Motif已决定作为模型开发商加入KT联盟。
随着政府支持从“前沿AI”转向“全民AI”,竞争焦点预计也将从模型性能扩展至计算能力、服务及人才争夺战。
在第二轮评估中,AAII排名第一的Motif若能同时证明其实际应用价值和韩语能力,能否跻身最终三强;以及已确认未购买AAII专用训练数据的SK电信(017670)和LG(003550)AI研究院能否在最后关头脱颖而出,都备受关注。 那些能够将基准测试性能转化为实际服务竞争力,并确保GPU、人才及生态系统资源的企业,预计将在“独破模”项目结束后掌握韩国AI领域的领导权。
在此次评估中,将从4个模型中淘汰1个,最终选定3个模型。其中,在全球AI评估机构Artificial Analysis(AA)综合指标中排名第一的Motif能否跻身最终3个模型之列,正备受关注。
Motif 3在AA的人工智能综合指标AAII中获得47分,领先于Upstage(37分)、SK电讯(35分)和LG AI研究院(31分)。特别是在评估实际业务执行能力的GDPval-AA、考察金融工具运用能力的τ³-Banking、评估开发与编码能力的Terminal-Bench等9项细分评估中,有6项位居榜首。 据评价,该模型在编程和基于代理的业务执行等实务领域也展现出了竞争力。
因此,业界普遍认为Motif有很大可能跻身最终三强之列。不过,也有预测指出,由于数据训练量不足导致的使用性问题将成为变数,要最终夺冠恐怕并不容易。
在此次“独破模”评估中,基准测试在总分100分中占40分。其中AAII占25分,韩国智能信息社会振兴院(NIA)自主基准测试占15分,其余为专家评估35分和用户评估25分。这种结构使得AAII的分数差距无法直接反映在最终结果中。
实际上,在之前的评估中,模型的可用性问题曾引发争议。今年7月,Motif公开测试版模型中被发现将《爱国歌》歌词中的“ 길이 보전하세”标注为“ 길이 보전hase”,或是在部分歌词中混入了毫无意义的英文单词。在《爱国歌》第四节中,错误也持续出现。
Upstage的“Solar Open 2 Beta”在公开测试中也发现了国歌错误。当要求“齐唱国歌第四节”时,系统生成了与实际国歌无关的内容,将其当作新歌词。这不仅涉及简单的词汇错误,更因误解了提问意图并生成与事实不符的内容而引发争议。
这两个案例表明,全球基准测试成绩并不一定与实际服务中的韩语准确性及真实性成正比。预计在本次评估中,实际使用稳定性也将成为主要变量。
围绕基准测试的公平性争议也是一个变量。这涉及所谓“基准优化(Benchmaxing)”问题,即针对特定测试集或评估方式对模型进行过度优化。
近期,网上有观点称LG AI研究院的K-ExaOne是针对特定韩语测试集进行调优的。不过,这仅是网络上的说法,并不意味着模型开发过程中存在舞弊行为。
Motif也因购买AAII相关数据集而引发争议。Motif方面虽承认购买事实,但表示并非为了提高评估分数而接受所谓的“补习”,且在无需使用该数据集的多个项目中均取得了均衡的高分,因此认为并无问题。
业界目光已超越第二轮评估结果,转向“‘独破模’之后”的动向。这是因为有传言称,政府在选定最终3个模型后,可能不再进行额外选拔,而是从明年起直接推进“前沿级”AI开发项目。
一位业界高层人士表示:“听说科学技术信息通信部在选定3个模型后,将不进行额外选拔,直接过渡到前沿级项目,”并称“明年是启动单独项目,还是以选定的3家公司为核心推进,这需要仔细斟酌。”
最终入选的3个模型极有可能继续获得包括1000张GPU在内的计算资源及政府研发支持。不过,也有观点指出,由于前沿AI不仅需要计算能力,还需具备云计算、半导体、数据及服务能力,因此需要构建一个涵盖最终入选的3家企业、落选企业及相关产业的开放式合作生态系统。
◇直至“全民AI”……超越模型的生态系统竞争
随着政府的人工智能政策从单一模型扩展到以多模型、多智能体结构为导向的“全民AI”,生态系统竞争预计也将全面展开。在预计将出现人工智能模型企业与通信、平台企业之间联盟竞争的背景下,Motif已决定作为模型开发商加入KT联盟。
随着政府支持从“前沿AI”转向“全民AI”,竞争焦点预计也将从模型性能扩展至计算能力、服务及人才争夺战。
在第二轮评估中,AAII排名第一的Motif若能同时证明其实际应用价值和韩语能力,能否跻身最终三强;以及已确认未购买AAII专用训练数据的SK电信(017670)和LG(003550)AI研究院能否在最后关头脱颖而出,都备受关注。 那些能够将基准测试性能转化为实际服务竞争力,并确保GPU、人才及生态系统资源的企业,预计将在“独破模”项目结束后掌握韩国AI领域的领导权。