[E-DailyLee So-Hyun 记者]Kakao(035720)公布了一项既能降低大规模人工智能(AI)模型的学习成本,又能提高稳定性的优化技术。该技术仅需约1%的总学习成本即可预测最佳学习率,并已实际应用于“Kanana”模型的预训练;在另一项研究中,该技术在将模型规模缩减最多40.4%的同时,将测试性能提升了最多6.6%。
Kakao于8日宣布,在语言建模国际学术会议“COLM(Conference on Language Modeling)2026”上,发布了提升大规模专家混合(MoE·Mixture-of-Experts)模型学习效率的技术以及模型轻量化研究成果。
COLM是专门研究大规模语言模型(LLM)和语言建模的国际学术会议,于2024年新设立。Kakao在本次会议的主会场以及分词(Tokenization)研讨会“TokShop”上分别公布了研究成果。
在主会议上,该公司发布了一种方法论,能够将大规模MoE模型预训练所需的最佳学习率预测值控制在总学习成本的约1%水平。
学习率是决定AI模型在学习过程中内部参数调整幅度的关键参数。若设定过高,可能导致学习不稳定;若设定过低,则可能使学习速度变慢,因此寻找合适的数值至关重要。
MoE模型是一种从多个专家模块中仅选择输入所需部分进行运算的结构,近年来在高性能LLM中的应用日益增多。不过,与现有的密集型(Dense)模型相比,关于其学习设置的公开研究相对较少,这可能导致在大规模学习过程中出现更多试错和成本负担。
Kakao将“μ-参数化(μ-Parameterization)”技术——即把在小型模型中找到的最佳学习设置扩展到大型模型——应用到了MoE结构中。
通过分阶段增加模型规模和训练令牌量来探索最佳学习率,并验证了在短训练阶段中找到的设置在大规模训练中是否依然有效。
该方法已实际应用于Kakao的“Kanana-2.6-155b-a17b”模型预训练中,成功实现了高达10万亿(10T)令牌的稳定训练。
在令牌化研讨会“TokShop”上,研究团队公布了在缩减模型规模的同时提升性能的“BBT(BPE-Guided Byte Transformer)”研究成果。
现有的基于BPE(字节对编码)的模型,是将文本分割为单词或单词片段形式的令牌进行处理。
BBT的设计旨在将其转换为基于更小基本单位“字节(Byte)”的结构,同时保留了传统BPE方法中将多个字符高效捆绑处理的优势。
在对比实验中,该模型在将参数数量减少20.2%至40.4%的同时,测试性能提升了2.7%至6.6%。
Kakao解释称,该模型在面对输入错误或字符混乱时表现出了更稳定的性能,且在未训练语言上的迁移性能也得到了提升。
Kakao认为,通过BBT技术,可在设备端环境中减轻模型的内存负担,并在多语言输入或频繁出现错别字的对话环境中提高其应用价值。
Kakao计划今后将研究应用范围扩展至多种模型结构,并朝着在多模态和多语言环境中提高效率的方向进一步优化该技术。
Kakao相关人士表示:“本次研究的意义在于,它提出了一种在保持或提升AI模型性能的同时,能够降低学习和运营成本的实用方法”,并称:“今后我们将把研究扩展到各种模型结构以及多模态、多语言环境中,以提高其在实际服务中的应用可能性。”
Kakao于8日宣布,在语言建模国际学术会议“COLM(Conference on Language Modeling)2026”上,发布了提升大规模专家混合(MoE·Mixture-of-Experts)模型学习效率的技术以及模型轻量化研究成果。
COLM是专门研究大规模语言模型(LLM)和语言建模的国际学术会议,于2024年新设立。Kakao在本次会议的主会场以及分词(Tokenization)研讨会“TokShop”上分别公布了研究成果。
以约1%的学习成本预测最优学习率
在主会议上,该公司发布了一种方法论,能够将大规模MoE模型预训练所需的最佳学习率预测值控制在总学习成本的约1%水平。
学习率是决定AI模型在学习过程中内部参数调整幅度的关键参数。若设定过高,可能导致学习不稳定;若设定过低,则可能使学习速度变慢,因此寻找合适的数值至关重要。
MoE模型是一种从多个专家模块中仅选择输入所需部分进行运算的结构,近年来在高性能LLM中的应用日益增多。不过,与现有的密集型(Dense)模型相比,关于其学习设置的公开研究相对较少,这可能导致在大规模学习过程中出现更多试错和成本负担。
Kakao将“μ-参数化(μ-Parameterization)”技术——即把在小型模型中找到的最佳学习设置扩展到大型模型——应用到了MoE结构中。
通过分阶段增加模型规模和训练令牌量来探索最佳学习率,并验证了在短训练阶段中找到的设置在大规模训练中是否依然有效。
该方法已实际应用于Kakao的“Kanana-2.6-155b-a17b”模型预训练中,成功实现了高达10万亿(10T)令牌的稳定训练。
模型规模缩减40.4%,性能最高提升6.6%
在令牌化研讨会“TokShop”上,研究团队公布了在缩减模型规模的同时提升性能的“BBT(BPE-Guided Byte Transformer)”研究成果。
现有的基于BPE(字节对编码)的模型,是将文本分割为单词或单词片段形式的令牌进行处理。
BBT的设计旨在将其转换为基于更小基本单位“字节(Byte)”的结构,同时保留了传统BPE方法中将多个字符高效捆绑处理的优势。
在对比实验中,该模型在将参数数量减少20.2%至40.4%的同时,测试性能提升了2.7%至6.6%。
Kakao解释称,该模型在面对输入错误或字符混乱时表现出了更稳定的性能,且在未训练语言上的迁移性能也得到了提升。
Kakao认为,通过BBT技术,可在设备端环境中减轻模型的内存负担,并在多语言输入或频繁出现错别字的对话环境中提高其应用价值。
Kakao计划今后将研究应用范围扩展至多种模型结构,并朝着在多模态和多语言环境中提高效率的方向进一步优化该技术。
Kakao相关人士表示:“本次研究的意义在于,它提出了一种在保持或提升AI模型性能的同时,能够降低学习和运营成本的实用方法”,并称:“今后我们将把研究扩展到各种模型结构以及多模态、多语言环境中,以提高其在实际服务中的应用可能性。”