[E-DailyPark Jung-Soo 记者] 专注于AI模型轻量化和优化的企业#NOTA在世界级人工智能(AI)学术会议上,其超大规模语言模型(LLM)优化技术实力接连获得认可。
NOTA于25日宣布,在自然语言处理(NLP)领域的国际学术会议“EMNLP 2026”上,其两篇关于超大规模AI模型优化的论文分别被主会议和《Findings》录用。
今年EMNLP共收到约1.8万篇论文投稿,主会议论文录用率为15.4%。EMNLP是一场由谷歌、Meta、OpenAI等全球科技巨头及主要高校研究团队参与、发表最新自然语言处理研究成果的学术会议。
此次被录用的论文探讨了在GPT系列、Qwen、Kimi等最新大型语言模型(LLM)中应用的“专家混合模型(Mixture of Experts·MoE)”在量化过程中出现的性能下降问题。
MoE虽然是一种根据输入仅由部分所需专家进行运算的结构,但因需将整个模型存储在内存中,在实际运行过程中需要消耗大量GPU和内存资源。虽然应用量化技术可以减少所需资源,但如果数值变化导致选中的专家与之前不同,模型的答题性能可能会下降。
被主会议录用的论文提出了一种名为“MENDS-MoE”的方法论,该方法不仅考虑了量化对后续专家选择的影响,还保留了处于选择临界点的专家的排序。针对三种MoE模型进行的4位和3位量化实验结果显示,在大多数评估环境中,该方法均实现了高于对比技术的平均准确率和语言模型性能。
被《Findings》录用的论文提出了一种名为“OPERA”的方法论,该方法不再对所有专家选择的变化进行统一校正,而是将优化重点集中在影响最终回答的变化上。这两项研究都致力于在量化后保持适当的专家选择,同时将模型性能下降降至最低。
此前,NOTA还在今年7月举行的ICML 2026“资源自适应基础模型推理(AdaptFM)”研讨会的“高效Qwen竞赛”中,从全球约40支参赛队伍中脱颖而出,获得第三名。 在单块NVIDIA A10G GPU上运行开源LLM Qwen 3.5-4B时,不仅保持了模型性能,还实现了比现有方案平均快6.978倍的推理速度。在同一研讨会上,还有两篇关于MoE量化的论文被录用。
Nota正将研究阶段积累的优化技术扩展应用于超大规模LLM和数据中心AI基础设施。这是因为随着AI模型规模扩大至数千亿至数万亿个参数,在保持性能的同时减少GPU和内存使用量的技术,正成为决定AI服务成本效益的关键因素。
最近,该公司对拥有1万亿以上参数的“Qwen 3.8 Max”进行了轻量化处理,将其运行所需的NVIDIA B300 GPU数量从24块减少至4块。 MoonShot AI的“Kimi K3”公布了将B300 GPU从8块减少至最多4块的优化成果,Upstage的“Solar Open 2”也公布了将H100 GPU从8块减少至2块的优化结果。
该公司计划将以移动及边缘AI为核心积累的优化能力,扩展至超大规模LLM和数据中心领域。迄今为止,从修剪和量化核心技术,到移动边缘AI、生成式AI、视觉语言模型(VLM)及LLM,已在国内外主要学术会议和期刊上发表了50余项研究成果。
Nota首席执行官蔡明洙表示:“随着AI模型参数规模扩大至数千亿乃至数万亿,AI产业的竞争焦点正从模型本身的性能转向运行效率。”他补充道:“今后我们将继续投入研发资源并提供支持,以预先应对最新AI模型的结构变化,同时扩大核心优化技术的应用范围,从而提高AI基础设施部署的效率。”
NOTA于25日宣布,在自然语言处理(NLP)领域的国际学术会议“EMNLP 2026”上,其两篇关于超大规模AI模型优化的论文分别被主会议和《Findings》录用。
今年EMNLP共收到约1.8万篇论文投稿,主会议论文录用率为15.4%。EMNLP是一场由谷歌、Meta、OpenAI等全球科技巨头及主要高校研究团队参与、发表最新自然语言处理研究成果的学术会议。
此次被录用的论文探讨了在GPT系列、Qwen、Kimi等最新大型语言模型(LLM)中应用的“专家混合模型(Mixture of Experts·MoE)”在量化过程中出现的性能下降问题。
MoE虽然是一种根据输入仅由部分所需专家进行运算的结构,但因需将整个模型存储在内存中,在实际运行过程中需要消耗大量GPU和内存资源。虽然应用量化技术可以减少所需资源,但如果数值变化导致选中的专家与之前不同,模型的答题性能可能会下降。
被主会议录用的论文提出了一种名为“MENDS-MoE”的方法论,该方法不仅考虑了量化对后续专家选择的影响,还保留了处于选择临界点的专家的排序。针对三种MoE模型进行的4位和3位量化实验结果显示,在大多数评估环境中,该方法均实现了高于对比技术的平均准确率和语言模型性能。
被《Findings》录用的论文提出了一种名为“OPERA”的方法论,该方法不再对所有专家选择的变化进行统一校正,而是将优化重点集中在影响最终回答的变化上。这两项研究都致力于在量化后保持适当的专家选择,同时将模型性能下降降至最低。
此前,NOTA还在今年7月举行的ICML 2026“资源自适应基础模型推理(AdaptFM)”研讨会的“高效Qwen竞赛”中,从全球约40支参赛队伍中脱颖而出,获得第三名。 在单块NVIDIA A10G GPU上运行开源LLM Qwen 3.5-4B时,不仅保持了模型性能,还实现了比现有方案平均快6.978倍的推理速度。在同一研讨会上,还有两篇关于MoE量化的论文被录用。
Nota正将研究阶段积累的优化技术扩展应用于超大规模LLM和数据中心AI基础设施。这是因为随着AI模型规模扩大至数千亿至数万亿个参数,在保持性能的同时减少GPU和内存使用量的技术,正成为决定AI服务成本效益的关键因素。
最近,该公司对拥有1万亿以上参数的“Qwen 3.8 Max”进行了轻量化处理,将其运行所需的NVIDIA B300 GPU数量从24块减少至4块。 MoonShot AI的“Kimi K3”公布了将B300 GPU从8块减少至最多4块的优化成果,Upstage的“Solar Open 2”也公布了将H100 GPU从8块减少至2块的优化结果。
该公司计划将以移动及边缘AI为核心积累的优化能力,扩展至超大规模LLM和数据中心领域。迄今为止,从修剪和量化核心技术,到移动边缘AI、生成式AI、视觉语言模型(VLM)及LLM,已在国内外主要学术会议和期刊上发表了50余项研究成果。
Nota首席执行官蔡明洙表示:“随着AI模型参数规模扩大至数千亿乃至数万亿,AI产业的竞争焦点正从模型本身的性能转向运行效率。”他补充道:“今后我们将继续投入研发资源并提供支持,以预先应对最新AI模型的结构变化,同时扩大核心优化技术的应用范围,从而提高AI基础设施部署的效率。”