[E-DailyShin Yeong-bin 记者] LG CNS(#LG CNS)与加拿大人工智能(AI)企业Coherent共同开发的企业级AI模型的学习方式及详细性能已通过论文公开。
据17日信息技术(IT)业界消息,Coherent研究团队近日发布了一篇题为《用英语推理,用韩语回答:多语言工具驱动AI代理的高效优化》的论文,其中详细介绍了与LG CNS共同开发的、拥有1110亿个参数的企业级推理大型语言模型(LLM)的开发过程及性能。
LuckyStar 111B的学习过程。在经过后训练的多语言基础模型上,依次应用了混合监督微调(SFT)、用于可验证推理与工具使用的强化学习(RLVR),以及用于生成简洁用户响应的偏好排序。(图片来源:Cohere)
论文中将该模型命名为“LuckyStar 111B”。该名称源自LG的旧公司名称“Lucky Goldstar”。不过据悉,这仅是开发过程中使用的代号,并非正式产品名称。
LG CNS于去年3月与Cohere建立合作伙伴关系,着手共同开发专注于韩语和金融领域的智能代理模型。同年7月,该公司宣布基于Cohere的企业级大语言模型(LLM)“Command”,共同开发出拥有1110亿个参数的推理型大语言模型。
该论文中提到了具体的训练方法和企业级AI代理的性能。研究团队以现有的Command A为基础,依次应用了监督微调(SFT)、可验证的奖励强化学习(RLVR)以及偏好优化(DPO)等技术。
研究团队还尝试了将英语推理数据简单翻译成韩语进行训练的方法,但结果显示性能提升效果有限。因此,他们将模型训练为:即使收到韩语问题,中间推理过程仍以英语进行,仅生成韩语的最终结果。
在此过程中,由于出现了韩语提问却以英语给出最终回答的问题,研究团队还应用了专门的“语言一致性”奖励机制,要求对韩语提问以韩语作答。根据论文,最终回答语言不匹配的比例从SFT阶段的12.2%降至强化学习第200阶段后的0.8%。
LG CNS与Coherent重点关注的另一个领域是实际企业业务执行能力。除了常规的问答功能外,还强化了AI利用外部工具执行业务的能力,例如将自然语言命令转换为数据库查询语言的NL2SQL以及函数调用等。
在内部评估中,其性能也优于基础模型。在Coherent的企业级NL2SQL评估中,原有Command A模型仅得7.3分,而联合开发模型则提升至38.0分。在LG CNS基于企业及金融业务构建的代理评估中,得分也从2.67分提升至4.85分。
该模型还融入了可将大型模型轻量化以便在企业内部直接运行的技术。研究团队通过应用4位量化技术,降低了111B模型的内存占用量。据介绍,由此仅需一块80GB容量的英伟达H100图形处理单元(GPU)即可运行该模型。
LG CNS与Cohere正开发7B、32B、111B等不同规模的模型,以便企业根据自身业务和基础设施环境灵活应用。据悉,这些模型并非仅限于研究目的,而是作为面向实际企业客户的商用模型开发的。
两家公司计划以金融业为起点,将代理式AI的业务领域扩展至制造业、流通业及服务业等。特别是,将支持企业通过本地部署环境在自有基础设施上运行AI,以满足安全要求较高的企业需求,并计划持续提升联合开发模型的性能。
据17日信息技术(IT)业界消息,Coherent研究团队近日发布了一篇题为《用英语推理,用韩语回答:多语言工具驱动AI代理的高效优化》的论文,其中详细介绍了与LG CNS共同开发的、拥有1110亿个参数的企业级推理大型语言模型(LLM)的开发过程及性能。
论文中将该模型命名为“LuckyStar 111B”。该名称源自LG的旧公司名称“Lucky Goldstar”。不过据悉,这仅是开发过程中使用的代号,并非正式产品名称。
LG CNS于去年3月与Cohere建立合作伙伴关系,着手共同开发专注于韩语和金融领域的智能代理模型。同年7月,该公司宣布基于Cohere的企业级大语言模型(LLM)“Command”,共同开发出拥有1110亿个参数的推理型大语言模型。
该论文中提到了具体的训练方法和企业级AI代理的性能。研究团队以现有的Command A为基础,依次应用了监督微调(SFT)、可验证的奖励强化学习(RLVR)以及偏好优化(DPO)等技术。
研究团队还尝试了将英语推理数据简单翻译成韩语进行训练的方法,但结果显示性能提升效果有限。因此,他们将模型训练为:即使收到韩语问题,中间推理过程仍以英语进行,仅生成韩语的最终结果。
在此过程中,由于出现了韩语提问却以英语给出最终回答的问题,研究团队还应用了专门的“语言一致性”奖励机制,要求对韩语提问以韩语作答。根据论文,最终回答语言不匹配的比例从SFT阶段的12.2%降至强化学习第200阶段后的0.8%。
LG CNS与Coherent重点关注的另一个领域是实际企业业务执行能力。除了常规的问答功能外,还强化了AI利用外部工具执行业务的能力,例如将自然语言命令转换为数据库查询语言的NL2SQL以及函数调用等。
在内部评估中,其性能也优于基础模型。在Coherent的企业级NL2SQL评估中,原有Command A模型仅得7.3分,而联合开发模型则提升至38.0分。在LG CNS基于企业及金融业务构建的代理评估中,得分也从2.67分提升至4.85分。
该模型还融入了可将大型模型轻量化以便在企业内部直接运行的技术。研究团队通过应用4位量化技术,降低了111B模型的内存占用量。据介绍,由此仅需一块80GB容量的英伟达H100图形处理单元(GPU)即可运行该模型。
LG CNS与Cohere正开发7B、32B、111B等不同规模的模型,以便企业根据自身业务和基础设施环境灵活应用。据悉,这些模型并非仅限于研究目的,而是作为面向实际企业客户的商用模型开发的。
两家公司计划以金融业为起点,将代理式AI的业务领域扩展至制造业、流通业及服务业等。特别是,将支持企业通过本地部署环境在自有基础设施上运行AI,以满足安全要求较高的企业需求,并计划持续提升联合开发模型的性能。