[E-DailyKim Hyun-ah 记者]Kakao(035720)已实质上完成了拥有1550亿个(155B)参数规模的自主大型语言模型(LLM)“卡纳纳”的训练。
该模型规模比此前公开的30B模型大5倍以上。Kakao正构建从0.9B到155B不等的多种规模模型,并推行“多模型”战略,根据问题难度和服务特性灵活选用。该公司不仅致力于模型开发,还计划自主构建面向实际服务的部署技术及分词器,以降低AI服务成本。
Kakao首席执行官郑真雅近日也强调了成本效益,表示:“与其盲目参与大型模型的竞争,我们将通过设备端AI和智能路由技术,构建能将推理成本降低最多90%的高效架构。”
负责Kakao自主AI模型开发和服务优化的成果负责人卢炳锡(44岁)在接受《Edaily》采访时表示:“在已公开的模型中,有规模约为30B的模型;而我们内部正在准备的,是比其大5倍左右的155B规模模型,目前已接近完成训练阶段”,并强调:“Kakao并非只专注于小型模型。” 他曾任职于电子通信研究院(ETRI)和英特尔,于2020年加入Kakao Brain。
关于Kakao的155B模型,罗负责人解释道:“可以将其视为政府‘自主基础模型’项目中,去年年底其他企业提交的模型规模水平。”他补充道:“去年年底Upstage的模型规模约为120B,而我们目前已拥有155B规模的模型。”
不过,与参与自主AI基础模型第二轮竞标的主要模型相比,其参数规模较小。LG AI研究院的750B、SK电信的688B、Motif的314B、Upstage的250B等模型的规模均大于Kakao。Kakao更侧重于根据服务目的灵活运用不同规模模型的战略,而非单纯追求模型规模的绝对大小。
Kakao基础模型负责人诺炳锡。照片来源:E-Daily 方仁权记者
诺负责人表示:“如果调用外部API,由于这些模型并非由我们自行开发和部署,成本自然会较高”,并补充道:“而且谁也不知道这种成本会持续到什么时候。”
他接着表示:“因为对方可能会突然宣布‘从今天起费用翻倍,甚至涨到10倍’,所以我们会尽量避免调用外部服务,而是通过我们自有的模型家族来解决所有问题。”
Kakao会根据问题的复杂程度调用不同的模型。简单的问题由小型模型处理,而像制定旅行计划这样复杂的请求则利用大型模型来提高回答质量。
诺负责人解释道:“我们的KakaoTalk需要面向4000万用户提供模型并开展服务,模型规模从最小的0.9B到1.3B、3B、8B、9.8B、30B乃至155B,模型系列非常丰富”,“并非所有用户都需要超大规模的模型。”
他接着说:“非常简单的回答可以用稍小的模型处理;而对于‘我明天要去济州岛旅行,请帮我制定旅行计划’这类稍难的问题,则会使用大型模型来制定计划,从而生成质量更高的回答。”
根据问题难度选择合适的模型,相比于对所有请求都使用最大规模的模型,既能降低推理成本,又能保持服务质量。
[由生成式AI撰写]
部署是指在服务器和GPU上实际运行已完成训练的AI模型,从而为用户的问题生成答案的过程。随着用户数量的增加,GPU使用量和成本也会随之上升,因此部署效率直接关系到AI服务的成本竞争力。
诺·里德表示:“在我目前负责的团队中,我们甚至会全面负责如何高效优化这些已构建的模型以实现服务部署,”并补充道:“例如,如果每次服务部署的GPU成本为100韩元,我们就能通过优化将其降至10韩元,此类优化工作我们都是自主完成的。”
如果说代表郑真雅提到的“智能路由”是根据问题决定使用哪种模型的技术,那么诺负责人所解释的部署优化则侧重于如何用尽可能少的GPU资源运行选定的模型。
该战略旨在在确保大型模型的同时,自主掌握能够以更少的GPU资源运行同一模型的服务技术,从而降低AI服务的成本。
Kakao基础模型负责人、成果负责人诺·秉锡。照片来源:E-Daily 方仁权记者
分词器是一种将人输入的句子转换为AI模型可计算单元的“句子分解器”。即使是同一句子的,根据所使用的分词器不同,所需的词元数量也会有所不同。在大规模AI服务中,词元数量越多,运算量和成本也会随之增加。
诺·里德表示:“我们已通过数据验证,卡纳纳分词器在处理韩语时的效率最高。”他进一步指出:“与全球广泛使用的开源模型之一——阿里巴巴的Qwen系列相比,我们的卡纳纳分词器在处理韩语时的效率高出1.6倍。”
他接着补充道:“这意味着,若使用其他模型来表达含义相同的句子,则需要多消耗1.6倍的令牌。”并强调:“像我们这样拥有数千万用户的平台,成本将因此增加60%,因此通过自主开发分词器来提升效率势在必行。”
Kakao不仅自主开发模型,还自主开发分词器,这也是为了降低大规模服务中产生的AI成本。
来源=Kakao
诺·里德表示:“由于在设备端运行的模型使用的是个人资源,因此对Kakao而言,服务成本为零”,并称“同时,敏感的隐私问题也从源头上得到了解决”。
他解释道:“用户的对话数据不会进入服务器,而是由设备端模型基于对话上下文,在设备上存储个性化信息,例如在‘明天在江南站见面吧’的对话中推荐地点。”他还补充道:“仅将设备端模型难以处理的复杂问题,在彻底清除个人信息后发送至服务器,由服务器处理上下文并给出回答,采用这种混合模式。”
Kakao的构想是结合设备端和服务器端AI,实现一种混合AI模式:将个人信息保留在设备上,而复杂的AI功能则由服务器模型处理。
Kakao基础模型负责人诺炳锡。照片来源:E-Daily 方仁权记者
诺负责人表示:“资本差距已经大到让我们根本无法再考虑与ChatGPT、Claude、Gemini竞争并取胜了”,但他同时强调:“KakaoTalk中积累了与ChatGPT对话完全不同的、来自亲友之间的对话数据。正是基于这些数据,Kakao才能提供最个性化的AI代理服务。”
他接着表示:“如果不是那种对所有人给出相同回答的AI,而是一个非常了解我的AI,它就能根据对话对象调整语气,甚至运用我的说话方式”,并称:“其他任何全球竞争对手都无法做到的事情,我们却能实现。”
代理AI不仅能提供回答,还能执行实际操作。卢·里德解释道:“如果现有模型只是提供简单的回答,那么代理AI会像‘我已经这样搜索到了,这样操作可以吗?要付款吗?’这样,在征得用户确认后,将操作直至付款这一系列行为完整地执行下来。”
其构想是在KakaoTalk这一生活平台内,实现能够理解用户对话语境、并根据个人具体情况提供相应回答和行动的人工智能。
诺·里德表示:“卡纳纳2.6的首要目标是实现比2.5更优异的性能,而过渡到卡纳纳3时,模型架构等将再次发生彻底改变”,并 并预告道:“我们正致力于大幅延长上下文处理长度,或通过改进模型结构,持续增强推理和智能代理能力。”
诺·里德描绘的Kakao人工智能,是一种即使用户没有意识到它的存在,也能在日常生活中自然运行的形式。从155B大型模型到设备端AI,Kakao不仅在模型规模上,更在如何高效地实际应用AI并实现个性化方面下足了功夫。
该模型规模比此前公开的30B模型大5倍以上。Kakao正构建从0.9B到155B不等的多种规模模型,并推行“多模型”战略,根据问题难度和服务特性灵活选用。该公司不仅致力于模型开发,还计划自主构建面向实际服务的部署技术及分词器,以降低AI服务成本。
Kakao首席执行官郑真雅近日也强调了成本效益,表示:“与其盲目参与大型模型的竞争,我们将通过设备端AI和智能路由技术,构建能将推理成本降低最多90%的高效架构。”
负责Kakao自主AI模型开发和服务优化的成果负责人卢炳锡(44岁)在接受《Edaily》采访时表示:“在已公开的模型中,有规模约为30B的模型;而我们内部正在准备的,是比其大5倍左右的155B规模模型,目前已接近完成训练阶段”,并强调:“Kakao并非只专注于小型模型。” 他曾任职于电子通信研究院(ETRI)和英特尔,于2020年加入Kakao Brain。
关于Kakao的155B模型,罗负责人解释道:“可以将其视为政府‘自主基础模型’项目中,去年年底其他企业提交的模型规模水平。”他补充道:“去年年底Upstage的模型规模约为120B,而我们目前已拥有155B规模的模型。”
不过,与参与自主AI基础模型第二轮竞标的主要模型相比,其参数规模较小。LG AI研究院的750B、SK电信的688B、Motif的314B、Upstage的250B等模型的规模均大于Kakao。Kakao更侧重于根据服务目的灵活运用不同规模模型的战略,而非单纯追求模型规模的绝对大小。
155B“卡纳纳”……模型群多元化Kakao自主研发模型的背景,在于降低对外部AI模型成本依赖的战略。
诺负责人表示:“如果调用外部API,由于这些模型并非由我们自行开发和部署,成本自然会较高”,并补充道:“而且谁也不知道这种成本会持续到什么时候。”
他接着表示:“因为对方可能会突然宣布‘从今天起费用翻倍,甚至涨到10倍’,所以我们会尽量避免调用外部服务,而是通过我们自有的模型家族来解决所有问题。”
Kakao会根据问题的复杂程度调用不同的模型。简单的问题由小型模型处理,而像制定旅行计划这样复杂的请求则利用大型模型来提高回答质量。
诺负责人解释道:“我们的KakaoTalk需要面向4000万用户提供模型并开展服务,模型规模从最小的0.9B到1.3B、3B、8B、9.8B、30B乃至155B,模型系列非常丰富”,“并非所有用户都需要超大规模的模型。”
他接着说:“非常简单的回答可以用稍小的模型处理;而对于‘我明天要去济州岛旅行,请帮我制定旅行计划’这类稍难的问题,则会使用大型模型来制定计划,从而生成质量更高的回答。”
根据问题难度选择合适的模型,相比于对所有请求都使用最大规模的模型,既能降低推理成本,又能保持服务质量。
部署成本从100韩元降至10韩元……“降低AI成本”Kakao不仅致力于模型开发,还自主研发了在实际服务中运行模型的部署技术。
部署是指在服务器和GPU上实际运行已完成训练的AI模型,从而为用户的问题生成答案的过程。随着用户数量的增加,GPU使用量和成本也会随之上升,因此部署效率直接关系到AI服务的成本竞争力。
诺·里德表示:“在我目前负责的团队中,我们甚至会全面负责如何高效优化这些已构建的模型以实现服务部署,”并补充道:“例如,如果每次服务部署的GPU成本为100韩元,我们就能通过优化将其降至10韩元,此类优化工作我们都是自主完成的。”
如果说代表郑真雅提到的“智能路由”是根据问题决定使用哪种模型的技术,那么诺负责人所解释的部署优化则侧重于如何用尽可能少的GPU资源运行选定的模型。
该战略旨在在确保大型模型的同时,自主掌握能够以更少的GPU资源运行同一模型的服务技术,从而降低AI服务的成本。
分词器也自主开发……韩语处理效率提升1.6倍为了让AI能够理解和处理句子,Kakao还自主开发了将句子拆分为小单位“词元”的分词器(tokenizer)。
分词器是一种将人输入的句子转换为AI模型可计算单元的“句子分解器”。即使是同一句子的,根据所使用的分词器不同,所需的词元数量也会有所不同。在大规模AI服务中,词元数量越多,运算量和成本也会随之增加。
诺·里德表示:“我们已通过数据验证,卡纳纳分词器在处理韩语时的效率最高。”他进一步指出:“与全球广泛使用的开源模型之一——阿里巴巴的Qwen系列相比,我们的卡纳纳分词器在处理韩语时的效率高出1.6倍。”
他接着补充道:“这意味着,若使用其他模型来表达含义相同的句子,则需要多消耗1.6倍的令牌。”并强调:“像我们这样拥有数千万用户的平台,成本将因此增加60%,因此通过自主开发分词器来提升效率势在必行。”
Kakao不仅自主开发模型,还自主开发分词器,这也是为了降低大规模服务中产生的AI成本。
降低API成本……通过端侧AI进一步减少服务成本Kakao还利用端侧AI技术。该策略旨在通过在智能手机(而非服务器)上处理部分AI运算,从而降低服务器的GPU使用量,并应对个人信息保护问题。
诺·里德表示:“由于在设备端运行的模型使用的是个人资源,因此对Kakao而言,服务成本为零”,并称“同时,敏感的隐私问题也从源头上得到了解决”。
他解释道:“用户的对话数据不会进入服务器,而是由设备端模型基于对话上下文,在设备上存储个性化信息,例如在‘明天在江南站见面吧’的对话中推荐地点。”他还补充道:“仅将设备端模型难以处理的复杂问题,在彻底清除个人信息后发送至服务器,由服务器处理上下文并给出回答,采用这种混合模式。”
Kakao的构想是结合设备端和服务器端AI,实现一种混合AI模式:将个人信息保留在设备上,而复杂的AI功能则由服务器模型处理。
利用KakaoTalk对话上下文……打造个性化AI代理Kakao计划利用KakaoTalk中积累的对话上下文,将其扩展
为个性化AI代理。
诺负责人表示:“资本差距已经大到让我们根本无法再考虑与ChatGPT、Claude、Gemini竞争并取胜了”,但他同时强调:“KakaoTalk中积累了与ChatGPT对话完全不同的、来自亲友之间的对话数据。正是基于这些数据,Kakao才能提供最个性化的AI代理服务。”
他接着表示:“如果不是那种对所有人给出相同回答的AI,而是一个非常了解我的AI,它就能根据对话对象调整语气,甚至运用我的说话方式”,并称:“其他任何全球竞争对手都无法做到的事情,我们却能实现。”
代理AI不仅能提供回答,还能执行实际操作。卢·里德解释道:“如果现有模型只是提供简单的回答,那么代理AI会像‘我已经这样搜索到了,这样操作可以吗?要付款吗?’这样,在征得用户确认后,将操作直至付款这一系列行为完整地执行下来。”
其构想是在KakaoTalk这一生活平台内,实现能够理解用户对话语境、并根据个人具体情况提供相应回答和行动的人工智能。
继卡纳纳2.6之后将迈向3.0……强化推理与代理功能Kakao还将继续推进卡纳纳的升级。计划于今年10月“if kakao 2026”大会前后完成卡纳纳2.6的开发,而在卡纳纳3中则将彻底改变架构本身。
诺·里德表示:“卡纳纳2.6的首要目标是实现比2.5更优异的性能,而过渡到卡纳纳3时,模型架构等将再次发生彻底改变”,并 并预告道:“我们正致力于大幅延长上下文处理长度,或通过改进模型结构,持续增强推理和智能代理能力。”
诺·里德描绘的Kakao人工智能,是一种即使用户没有意识到它的存在,也能在日常生活中自然运行的形式。从155B大型模型到设备端AI,Kakao不仅在模型规模上,更在如何高效地实际应用AI并实现个性化方面下足了功夫。