[E-DailyKim Hyun-ah 记者] 政府将向民间开放由参与“自主AI基础模型(独基模)”项目的5支精英团队构建的3544万条AI训练数据。国内在获取大规模训练数据方面面临困难的AI初创企业、中小企业及研究人员等,可通过AI Hub免费下载这些数据,并将其用于AI模型开发和服务构建。
科学技术信息通信部和韩国智能信息社会振兴院(NIA)宣布,将把Naver Cloud、Upstage、SKTelecom(017670) 、NC AI以及LG Corp.(003550) 人工智能研究院在第一阶段评估过程中构建的29种AI训练数据在AI Hub上公开。
12月30日下午,副总理兼科学技术信息通信部部长裴京勋在首尔江南区COEX礼堂举行的自主AI基础项目发布会上致欢迎辞。照片来源:News1
公开数据规模约达3544万条,1.56万亿个令牌(估算值)。其中不仅包含大规模预训练数据,还涵盖推理、智能体、多模态及AI安全性数据等,可用于开发新AI模型或提升现有模型的性能。
其中,Upstage构建的1万亿令牌规模预训练数据尤为引人注目。该数据可用于从头开始训练大规模AI模型,同时还将公开知识·智能数据、用户偏好数据以及智能体行为能力数据等后训练数据。
Naver Cloud提供了包括234万条公开视频和52万条广播视频在内的视频相关文本及语音数据。这些数据可用于视频理解和图像生成等多模态AI开发。
SK电信公开了数学、科学、法律等专业领域的高难度推理数据,以及语音、图像数据和1万份韩国式红队测试数据等。这些数据可用于提升专业AI模型的推理能力和安全性。
NC AI提供了基于实际工业现场的制造技术文档和投诉咨询语音等数据。这些数据可用于长上下文理解、分步推理、多轮对话及多模态AI开发,其中还包含医疗AI相关的图像数据。
LG AI研究院将公开面向类人机器人的“场景理解(Scene Understanding)”数据集。该数据集基于韩国家庭环境构建,包含图像和文本数据,可用于物理AI以及视觉、VLM模型的开发等。
政府在公开前,通过国家信息社会局(NIA)和韩国信息通信技术协会(TTA)对数据质量、个人信息及危害性等进行了验证,并剔除了受许可限制的数据。
此次数据开放,将为难以自主获取大规模数据的AI初创企业和中小企业提供获取模型开发所需数据的机会。从预训练到推理、智能代理、多模态及安全性等,各类用途的数据均可利用,预计将有助于缩短研发周期并降低成本。
科技信息通信部计划对第二阶段评估过程中构建的数据也进行质量验证后予以追加开放。 科技信息通信部人工智能政策室长金京万表示:“自主AI基础模型项目不仅限于AI模型的开发,更重要的是,它通过开发过程中积累的经验和诀窍,为整个AI生态系统的质量提升做出贡献,这具有重大意义。”他还指出:“今天开放的数据凝聚了精英团队的AI学习策略,是宝贵的资产,必将成为推动AI生态系统成长和增强其自我发展能力的基石。”
科学技术信息通信部和韩国智能信息社会振兴院(NIA)宣布,将把Naver Cloud、Upstage、SKTelecom(017670) 、NC AI以及LG Corp.(003550) 人工智能研究院在第一阶段评估过程中构建的29种AI训练数据在AI Hub上公开。
公开数据规模约达3544万条,1.56万亿个令牌(估算值)。其中不仅包含大规模预训练数据,还涵盖推理、智能体、多模态及AI安全性数据等,可用于开发新AI模型或提升现有模型的性能。
其中,Upstage构建的1万亿令牌规模预训练数据尤为引人注目。该数据可用于从头开始训练大规模AI模型,同时还将公开知识·智能数据、用户偏好数据以及智能体行为能力数据等后训练数据。
Naver Cloud提供了包括234万条公开视频和52万条广播视频在内的视频相关文本及语音数据。这些数据可用于视频理解和图像生成等多模态AI开发。
SK电信公开了数学、科学、法律等专业领域的高难度推理数据,以及语音、图像数据和1万份韩国式红队测试数据等。这些数据可用于提升专业AI模型的推理能力和安全性。
NC AI提供了基于实际工业现场的制造技术文档和投诉咨询语音等数据。这些数据可用于长上下文理解、分步推理、多轮对话及多模态AI开发,其中还包含医疗AI相关的图像数据。
LG AI研究院将公开面向类人机器人的“场景理解(Scene Understanding)”数据集。该数据集基于韩国家庭环境构建,包含图像和文本数据,可用于物理AI以及视觉、VLM模型的开发等。
可在AI Hub免费使用……部分数据在“安心区”提供此次公开
的数据可在AIHub的“自主AI模型数据”菜单中,按团队或数据类型进行搜索查看。韩国企业、研究人员及学生等均可免费下载并使用。部分数据出于保护个人信息等考虑,需经单独申请后,方可在AI Hub的“安心区”使用。
政府在公开前,通过国家信息社会局(NIA)和韩国信息通信技术协会(TTA)对数据质量、个人信息及危害性等进行了验证,并剔除了受许可限制的数据。
此次数据开放,将为难以自主获取大规模数据的AI初创企业和中小企业提供获取模型开发所需数据的机会。从预训练到推理、智能代理、多模态及安全性等,各类用途的数据均可利用,预计将有助于缩短研发周期并降低成本。
科技信息通信部计划对第二阶段评估过程中构建的数据也进行质量验证后予以追加开放。 科技信息通信部人工智能政策室长金京万表示:“自主AI基础模型项目不仅限于AI模型的开发,更重要的是,它通过开发过程中积累的经验和诀窍,为整个AI生态系统的质量提升做出贡献,这具有重大意义。”他还指出:“今天开放的数据凝聚了精英团队的AI学习策略,是宝贵的资产,必将成为推动AI生态系统成长和增强其自我发展能力的基石。”