相关性;(c) 过滤捷径题前后主要模型的性能差距。(图片来源:Naver Cloud)
[E-DailyHan Kwangbeom 记者] 随着Team Naver共有23篇研究论文被世界三大计算机视觉学术会议之一“ECCV(欧洲计算机视觉会议)2026”录用,Naver(NAVER(035420) )Cloud公开了4篇聚焦AI“理解过程”与“评估体系”的论文。
Naver Cloud于28日表示,在此次ECCV 2026会议上,他们诊断了隐藏在表面基准测试分数背后的AI技巧和判断错误,并提出了纠正这些问题的学习方法。
首先,Naver Cloud分析了评估AI视频理解能力的现有视频基准测试中的缺陷(论文:《Video-Oasis:重新思考视频理解的评估》)。 针对现有的14个基准测试,进行了视频移除、场景顺序打乱等6种测试,结果显示,55%的题目即使不仔细观看视频也能答对。排除此类题目后重新评估,主要模型的准确率仅为26%至37%。Naver Cloud并未制定新的评估标准,而是提出了一种用于诊断现有测试题本身问题的工具。
研究还探讨了AI依赖物体来惯性判断动作的问题(论文:《Why Can’t I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition》)。 具体来说,AI在训练数据中学习到“抽屉”主要与“关闭”动作组合出现后,便会在未观察实际动作、仅看到抽屉的情况下,就将其判定为“关闭”动作。研究团队通过引入视频合成技术和逆向学习法,仅靠改进学习方法,无需收集额外数据或扩展模型,就提升了动作识别的精度。
校正,其精度高于现有方法(中间),结果如图所示(右侧,绿色)。(图片来源:Naver Cloud)
还发布了利用AI弱点来提高精度的遮罩精炼技术“凤凰(Phoenix)”(论文:《Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation》)。 该技术利用能使AI失效的“对抗性攻击”技术,自动生成AI在实际中容易混淆的区域的训练数据。通过此举,将物体轮廓提取及微小区域区分的精细分割性能提升了最高21个百分点。
还展示了利用语言模型学习图像中三维空间结构的研究“SpatialBoost”(论文:《SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning》)。 该研究从2D照片中提取深度和位置信息并转换为句子,随后按点、物体、整个场景的顺序分阶段构建空间理解能力,并通过语言模型将其注入视觉模块。这种方法在降低3D数据构建成本的同时,也提升了机器人操作和图像分类性能。
Naver Cloud相关人士表示:“此次入选的论文意义重大,它们验证了AI是否能够正确处理信息,并指明了改进方向”,并称:“我们将深入研究AI理解和判断信息的全过程,以构建值得信赖的AI生态系统。”