视觉智能发展综述
魏云超
任中伟
方岩
北京交通大学 计算机科学与技术学院,北京 100044
摘要:视觉智能作为人工智能的核心分支,旨在赋予机器类人视觉的理解与交互能力.本文首先系统性地梳理了自2012年深度学习在计算机视觉领域取得重大突破以来,现代视觉智能所经历的4个环环相扣、层层递进的演进阶段:第一阶段,以AlexNet、VGGNet、ResNet为代表的监督学习范式,在ImageNet规模标注数据集的驱动下,神经网络于封闭域特定任务(如图像分类、目标检测)上取得了突破性进展,但其对标注数据的严重依赖催生了后续变革;第二阶段,以MoCo、DINO、MAE等模型代表的自监督学习兴起,通过对比、蒸馏、掩码重构等方法,从海量无标签数据中学习到了强大的通用视觉表征;第三阶段,基于强大的视觉基础,视觉智能与自然语言处理深度融合,以CLIP、GPT-4V为代表的多模态模型实现了从"识别"到"理解"的飞跃,能够处理开放词汇的视觉概念,并向像素级、意图导向的精细化推理演进;第四阶段,即当前的前沿领域——世界模型,其目标不再局限于理解与描述,而是构建能够模拟、预测物理世界的内部生成模型(如Sora),为实现与真实世界交互的具身智能奠定基础.预测物理世界的内部生成模型(如Sora),为实现与真实世界交互的具身智能奠定基础.这一从对世界的判别式理解到生成式模拟的深刻转变,标志着一个新的领域共识正在形成:生成式建模正成为新的深度学习.然后遵循此发展脉络,深入剖析各阶段核心思想、关键模型与技术范式,揭示其内在的演进逻辑.最后深入探讨视觉智能面临的鲁棒性、推理能力、泛化性等挑战.
关键词:视觉智能深度学习自监督学习多模态AI世界模型
分类号:TP391.4(计算技术、计算机技术)
论文发表日期:2025-10-30
在线出版日期:2025-11-06(本平台首次上网日期,不代表文献的发表时间)
页数:16( 66-81 )
英文信息
