
产品经理视角学AI——CV领域(一)
为非技术背景的产品经理设计的 CV 从 0 到 1 学习路径:图像数字化、卷积与特征提取,四大核心任务的取舍,以及从 AlexNet 到 ViT 的五个里程碑。
TL;DR
这是「AI技术理解」系列的第一篇,也是 CV 六章学习路径中的基础部分。 全文围绕产品经理的核心四问展开——业务问题、输入输出、性能边界、落地成本, 依次讲清图像数字化与卷积等基础概念,分类 / 检测 / 分割 / 生成四大任务各自的能力上限与标注成本, 以及从 AlexNet 到 Vision Transformer 五个改变行业的技术里程碑。每一节都附了学习资源与该掌握到什么程度。
目录
如果你想自学 AI,尤其是转行做 AI 产品经理,是否感到有些迷茫?不知道从哪里开始学,或者怎样进入这个领域?如果你的目标是进入计算机视觉(CV)领域,今天我整理了一个非常全面的学习路径,专为产品经理设计,帮助你从 PM 视角学习 AI。
作为非 AI 专业背景的产品经理,你可能正考虑如何跨越这个技术门槛,进入 AI 领域,甚至成为一名 AI 产品经理。本系列文章将从「产品经理视角」出发,分为三大部分,总计六个章节:
- 基础概念
- 核心 CV 任务
- 技术 Milestone
- 大模型时代
- 前沿技术——多模态
- 技术挑战与工程落地
以下是从 0 到 1 入门 CV 领域的学习路径。如果你有兴趣学习其他领域的 AI 知识,也可以参考类似的路径。本文内容干货满满,尽管篇幅较长,但可以收藏并一步步跟着学习。
下面将从产品经理的视角,带你了解 CV 领域的核心概念、学习资源、学习目标、掌握程度及技术性能边界等。通过这种思维框架,PM 可以从用户需求出发去理解技术,而非仅仅从工程师的角度去思考。理解了这些「前世」,你才能更好地做好今天的工作。
零、核心四问
对于 PM 而言,关键点不仅在于理解技术的「是什么」,更在于洞察其「为什么」以及「如何用」。在每一层级的探讨中,要始终贯穿产品经理的核心四问:
- 业务问题:这项技术或模型旨在解决何种具体的业务挑战?
- 输入与输出:它的运作需要什么样的数据,最终产出什么形式的结果?
- 性能边界:它的能力极限在哪里,存在哪些固有的局限性?
- 落地成本:将其产品化需要付出哪些显性与隐性的代价?
一、基础概念
1. 图像数字化
核心概念:图像不仅仅是一幅画,它是一个结构化的数字矩阵。这是产品经理需要理解的最重要的概念,因为它将「AI 魔法」去神秘化,并将其根植于计算的现实中。
知识点:
- 像素:图像的最小单位,每个像素都是一个捕捉光线和颜色信息的微小方块。对于产品经理来说,像素的数量(即分辨率)是成本的直接乘数。机器视觉系统通过分析像素级数据来识别模式、边缘和差异,从而揭示物体的关键细节。
- 通道:颜色信息的层,通常是构成全彩图像的红、绿、蓝(RGB)三层。对于产品经理来说,这意味着一张彩色图像实际上是三个矩阵,其原始数据量是灰度图像的三倍。这会影响存储、内存和处理要求。
- 分辨率:像素网格的尺寸(例如 1920x1080)。对产品经理而言,分辨率是一把双刃剑——优势是更高的分辨率提供更多细节,这对于检测微小的制造缺陷或在广阔场景中识别小目标至关重要;劣势是分辨率翻倍会使像素数量增加四倍,导致计算负载、存储成本和数据标注工作量呈二次方增长。这是任何 CV 产品都必须进行的关键权衡分析。
PM 视角:这种权衡并非纯粹的技术选择,而是一个根本性的产品战略决策,它定义了一条「成本-质量曲线」。这条曲线迫使产品经理在用户体验(例如,看到精细细节的能力)和商业可行性(例如,计算资源、延迟、存储成本带来的商品销售成本)之间做出明确取舍。
例如,对于一个 B2B 工业检测产品,发现一个微小但代价高昂的缺陷所带来的商业价值,可能足以证明处理 4K 图像的高昂计算成本是合理的。相反,对于一个消费级社交媒体应用,略微清晰的图像所带来的价值,不太可能证明增加的服务器成本和用户数据流量消耗是合理的,因此选择较低分辨率是更优的产品决策。
学习资源
行动建议:观看一个简短的、可视化的 YouTube 视频,解释 RGB 通道如何组合成一张图像。
- 像素和分辨率:https://www.youtube.com/watch?v=pJbaKcoVIWY
- 通道:https://www.youtube.com/watch?v=dR8ZYjnvIh0、https://www.youtube.com/watch?v=SpmmjuMDp7E
学习目标:建立一个直观的、非数学的感觉,理解计算机是如何「看见」一张图片的。
掌握程度:无需进行矩阵运算,但应能向利益相关者解释,为什么实时处理 4K 视频流的成本比处理 480p 视频流要高出指数级别。
2. 经典图像处理——卷积
核心概念:卷积是卷积神经网络(CNN)的基础运算。它涉及将一个小矩阵(称为滤波器或卷积核)在图像矩阵上滑动,以检测特定的模式。这一过程的灵感来源于动物视觉皮层的感受野,其中单个神经元仅对视觉场中一个受限区域的刺激作出反应。
PM 视角:将滤波器 / 卷积核想象成一个专门的「模式探测器」或「特征放大镜」。一个滤波器可能被设计用来检测垂直边缘,另一个用来检测曲线,还有一个用来检测特定的纹理。
CNN 并非使用预先编程的滤波器,它在训练过程中从数据中学习出完成任务所需的最佳滤波器,这正是深度学习的精髓所在。这种滑动运算的输出被称为特征图,它突显了特定模式在图像中的位置。
通过堆叠这些层,网络构建了一个特征的层级结构:早期层学习简单的边缘和颜色,中间层将这些组合成形状和纹理(如眼睛和鼻子),而最终层则将它们组合成复杂的对象(如人脸)。这种层级化的方法赋予了 CNN 强大的能力。
学习资源
行动建议:访问一个在线交互工具,如 CNN Explainer,它能直观地展示一个滤波器在图像上滑动并创建特征图的过程。创建完特征图,才会进入神经网络。
- 网站地址:https://poloclub.github.io/cnn-explainer/#article-input
- 讲解视频:https://www.youtube.com/watch?v=vi9eNd9CPnk
学习目标:在不需要理解底层线性代数的情况下,对卷积运算获得一种感性的理解。你应该能够向非技术背景的设计师解释「滤波器」和「特征图」的概念。
掌握程度:概念层面。需要理解它做什么(模式检测),而不需要知道其数学原理如何工作。
3. 特征提取——深度学习之前的时代
手工特征提取 → 从数据中自主学习特征;从「特征提取算法(SIFT/HOG)+ 分类器(SVM)」→ 端到端学习(CNN 模型)。
核心概念:在深度学习实现特征提取自动化之前,工程师必须手动设计算法来从图像中提取有意义的特征。SIFT、SURF 和 HOG 是这些「手工制作」特征描述符的典型代表。
知识点:
- SIFT:识别图像中独特的「关键点」(如角点或独特的纹理点),这些关键点对尺度和旋转变化具有鲁棒性。它回答了「这张图片中最独特、最易识别的点是什么?」的问题。
- HOG:通过统计图像局部区域中梯度方向(边缘方向)的出现次数来描述物体的形状,在行人检测方面效果显著。
PM 的启示:理解这个「过去」对于领会深度学习革命的意义至关重要。关键区别在于「显式」与「隐式」的特征工程。
- 显式(SIFT/HOG):由人类专家决定哪些特征是重要的(例如「边缘和角点很重要」)。这种方法可解释性强、所需数据较少,但较为脆弱,难以很好地泛化到新的、未见过的物体类别。
- 隐式(CNNs):模型自动从数据中学习重要特征。这种方法功能更强大、可扩展性更强、鲁棒性更好,但它创建了一个更难解释的「黑箱」。
这种在控制 / 可解释性与性能 / 可扩展性之间的权衡,是 AI 产品管理中一个反复出现的主题。
PM 视角:从 SIFT 时代到 CNN 时代的转变,也标志着产品风险和投入重点的转移。在 SIFT 时代,风险集中在算法设计上(我们手工设计的特征是否有效?);而在 CNN 时代,风险则转移到了数据管理上(我们是否有足够的高质量、已标注的数据来让网络学习到特征?)。在 SIFT 时代,产品经理会花更多时间与算法专家沟通;而在 CNN 时代,产品经理则更多地与数据运营团队合作,关心标注流程、数据质量和数据集偏见等问题。
学习资源
行动建议:观看 5 分钟的 YouTube 解说视频,对比 SIFT 如何寻找关键点与 CNN 如何处理整张图像。
- SIFT:https://www.youtube.com/watch?v=KgsHoJYJ4S8
- 神经网络:https://www.youtube.com/watch?v=NhvEGSuCLHA
- CNN 模型:https://www.youtube.com/watch?v=vi9eNd9CPnk
学习目标:理解从「设计特征提取器」到「学习特征提取器」的概念性飞跃。
掌握程度:高层次的概念性理解。你应该能够清晰地阐述,为什么对于一个需要识别数千种不同物体类别的产品来说,深度学习方法更具可扩展性。
深度探索建议
《动手学深度学习》(在线书 / B 站 PyTorch 版视频)第 6 章「卷积神经网络」相关小节(如 6.1~6.5),理解卷积、滤波等基础概念,并浏览 SIFT 等特征提取方法的基本原理(了解概念即可,无需深入数学推导)。
产品经理视角梳理
对于图像识别,过去依赖像 SIFT、HOG 这样的传统算法。这些算法的核心是由专家根据经验设计好的一套固定的数学规则,来提取图像中的边缘、角点等特征。产品经理的工作重点是验证和优化这些人为设计的规则。
但 CNN 带来了革命性的改变。它不再需要我们去定义什么是「好的特征」。我们给它一张图片(包括 RGB 三个通道),CNN 会使用一系列的滤波器 / 卷积核去自动学习特征。一个关键点是,一个滤波器会同时观察所有输入通道,来寻找特定的模式。更有趣的是,CNN 的学习是分层的:靠近输入的层会先学会识别像边缘、颜色块这样的基础特征;更深的网络层会把这些基础特征组合起来,形成比如「眼睛」「车轮」这样更复杂的抽象特征。
那它是怎么「学习」的呢?我们给它海量的数据,告诉它「这张是猫」「那张是狗」。CNN 会先进行一次预测,如果预测错了,就会通过反向传播和梯度下降的机制,回头去微调所有滤波器里的参数,目标就是让预测错误最小化。这个过程重复千百万次后,滤波器就自适应地学会了应该提取哪些特征才能最好地完成任务。
所以,作为产品经理,我们的工作重心也变了。我们不再是去问「我们的特征提取算法设计得对不对?」,而是要问:「我们提供的数据质量够高、数量够多么?这些数据能否让模型学习到区分不同物体的关键特征?」我们的成功更多地依赖于数据策略,而不是算法细节的设计。(到现在的大模型时代,产品经理的重点在评测上,后面会有大模型时代章节。)
二、核心 CV 任务
带着核心四问去学习。
1. 图像分类
业务问题:为整张图片分配一个或多个标签,以回答「这张图片的主要内容是什么?」。这是最简单、最成熟的 CV 任务。
输入 / 输出:输入是一张图片,输出是一个类别标签(例如「猫」)和一个置信度分数(例如「98% 的置信度认为是猫」),模型选取概率最高的类别作为识别结果。
经典算法 / 模型:LeNet-5(最早的 CNN 之一)、AlexNet(引爆深度学习革命的里程碑)。
产品应用(按商业价值分类):
- 提升运营效率:电子商务中的自动商品分类,制造业中的质量控制(检测「次品」与「合格品」),通过分类损伤类型来简化保险理赔流程。
- 保障安全与信任:社交媒体上的内容审核(将图片分类为「安全」或「不当内容」),安防系统(将图像分类为「检测到威胁」)。
- 医疗与科学:通过对医学影像进行分类辅助诊断(例如「存在肺炎」vs.「健康」),在农业中识别作物病害。
性能边界:图像分类通常假设图片中有单一主要物体,当图像包含复杂背景或多个目标时,分类的表达力就不足(这正是检测要解决的问题)。此外,分类模型对训练数据依赖很强:如果出现未见过的新类别或不常见角度,可能无法正确分类。
落地成本:相对而言,分类任务的数据标注成本最低(只需对整图打标签而非逐像素标注)。许多预训练的分类模型(如 ResNet、Vision Transformer 等)开源可用,可通过微调降低定制数据需求。在实际部署中,分类模型计算开销适中,可以在云端或移动端实时运行。
2. 目标检测
业务问题:在单张图片内定位并分类多个物体,回答「这张图片里有哪些物体,它们分别在哪里?」。它比分类更进一步,通过边界框提供了位置信息——有哪些对象,以及每个对象的位置。
输入 / 输出:输入是一张图片,输出是一组边界框和对应的类别标签(有时还包括置信度评分)。例如输入一张街景图,输出可能是在行人和车辆位置上绘制的方框及其类别。
经典模型:主要分为「两步走」和「一步到位」两种框架。
- R-CNN 系列(R-CNN、Fast R-CNN、Faster R-CNN):代表性的两阶段检测算法。第一步生成候选区域(可能含物体的框),第二步用 CNN 分类器精细识别每个候选框的类别并微调位置。这类方法精度高,对小目标检测效果好,但缺点是计算流程复杂、速度较慢。Faster R-CNN 引入了区域提议网络(RPN)与主干 CNN 共享特征,使检测速度有所提高,但实时性仍不佳。
- YOLO(You Only Look Once)系列、SSD:代表性的单阶段检测算法。它们不再显式产生候选框,而是一张图直接回归出各类目标的位置和类别。这种方法省去了第二阶段,极大提升了检测速度,可以做到实时检测。YOLOv3/v5 等版本在精度和速度上取得很好平衡,已成为实时目标检测主流。SSD 则采用多尺度特征图预测不同大小的目标,精度和速度也表现优秀。
产品应用(与架构选择对应):
- YOLO(速度关键型):自动驾驶(实时检测车辆 / 行人),体育赛事直播分析(追踪球员和球),实时安防监控。
- R-CNN(精度关键型):医学影像(精确定位肿瘤或异常),工业质检(发现微小但关键的瑕疵),零售货架分析(精确盘点每件商品)。
性能边界:检测模型需同时兼顾精度和速度。两阶段方法若部署在实时场景(如行车每秒帧视频),可能速度不足;单阶段方法虽然快,但在小目标、遮挡情况下精度可能下降,而且容易出现漏检或误检(YOLO 因采用密集预测,有时会产生较多假阳性框)。另外,训练检测模型需要大量带标注框的数据,对标注质量和数量要求高。
落地成本:边界框标注比分类标签贵重得多(需要逐对象画框)。模型方面,轻量级检测模型(如 YOLO-nano 版)可以在手机端跑,但高精度模型往往需 GPU 支持才能达到理想速度。部署时还需考虑不同场景下的迁移学习:例如从公开数据集训练的模型,可能需要在你的业务数据上微调才有最佳效果。维护成本上,需定期检查模型在新环境下的表现,数据漂移会导致检测准确率下降,需要追加训练数据。
学习资源
行动建议:阅读一篇博客文章,其中包含 YOLO 和 Faster R-CNN 在驾驶数据集上并排比较的视频。
- 对比博客:https://medium.com/data-science/yolov5-compared-to-faster-rcnn-who-wins-a771cd6c9fb4
- GitHub 仓库(README 底部有自动驾驶对比):https://github.com/alen-smajic/Real-time-Object-Detection-for-Autonomous-Driving-using-Deep-Learning
学习目标:直观地感受这种权衡。你会注意到 YOLO 的视频更流畅(更高的 FPS),但可能偶尔会漏掉一个 Faster R-CNN 能捕捉到的远距离行人。
掌握程度:你应该能够自信地向工程负责人解释,为什么你为产品的 MVP 优先考虑速度或准确度,并能用具体的用户故事来证明其合理性。
深度探索建议
建议学习《动手学深度学习》第 13 章相关小节(13.3~13.8),其中涵盖目标检测的基础概念(锚框、多尺度检测)以及 SSD、R-CNN 系列等算法原理。你也可以参考百度云智社区的文章《从 R-CNN 到 YOLO:目标检测模型的演进与比较》,获取各算法优缺点的对比(包含 R-CNN、YOLO、SSD 论文原文)。阅读这些材料时,关注算法思想和性能权衡,无需深入实现细节。
3. 图像分割
业务问题:对图像进行像素级别的分类,为图像中的每一个像素分配一个类别标签,回答「哪类物体占据了哪些像素」。这提供了最精细粒度的理解。它比目标检测更加精细:检测只给出框,而分割能清晰描绘物体轮廓。
输入 / 输出:输入是图片;输出可以看作与输入等大的标签矩阵,每个像素标注所属类别(语义分割)或所属实例 ID。输出通常以彩色掩码图呈现,以不同颜色表示不同类别 / 实例的像素区域。
类型与 PM 视角:
- 语义分割:将属于同一类别的像素归为一类,不区分具体实例。比如把图中所有「车」像素都涂成一种颜色。常见模型有 FCN(全卷积网络)、U-Net(医疗图像常用)等,适用于场景的宏观类别。
- 实例分割:区分同类的不同实例,每个对象都有独立的掩码。比如在街景中,不仅分出哪些像素是「车」,还区分这是第 1 辆车、第 2 辆车,给它们不同颜色。典型模型是 Mask R-CNN,它在 Faster R-CNN 检测框架基础上增加了像素级掩码预测。
产品应用:
- 自动驾驶:识别精确的可行驶区域、车道线和人行道,而不仅仅是用框标出车辆。
- 医学影像:为手术规划或体积测量精确勾画肿瘤或器官的边界。
- 创意工具:视频会议中的「虚拟背景」就是一个实时的图像分割任务。允许用户选择并修改特定物体(如人物)的照片编辑工具也使用了分割技术。
- 卫星图像:对土地用途进行像素级分类(如水体、森林、城市),用于环境监测。
性能边界:分割的难点在于像素级的精度要求高,因此对光照变化、物体遮挡、边缘模糊等情况非常敏感,模型需要非常精细的特征才能正确划分边界。同时分割计算量大,常比检测慢,实时分割对硬件要求高。分割模型对小物体也不友好,小面积区域可能被忽略或误分类。
标注成本:极高——需要人为勾画每张图每个物体的像素轮廓,这是耗时耗力的,训练这样的模型需要大量像素标注数据。部署方面,语义分割模型可以与检测模型共享部分特征(有些产品将检测与分割结合),但总体计算开销大,多运行在云端或高性能边缘设备上。维护时若遇到新场景(比如不同城市街景),往往需要收集新数据重新标注训练,以保证像素级准确度。
学习资源
- Mask R-CNN 论文原文:https://arxiv.org/abs/1703.06870(建议先看知乎上的原理概述文章)
- COCO 官方站:任务与数据规模总览(80 类、150 万实例、含 stuff 类),用于把常见类别和标注形式建立直觉
- Ultralytics 的 COCO-Seg 与 Instance Segmentation 文档:同一张图对应的实例分割 mask 示例,非常适合对照理解「每个实例一张 mask」的概念,并对比检测 / 分割 / 姿态任务
- 体验 Meta 的开源工具 Segment Anything,感受通用分割模型的能力:https://segment-anything.com/
4. 图像生成
业务问题:图像生成任务旨在根据输入(可以是随机噪声、文本描述或一张图片)合成一张新图像,实现「无中生有」或「按需造图」。它回答的是「如何根据某种条件创造图像」。常见生成模式包括:
- 无条件生成:给定随机种子,直接生成逼真的图像样本,例如生成各种人脸(典型模型:GAN)。
- 条件生成:基于输入条件来生成图像,例如文本生成图像(如输入描述「日落沙滩」,生成相应图像),或图像到图像(如给素描生成上色图)。
输入 / 输出:根据任务不同,输入可以是纯噪声(无条件 GAN 的情况)、文本描述,或者参考图像;输出则是一张合成的图像。以 Stable Diffusion 的文生图为例:输入一段文本提示,模型输出一张符合描述的新图。
经典模型:
- GAN(生成对抗网络):由 Ian Goodfellow 等提出的架构,由生成器和判别器两个网络对抗训练。生成器尝试欺骗判别器,产出越来越「真实」的图像。GAN 在过去几年非常火,涌现出多种变体(DCGAN、StyleGAN 等),能生成高分辨率、细节惊人的人脸、风景等。然而,GAN 训练不稳定,常出现模式崩溃(生成器只会生成有限几种样本)等问题。
- 扩散模型(Diffusion Model):近年崛起的生成主流。其原理是对训练图像逐步添加随机噪声直至完全噪声化,然后训练模型学会逆向去噪还原图像。经过许多步迭代采样,最终生成高质量图像。扩散模型(如 DDPM)在图像生成质量上往往超过 GAN,并避免了 GAN 的不稳定和模式崩溃问题。著名的 Stable Diffusion、DALL·E 2、Midjourney 等 AI 绘画模型背后用的都是扩散模型技术,它们可以从纯噪声开始,在提示词的引导下将其「去噪」成一张连贯的图像。
生成模型权衡对比(GANs vs. 扩散模型)
| 属性 | GANs | 扩散模型 | PM 决策标准 |
|---|---|---|---|
| 图像质量 / 多样性 | 质量高,但可能遭受「模式崩溃」(多样性低) | 顶级的质量、真实感和多样性,更擅长处理复杂分布 | 对创意多样性和照片真实感至关重要的产品(如 AI 艺术),扩散模型更优 |
| 推理速度 | 非常快(一次前向传播) | 非常慢(迭代去噪过程),可能慢 1000 倍以上 | 如果产品需要实时或近实时的生成,GANs 是目前唯一可行的选择 |
| 训练稳定性 | 训练过程出了名的困难和不稳定 | 训练过程更稳定、更可靠 | 从研发和工程成本的角度看,扩散模型更易于预测和使用 |
| 可控性 / 可编辑性 | 可控性较差,输入的小变化可能导致输出的大变化 | 更稳定、可控,编辑更具局部性和可预测性 | 对于涉及迭代设计或编辑的产品,扩散模型的稳定性是一个关键特性 |
| 理想应用场景 | 实时视频滤镜、快速虚拟形象生成 | 高质量营销创意生成、概念艺术、照片级产品模型图 | 所需的用户体验(交互式 vs. 离线式)是决定性因素 |
落地成本:训练一个高质量生成模型通常需要海量数据和算力(例如 LAION-5B 图像数据集、数百 GPU 日的训练成本)。所幸很多强大的模型开源了预训练权重,可以直接使用或微调,降低落地门槛。部署推理时,如 Stable Diffusion 可在带 GPU 的服务器甚至高端笔记本上运行,但实时生成高清图仍需较强计算资源。产品层面需考虑付费第三方 API(如 OpenAI 的 DALL·E 接口)与自建模型之间的成本、版权和安全问题。
学习资源
行动建议:使用一个免费的 Stable Diffusion(一种扩散模型)网页界面生成几张图片,然后观看一个实时 StyleGAN(一种 GAN 模型)的演示视频。
学习目标:亲身感受速度和质量的差异。扩散模型可能需要几秒到几分钟,但会产生令人惊叹的图像;GAN 则是瞬时的,但质量可能稍逊一筹。
掌握程度:用户级体验。你应该能够就哪种技术更适合你可能有的不同产品概念提出自己的看法。
深入探索建议
- 《Diffusion Models Beat GANs on Image Synthesis》论文摘要或相关中文解读:https://arxiv.org/abs/2105.05233
- OpenAI 官方博客对 DALL·E 的介绍,阐述了文本到图像生成的思路:https://openai.com/index/dall-e/、https://openai.com/index/dall-e-2/
- 或更直接的做法是动手使用 Stable Diffusion 开源模型:通过简单的 Colab 教程运行文生图,感受扩散模型的效果(不需深度掌握数学,只需了解其「加噪-去噪」过程)。通过实践,你可以更加直观地理解这类模型的能力和局限。
产品经理视角
值得注意的是,这些架构间的权衡并非一成不变。行业趋势显示出一种趋同现象:速度更快的模型在准确性上正迅速追赶,而更准确的模型也变得越来越高效。例如,较新的 YOLO 模型在性能上已经超越了旧的 R-CNN 模型,挑战了传统认知;同时,扩散模型也通过 ODE 求解器等技术变得更快。
这意味着我们今天创建的清晰的权衡表格只是时间上的一个快照。对于产品经理来说,这揭示了持续进行技术侦察的重要性:今天对你的产品而言「最好」的架构,可能在 18 个月后就过时了。这要求产品战略具备架构上的灵活性,避免被锁定在单一、老化的方法上。(多关注最前沿的技术、模型,找一个稳定获取前沿信息的渠道。)
三、技术 Milestone
1. AlexNet(2012):拉开深度学习序幕
AlexNet 由 Krizhevsky 等人在 2012 年提出,在 ImageNet 图像分类比赛中一举夺冠,将 Top-5 错误率降至 15.4%,比第二名低了 10 多个百分点。它证明了深度 CNN + GPU 训练的巨大威力,拉开了 CV 深度学习时代的序幕。
核心贡献:引入更深的卷积网络(8 层,其中包括 5 层卷积)、使用 ReLU 激活加速收敛、通过 Dropout 和数据增强缓解过拟合,以及充分利用 GPU 并行计算。这些技术要点后来成为深度 CNN 的基本配置。
影响:AlexNet 的成功直接催生了后续大量研究,证明 CNN 可以在大数据集上达到优秀性能,促使业界开始重视并投入深度学习。许多应用由此诞生,例如图片自动标注(Google Photos 利用 CNN 分类特征实现以图搜图)等。可以说,没有 AlexNet 就没有之后 CV 领域的繁荣生态。
2. VGGNet(2014):加深网络
VGG 网络是牛津大学 Visual Geometry Group 提出的,其特点是在 AlexNet 基础上进一步加深网络(16-19 层)且结构非常简洁统一。它用 3×3 的小卷积核堆叠取代了较大卷积核,以较少参数提取更复杂特征。
核心贡献:证明了网络越深、性能越好这一点(但也提示了参数和计算增加的代价)。VGG 采用模块化设计——不断重复卷积 + 池化块,这种规范化结构在当时便于复现和迁移。
影响:VGG 在 2014 年比赛中获得图像分类第二名,但因结构简单被认为可迁移性很好。事实也如此:VGG 的卷积特征在许多下游任务中被广泛用作预训练初始化(例如很多目标检测、分割模型都使用 VGG 提取特征或作为 backbone)。虽然如今更高效的网络替代了 VGG,但作为「深度有效性」的验证者,VGG 的思路影响深远。
3. GoogLeNet / Inception(2014):轻量化
GoogLeNet 是 Google 团队在 2014 年提出的 22 层深的网络(也称 Inception V1),它以 6.7% 的惊人成绩夺得当年 ImageNet 冠军。令人瞩目的是,GoogLeNet 只有约 4 百万参数,而当年的 AlexNet 有 6000 万。这得益于其创新的 Inception 模块设计。
核心贡献:Inception 模块在同一层内并行使用多种卷积核(如 1×1、3×3、5×5)以及池化,然后将结果拼接。这一结构在提取不同尺度特征的同时有效控制了计算量。此外,GoogLeNet 大量使用 1×1 卷积进行降维,进一步减少参数。总的来说,它探索了网络宽度与深度的高效平衡。
影响:GoogLeNet 开创了模型轻量化和高效计算的风潮。其成功证明,通过聪明的架构设计,在不牺牲准确度的情况下显著降低计算成本成为可能。这对工业界意义重大——模型不再只是追求精度,也开始追求部署效率。后续许多高效模型(如 MobileNet、SqueezeNet 等)都继承了这种理念。
4. ResNet(2015):证明极深网络的价值
2015 年微软亚洲研究院的何恺明等推出了 ResNet(残差网络),这是 CV 架构的又一次飞跃。ResNet-152 网络堆叠了 152 层之深,但通过引入残差连接成功解决了训练退化问题,最终获得 ImageNet 冠军,Top-5 错误率低至 3.57%,超越人眼水平。
核心贡献:残差结构的理念是让每层去学习「差值」(即 F(x) = H(x) - x)而非完整映射 H(x),通过恒等 shortcut 将输入直接加到输出上。这样信息和梯度可以跨层快捷传递,避免随着网络加深出现梯度消失或训练困难。ResNet 证明了极深的网络不仅可训练,而且能显著提升准确率。
影响:ResNet 几乎成为后来 CV 模型的标配骨干。例如目标检测的 Mask R-CNN、实例分割等很多 framework 都基于 ResNet 骨架,残差思想也延伸出 DenseNet 等架构。总而言之,ResNet 打开了堆叠百层乃至千层网络的大门,在学术和工业应用中被广泛采用,是目前最具影响力的 CNN 架构之一。
5. Vision Transformer(ViT,2020):视觉基模时代开启
ViT 由 Google 于 2020 年提出,将 Transformer 成功应用于视觉任务。Transformer 是 NLP 领域的大杀器,而 ViT 证明了即使不使用卷积,Transformer 架构也能在图像分类上达到 SOTA 性能。
核心贡献:ViT 把图像切成固定大小的小 patch(如 16×16 像素块),将每个 patch 线性展平并加上位置信息,作为类似单词的输入序列,然后用自注意力机制建模 patch 之间的关系。ViT 需要大量数据预训练,因为不像 CNN 那样有先验的局部平移不变性(即 ViT 缺少 CNN 的归纳偏置,需要数据弥补)。谷歌用大规模 ImageNet-21k 数据训练 ViT,结果在 ImageNet 上达到甚至超过同规模 CNN 的精度,展示了 Transformer 在 CV 领域的可行性和潜力。
影响:ViT 引领了「CV 与 NLP 架构统一」的趋势。此后,各种视觉 Transformer 层出不穷,用于分类、检测(如 DETR)、分割等任务,很多刷新了当时的性能纪录。对产品而言,这意味着未来视觉模型可能更多借鉴 NLP 的预训练大模型范式,具有更通用的视觉理解能力。ViT 的成功让业界开始思考视觉领域的基础模型如何构建,也为多模态模型融合视觉和语言埋下伏笔。
学习资源
建议阅读《动手学深度学习》第 7 章「现代卷积网络」相关小节(涵盖了 AlexNet、VGG、GoogLeNet、ResNet),加深对这些架构设计动机的理解。对于 Vision Transformer,可以查阅谷歌的 ViT 论文《An Image is Worth 16x16 Words》摘要或知乎上的科普帖,重点了解 Transformer 在图像中的处理方法和效果(不用深究数学证明)。
这些模型的原始论文可以收藏以备深入阅读:
- AlexNet:ImageNet Classification with Deep Convolutional Neural Networks(NIPS 2012)
- VGG:https://arxiv.org/abs/1409.1556
- GoogLeNet(Inception v1):https://arxiv.org/abs/1409.4842
- ResNet:https://arxiv.org/abs/1512.03385
- Vision Transformer(ViT):https://arxiv.org/abs/2010.11929
这个叙事表明,进步并非随机,而是对下一个最紧迫限制的针对性攻击。
产品经理视角
理解产品技术路线,我们当前的瓶颈是什么(成本、速度、准确度、数据),哪种架构创新可以解决它?
ViT 的崛起不仅仅是为了取代 CNN,更是为了创造一个更灵活、更通用的 AI 基础。结合了 CNN(用于局部特征提取)和 Transformer(用于全局关系建模)的混合模型正变得越来越流行,这表明未来不是「非此即彼」,而是一种「两全其美」的方法。
产品经理不应只考虑「我们用 CNN 还是 ViT?」,而应思考「针对我们的具体问题,局部和全局特征提取的正确组合是什么?」。这会引导与技术团队就可根据产品独特需求量身定制的混合架构进行更深入的讨论。
第一部分结尾
以上是基础部分的内容。只有打下了坚实的基础,才能够在接下来的学习中不断前进,理解更复杂的概念与技术。最重要的,是保持耐心,保持对这个领域的热情与好奇。相信自己,不要急于求成,遇到困难时,咬紧牙关继续前进。时间久了,你会发现自己在这个领域中已经迈出了稳稳的一大步。
这一部分为你奠定了从产品经理视角理解 CV 的基础。接下来的内容将深入探讨大模型时代对于传统 CV 领域的冲击,以及将这些基础知识应用到实际的产品开发中需要掌握的更多技术与思维方式。加油吧~
核心结论
标注「判断」「假设」的是我的看法而非事实;标注「已推翻」的保留在这里,不删除。
引用本文
晨旭,《产品经理视角学AI——CV领域(一)》,晨光里的AI,2025-09-25
[晨旭:《产品经理视角学AI——CV领域(一)》](https://chenxu.xin/writing/pm-learning-cv-1)