目录一、Yolo介绍二、Yolo和CNN三、Yolo的原理Yolo的原理非极大值抑制NMS损失函数四、Yolo的发展史五、总结上一篇内容 PDF解析工具-MinerU 中提到了yolo模型。YOLOYou Only Look Once属于传统计算机视觉 CV Computer Vision模型和 Qwen‑VL 这类多模态大模型能力有本质区别。YOLO 负责画框定位物体没有高级语义推理多模态大模型可以看懂画面、做逻辑推理。一、Yolo介绍在各类实际业务场景里目标检测任务占比最高如下是真实使用场景中对车画了一个框并在上面的标签label上写了识别物体的种类。目前目标检测分为两大技术路线两阶段 Two‑StageR‑CNN 系列先生成大量候选框再对每个框做分类识别。精度更高但速度慢达不到实时。一阶段 One‑StageYOLO、SSD整张图片只经过一次 CNN 卷积运算同时预测物体位置和类别端到端输出结果。最大优势就是速度快可以视频实时检测。Two-stage方法准确度高一些但速度慢one-stage算 法是速度快但是准确性低一些YOLO 名字含义You Only Look Once图片只看一次就完成全部检测。YOLO的特点速度快能够达到实时的要求泛化能力强。广泛应用于各种需要目标检测的场景• 自动驾驶检测道路上的车辆、行人、交通标志等为自动驾驶系统提供决策依据。• 安防监控在视频监控中实时检测可疑人物或物体提高安防效率。• 机器人视觉帮助机器人识别和定位周围的物体实现自主导航和操作。• 智能交通用于交通流量监测、违章检测等提高交通管理的智能化水平。YOLO是一种非常有影响力的实时目标检测算法以快速、高效的特点在很多领域都发挥了重要作用。当然在实际工程中YOLO也并不一定能完全满足需求需要和多模态大模型经常搭配使用如MinerU 文档解析YOLOv8 检测 PDF 中公式区域再交给 UniMERNet 转 LaTeXLayoutLMv3 做布局检测请回看PDF解析工具-MinerU。监控业务YOLO 实时框选出人员再把画面送入多模态模型统计行为、事件。二、Yolo和CNNCNN (卷积神经网络) 我们在前面介绍过卷积神经网络CNN) 是做特征提取的关键工具。比如我们想要区分人• 先用S细胞卷积找到无数个小碎片横线、竖线、圆弧。• 再用C细胞池化忽略掉无关紧要的位置抖动。• 最后层层叠加把线条拼成眼睛把眼睛拼成脸把脸拼成完整的人。那么通过CNN学习背景部位的激活度基本很少。卷积层数越多学习到的特征越高阶。YOLO (You Only Look Once) 是 解决方案/架构 。 它是一个设计精妙的算法框架。把这一堆CNN 按照特定的顺序组装起来不仅要看懂图还要算出物体在哪个位置坐标。如果把CNN 看作砖块YOLO 是用砖块盖起来的摩天大楼。三、Yolo的原理Yolo的原理1网格划分把输入图片切分为 S×S 的网格YOLO‑V1 是 7×7共 49 个格子。2每个网格输出预测每个网格预测 B 个边界框 BBox每个框输出 5 个值中心点 x、y宽 w高 h置信度 confidence0~1表示预测框的可信程度同时输出 C 个类别的概率。这个B是自己来设定的假如设B等于2一个格子里面最多可以包含两个物体C是能识别的物体的种类。到底能识别多少种物体需要提前对yolo模型进行训练。每个网格输出的向量长度为 len B * 5 C把所有网格拼在一起最终输出张量形状(S,S,len)3卷积做特征提取非极大值抑制NMS非极大值抑制 NMS同一个物体会被多个网格重复预测生成大量重叠框。通过 IOU 交并比计算框重叠程度保留置信度最高的框过滤掉重复冗余框得到最终干净的检测结果。具体流程如下step 1:将重复预测框按照置信度排序保留置信度最高的A框作为基准框step 2:将框A和其他框计算交并比如果交并比大于某个阈值那么说明重叠严重去掉循环以上步骤直到所有框处理完毕。损失函数yolo的速度快是因为它只经过一次计算就预测了物体的类别和位置。他的误差有分类误差和定位误差。四、Yolo的发展史YOLO‑V1 奠定一阶段检测整体框架V2/V3 持续优化性能。YOLO 原作者完成 V1‑V3 之后出于伦理顾虑退出 CV 社区后续 V4、V5 及更高版本由社区继续迭代。优势速度极快早期版本就可以做到每秒 45 帧轻量版本可达 155 帧可在 CPU、浏览器端实时运行开源、工业落地广泛无人驾驶、安防监控、文档检测都大量使用。YOLO 版本演进表版本年份关键改进代表意义YOLOv12015单阶段检测开山之作S×S 网格划分 直接回归坐标与类别速度革命首次实现实时检测45 FPS将检测视为回归问题YOLOv22016引入 Anchor Box、批归一化BN、多尺度训练Multi-Scale、高分辨率分类器精度大幅提升mAP 从 63.4% 提升至 78.6%支持 9000 类别YOLO9000YOLOv32018多尺度预测13×13/26×26/52×52、特征金字塔网络FPN、独立逻辑分类器小目标检测增强Darknet-53 backbone兼顾速度与精度YOLOv42020CSPDarknet53 骨干、Mosaic 数据增强、CIoU Loss、DropBlock 正则化、SPPPAN Neck工业落地标杆系统验证 Bag of Freebies 与 Bag of Specials 技巧组合YOLOv52020Ultralytics 工程化实现、PyTorch 原生、AutoAnchor、模型缩放n/s/m/l/x、ONNX 导出工程化典范易用性极佳社区生态最活跃部署友好YOLOv62022美团开源、RepVGG 重参数化、更高效的 Neck 设计、硬件感知量化QAT产业落地专精工业场景推理速度优化显著YOLOv72022E-ELAN 架构、模型重参数化、动态标签分配、扩展的高效层聚合网络学术 工程并重训练成本降低实时性与精度双优YOLOv82023Anchor-Free 设计、C2f 模块CSPLayer 改进、解耦头Decoupled Head、任务统一检测 / 分割 / 姿态 / 分类新一代基线架构现代化支持实例分割与姿态估计YOLOv92024可编程梯度信息PGI、通用高效层聚合网络GELAN、辅助可逆分支信息瓶颈突破解决深度网络信息衰减问题轻量级模型表现优异YOLOv102024无 NMS 端到端设计、一致性双标签分配TAL、效率驱动的模型设计去除后处理消除 NMS 延迟实现真正端到端检测YOLOv112024C3k2 模块C2f 改进、大核可分离卷积LKA、注意力机制集成效率 精度平衡Ultralytics 最新版进一步优化计算效率YOLOv122024区域注意力机制AAttn、R-ELAN 架构、FlashAttention 优化、纯 Transformer 风格设计注意力融入 YOLO首次在保持实时性的前提下引入全局注意力五、总结YOLO 是经典一阶段目标检测 CV 模型核心就是把检测问题转化回归问题一次卷积同时输出物体位置与类别主打实时高速。 但 YOLO 只完成 “看见、定位物体”不具备高级语义理解能力。现在的工程方案大多是「YOLO 等传统 CV 小模型做感知 VLM 多模态大模型做推理」的组合两者各司其职。模型能力输出形式推理能力YOLO目标定位、识别物体类别坐标框、置信度、类别 ID❌无语义推理只识别特征VLM 多模态大模型 (Qwen‑VL/InternVL)看图理解、问答、逻辑推理自然语言文本✅具备推理能回答复杂业务问题