
本文针对计算机视觉中的七类典型任务,按照不同模型类别(小容量模型、经典算法、YOLO 系列、前沿算法、精准-低延迟-硬件友好型)进行推荐,并提供对比表格和模型简介。
1. 文档 OCR
| 类别 |
模型 |
参数量 |
推理速度 |
主要特点 |
内存 |
GPU |
| 小容量 |
MobileOCR |
~1.5M |
快 |
轻量端到端文本检测与识别 |
8GB |
可选(集成 GPU 服务器) |
| 经典 |
Tesseract |
N/A |
中 |
开源、多语言支持 |
16GB |
无 |
| YOLO |
YOLOv8-Text |
~30M |
快 |
基于 YOLOv8 的端到端文本检测 |
16GB |
≥12GB VRAM |
| 前沿 |
SwinTextSpotter |
~60M |
中 |
Swin Transformer 联合检测与识别 |
32GB |
≥24GB VRAM |
| 高精低延迟 |
PP-OCRv3 |
~34M |
中快 |
工业级流水线优化 |
16GB |
≥16GB VRAM |
模型简介
- MobileOCR: 极小模型,集成轻量级卷积 + CRNN,适合资源受限设备。
- Tesseract: Google 开源 OCR 引擎,需配合图像预处理和版面分析。
- YOLOv8-Text: Ultralytics 推出,利用 YOLOv8 框架进行文本检测。
- SwinTextSpotter: 使用 Swin Transformer backbone,性能优于大部分传统方法。
- PP-OCRv3: 百度飞桨生态,端到端流水线高效,兼顾精度与速度。
2. 人脸识别
| 类别 |
模型 |
参数量 |
精度 (LFW) |
主要特点 |
内存 |
GPU |
| 小容量 |
MobileFaceNet |
~0.5M |
99.63% |
移动端轻量化实时验证 |
8GB |
可选 |
| 经典 |
FaceNet |
~7.5M |
99.63% |
Inception + 三元组损失 |
32GB |
≥8GB VRAM |
| YOLO |
YOLOFace |
~30M |
检测95% |
YOLO 检测 + 特征提取 |
32GB |
≥12GB VRAM |
| 前沿 |
CurricularFace |
~11M |
99.83% |
动态难度调整优化损失 |
64GB |
≥24GB VRAM |
| 高精低延迟 |
InsightFace (ArcFace) |
~20M |
99.83% |
角度 Softmax 损失,高效部署 |
32GB |
≥16GB VRAM |
模型简介
- MobileFaceNet: 针对移动端轻量化设计。
- FaceNet: Google 提出,使用 Inception 网络与三元组损失。
- YOLOFace: 在 YOLO 检测基础上集成人脸识别。
- CurricularFace: 改进 CosFace/ArcFace,动态调整样本难度。
- InsightFace (ArcFace): 开源人脸识别库,角度距离损失效果卓越。
3. 目标检测
| 类别 |
模型 |
参数量 |
mAP |
推理速度 |
主要特点 |
内存 |
GPU |
| 小容量 |
NanoDet |
~1.5M |
25.4 |
快 |
Anchor-free 轻量化 |
8GB |
可选 |
| 经典 |
Faster R-CNN |
~41M |
42.1 |
慢 |
二阶段检测器 |
64GB |
≥16GB VRAM |
| YOLO |
YOLOv8 |
~30M |
≥50 |
快 |
通用性强,社区支持 |
32GB |
≥12GB VRAM |
| 前沿 |
Swin Transformer DETR |
~90M |
52.3 |
中 |
Transformer 检测架构 |
64GB |
≥24GB VRAM |
| 高精低延迟 |
Scaled-YOLOv4 |
~65M |
55.5 |
中快 |
CSPDarknet + 算子优化 |
32GB |
≥16GB VRAM |
模型简介
- NanoDet: 极轻量适合移动端应用。
- Faster R-CNN: 经典二阶段管道,多任务学习框架。
- YOLOv8: 最新 YOLO 版本,通用性和性能兼备。
- Swin Transformer DETR: 结合 transformer 的 DETR 架构。
- Scaled-YOLOv4: 在 YOLOv4 基础上扩展模型尺度,兼顾速度与精度。
4. 小目标检测
| 类别 |
模型 |
参数量 |
mAP_small |
推理速度 |
主要特点 |
内存 |
GPU |
| 小容量 |
TFLite-SSD-MobileNetV2 |
~6M |
12.8 |
快 |
TensorFlow Lite 量化 |
8GB |
可选 |
| 经典 |
FPN + Faster R-CNN |
~50M |
15.4 |
慢 |
特征金字塔增强 |
64GB |
≥16GB VRAM |
| YOLO |
YOLOv5s |
~7.3M |
14.6 |
快 |
YOLOv5 轻量版 |
32GB |
≥8GB VRAM |
| 前沿 |
DetectoRS |
~58M |
16.2 |
中 |
递归特征金字塔 |
64GB |
≥16GB VRAM |
| 高精低延迟 |
PP-YOLOE |
~47M |
18.3 |
中快 |
飞桨高效 YOLO 变体 |
32GB |
≥12GB VRAM |
模型简介
- TFLite-SSD-MobileNetV2: 量化后速度更快,适合嵌入式。
- FPN + Faster R-CNN: FPN 强化多尺度特征。
- YOLOv5s: 轻量版,速度佳。
- DetectoRS: 递归特征金字塔,增强小目标检测。
- PP-YOLOE: 百度飞桨推出的高效 YOLO 变体。
5. 关键点检测
| 类别 |
模型 |
参数量 |
AP (COCO) |
推理速度 |
主要特点 |
内存 |
GPU |
| 小容量 |
Lite-HRNet |
~4M |
70.1 |
快 |
轻量化高分辨率网络 |
8GB |
≥4GB VRAM |
| 经典 |
OpenPose |
~135M |
65.4 |
慢 |
多分支骨架检测 |
64GB |
≥16GB VRAM |
| YOLO |
YOLO-Pose |
~30M |
72.3 |
中 |
YOLO 热图预测关键点 |
32GB |
≥12GB VRAM |
| 前沿 |
HigherHRNet |
~30M |
75.5 |
中 |
高分辨率表示 |
64GB |
≥16GB VRAM |
| 高精低延迟 |
MoveNet Thunder |
~6M |
72.7 |
快 |
TFLite 实时优化 |
8GB |
可选 |
模型简介
- Lite-HRNet: HRNet 轻量变体,平衡速度与精度。
- OpenPose: 最早多人关键点检测框架。
- YOLO-Pose: 将 YOLO 框架扩展到关键点热图预测。
- HigherHRNet: HRNet 高分辨率特征。
- MoveNet Thunder: 针对实时时序优化。
6. 语义分割
| 类别 |
模型 |
参数量 |
mIoU (%) |
推理速度 |
主要特点 |
内存 |
GPU |
| 小容量 |
BiSeNetV2 |
~13M |
72.6 |
快 |
双分支速度优先 |
16GB |
≥4GB VRAM |
| 经典 |
FCN-8s |
~134M |
62.2 |
慢 |
全卷积开创性网络 |
64GB |
≥16GB VRAM |
| YOLO |
YOLOv8-Seg |
~30M |
≥70 |
中 |
分割头扩展 |
32GB |
≥12GB VRAM |
| 前沿 |
SegFormer |
~48M |
80.2 |
中 |
Transformer 分割架构 |
64GB |
≥24GB VRAM |
| 高精低延迟 |
Fast-SCNN |
~1.1M |
68.0 |
非常快 |
高效卷积+金字塔 |
16GB |
≥4GB VRAM |
模型简介
- BiSeNetV2: 同时优化速度与精度。
- FCN-8s: 语义分割里程碑式模型。
- YOLOv8-Seg: 对 YOLOv8 增加分割能力。
- SegFormer: 强化 transformer,在多个分割基准上领先。
- Fast-SCNN: 专为移动端设计。
7. 手势识别
| 类别 |
模型 |
参数量 |
Top-1 精度 |
推理速度 |
主要特点 |
内存 |
GPU |
| 小容量 |
MediaPipe Hands |
~2.5M |
98.5% |
快 |
实时掌部姿态估计 |
8GB |
可选 |
| 经典 |
C3D+LSTM |
~80M |
85.2% |
慢 |
3D 卷积 + LSTM 时序分类 |
64GB |
≥16GB VRAM |
| YOLO |
YOLOv8-Hands |
~30M |
96.8% |
中 |
YOLO 扩展手势检测与分类 |
32GB |
≥12GB VRAM |
| 前沿 |
ST-GCN |
~12M |
98.1% |
中 |
骨架时空图卷积 |
32GB |
≥12GB VRAM |
| 高精低延迟 |
TSP |
~5M |
97.4% |
快 |
时序点处理实时优化 |
16GB |
≥8GB VRAM |
模型简介
- MediaPipe Hands: Google 跨平台手部检测与关键点识别。
- C3D+LSTM: 视频手势经典管道。
- YOLOv8-Hands: 将 YOLOv8 迁移到手势识别。
- ST-GCN: 基于骨架图的时空图卷积。
- TSP: 时序点网络,速度与精度兼顾。
所有评论(0)