登录社区云,与社区用户共同成长
邀请您加入社区
RCNN,SSD, YOLO的优缺点比较及反思1. RCNNFast-RCNNFaster-RCNNFaster-RCNN 系列的反思2. YOLOYOLO V1YOLO V2YOLO V3YOLO系列的反思3. SSD1. RCNNrcnn对于原有的目标检测算法提升50% 在VGG-16网络模型下,voc2007数据集上准确率为66%,但是速度很慢,内存占用量大,主要原因为候选框由速度较慢的..
ORBextractor是 ORB(Oriented FAST and Rotated BRIEF)特征提取器的构造函数,用于初始化 ORB 特征提取器的各项参数和内部数据结构。
利用显著性作为伪像素监督的弱监督和半监督语义分割#
通过图像预处理去除噪声、增强对比度,进行图像分割以精确分割病灶区域,利用深度学习模型进行病灶检测和诊断预测。在人脸识别方面,手机的面部识别功能就是计算机视觉的应用实例,通过前置摄像头采集面部图像,识别关键特征并与保存图像对比,实现手机解锁。图像检索领域也有计算机视觉的新范式,如北京大学基础医学院博士生邵世豪与谷歌研究部合作提出的 SuperGlobal 方法,仅依靠全局特征进行图像检索的粗分和重排
MobileOCR: 极小模型,集成轻量级卷积 + CRNN,适合资源受限设备。Tesseract: Google 开源 OCR 引擎,需配合图像预处理和版面分析。YOLOv8-Text: Ultralytics 推出,利用 YOLOv8 框架进行文本检测。SwinTextSpotter: 使用 Swin Transformer backbone,性能优于大部分传统方法。PP-OCRv3: 百度飞
Opencv本质上是用于处理计算机视觉算法的一堆 C 和 C++源代码。全称Open Source Computer Vision Library,即开放源代码的计算机视觉库。Opencv库中的某些操作可利用自动多核处理,通过并行处理提高性能。OpenCV支持多种硬件加速技术,包括但不限于CUDA(NVIDIA的GPU编程模型)、OpenCL等,这些技术可以显著提升处理速度,特别是在执行大规模矩阵
陌讯多模态融合算法显著提升液体泄漏检测精度,误报率降低76%。该技术通过"环境感知-特征融合-动态决策"三阶架构,融合可见光与红外热成像特征,并采用加权注意力机制实现动态特征聚合。在工业测试中,算法mAP达到0.897,误报率仅6.8%,推理延迟42ms。某化工厂实际部署显示,日均误报次数从27次降至3次,响应速度提升90%。文章还提供了模型量化和数据增强等优化建议,使量化后模
将目标图像或视频的外观迁移到源图像或视频上将源图像(如一幅绘画)的 “风格” 迁移到目标图像或视频上,使其具有与源图像相同的风格。
这些边缘设备可以是物联网传感器、智能网关、边缘服务器等,它们能够对本地生成的数据进行实时处理和分析,仅将必要的数据上传到云端,从而减少数据传输量和延迟。同时,构建一个开放的边缘计算平台,吸引更多的开发者和企业参与,共同推动边缘计算技术的发展。例如,通过在患者佩戴的医疗设备上部署边缘计算模块,实时监测患者的生命体征数据,并在发现异常时立即通知医护人员,为患者提供及时的医疗救助。边缘计算通过在本地处理
本文档详细介绍了使用 PyTorch 框架搭建一个简单的手写数字识别系统的全过程。从环境准备到模型训练与测试,每一步都包含详细的代码示例和操作指南。该系统利用卷积神经网络(CNN)处理 MNIST 数据集,旨在为初学者提供一个易于理解且可操作的项目案例。
本文采用YOLOv8作为核心算法框架,结合PyQt5构建用户界面,使用Python3进行开发。YOLOv8以其高效的实时检测能力,在多个目标检测任务中展现出卓越性能。本研究针对行人目标数据集进行训练和优化,该数据集包含丰富的行人目标图像样本,为模型的准确性和泛化能力提供了有力保障。通过深度学习技术,模型能够自动提取行人目标的特征并进行分类识别。PyQt5界面设计简洁直观,便于用户操作和实时查看检测
为深度学习神经网路的图像数据集配置标签,使用labelimg/makesence为图像数据集做标注
【摘要】仓库鼠患监测面临夜间识别率低(51%)、小目标漏检(<60%)和误报率高(23%)三大痛点。陌讯算法创新采用多模态融合+动态注意力架构:1)跨光谱特征融合提升夜间mAP至79%;2)小目标增强网络使10-15cm鼠类检出率达89%;3)动态背景抑制降低误报至6.7%。某食品仓实测显示,部署后识别准确率92.3%,月均损失减少8.6万元。相比开源方案,陌讯算法综合性能提升15%-35%
opencv--摄像头OCR(光学字符识别)
陈梦丹,女,西安工程大学电子信息学院,2022级研究生研究方向:机器视觉与人工智能电子邮件:1169738496@qq.comYOLOv5是一种单阶段、有监督目标检测算法,该算法在YOLOv4的基础上添加了一些新的改进思路,使其速度与精度都得到了极大的性能提升。主要的改进思路输入端:在模型训练阶段,提出了一些改进思路,主要包括Mosaic数据增强、自适应锚框计算、自适应图片缩放;基准网络Focus
[mmdetection] 如何在训练中断后,接着上次训练?最近由于不知名原因,在用 faster rcnn 训练一个大型数据集的时候,在epoch= 20 的时候中断训练了.采用以下方式继续上次训练.打开 train.py,如图:也就是说,训练时,最后加一个–resume from 参数,然后后面跟上次训练生成的最后一个权重文件(.pth)就可以了.因此,在命令行输入以下语句进行训练即可以完全相
在当今快速发展的科技领域中,人工智能(AI)和物联网(IoT)成为了关注的焦点。什么是物联网呢?通俗来讲,物联网是指通过各种技术和设备将物体与互联网连接起来,使它们能够实时采集数据、互相通信和交换信息。通过物联网,我们可以远程监控和管理各种物体,实现智能化的感知、识别和控制。物联网的目标是实现物体之间的无缝连接和智能化交互,为人们的生活和工作带来更多的便利和效率提升随着AI和物联网的结合愈加深入,
自动驾驶时代是指人工智能和相关技术在汽车行业中广泛应用,使得汽车能够在不需要人类干预的情况下自主进行驾驶操作的车辆新时代。在自动驾驶时代,车辆配备了感知、决策和控制系统,利用传感器、摄像头、雷达、激光等设备来获取周围环境信息,并通过人工智能算法进行实时分析和处理。这些车辆可以自动完成转弯、加减速、避开障碍物等操作,以及规划最优的路线和行驶策略自动驾驶时代的目标是提高交通安全性效率和便利性。自动驾驶
彩色图像中的每个像素颜色由R、G、B三个分量来决定,而每个分量的取值范围都在0-255之间,这样对计算机来说,彩色图像的一个像素点就会有256*256*256=16777216种颜色的变化范围!在下图的路径中,我们可以看到需要xml文件,这些都是OpenCV中自带的分类器,根据文件名我们可以看到有识别眼睛的,身体的,脸的,等等。彩色图片的信息含量过大,而进行图片识别时,其实只需要使用灰度图像里的信
Precision: 描述的是找对的概率Recall: 描述的是找全的概率一般来说,准确率和找回率不能同时兼顾,一个高另一个就相对变低。改变阈值(IOU大于一定的阈值,就被判为正样本),可以得到不同的precision和recall, 然后做出presion - recall 的图(一般叫做PR图)去上限求出与x轴围成的阴影的面积就是AP的值。如上图就是长方形A1,A2,A3,A4的面积之和。对每
计算机视觉 行为检测 视频理解1. 背景2. 国内外研究现状3. 行为分类3.1 研究难点3.2 数据集介绍3.3 传统方法3.3.1 密集采样特征点3.3.2 轨迹与轨迹描述子3.3.3 运动描述子3.4 TWO STREAM方法3.4.1 TWO-STREAM CNN3.4.2 TSN3.5 C3D方法3.6 RNN方法3.6.1 网络结构3....
使用Mediapipe参考资料21 hand landmarks水平镜像处理import cvzoneimport cv2import numpy as npfrom cvzone.HandTrackingModule import HandDetectorcap = cv2.VideoCapture(0)# 0代表自己电脑的摄像头cap.set(3, 1280)# 宽cap.set(4, 720
本文从True Positive, False Positive和False Negative的定义出发,讲解了Precision和Recall的定义,如何绘制P-R(Precision Recall)曲线,如何进一步计算得出AP。本文提供了手动计算所有指标的过程以及用sklearn计算这些指标的代码以及P-R curve的示意图。通过阅读本文你可以从源头开始了解mAP这一指标是如何计算的。