登录社区云,与社区用户共同成长
邀请您加入社区
24年10月清华大学的论文"RDT-1B: A Diffusion Foundation Model for Bimanual Manipulation"。双手操作在机器人技术中至关重要,但由于协调两个机械臂(导致多模态动作分布)的固有复杂性以及训练数据的稀缺性,开发基础模型极具挑战性。本文提出机器人扩散Transformer(RDT),一种用于双手操作的开创性扩散基础模型。RDT 以扩散模型为基
RCNN,SSD, YOLO的优缺点比较及反思1. RCNNFast-RCNNFaster-RCNNFaster-RCNN 系列的反思2. YOLOYOLO V1YOLO V2YOLO V3YOLO系列的反思3. SSD1. RCNNrcnn对于原有的目标检测算法提升50% 在VGG-16网络模型下,voc2007数据集上准确率为66%,但是速度很慢,内存占用量大,主要原因为候选框由速度较慢的..
1.在终端执行程序时指定GPU CUDA_VISIBLE_DEVICES=0 python your_file.py # 指定GPU集群中第一块GPU使用,其他的屏蔽掉CUDA_VISIBLE_DEVICES=1 Only device 1 will be seenCUDA_VISIBLE_DEVICES=0,1 Devices 0 an...
当你配置好CUDA、cuDNN、tensorflow,并且确保这三者之间的版本对应一致之后,你满怀希望的在终端中输入:In[1] import tensorflow as tfIn[2] tf.test.is_gpu_available()结果生活给了你当头一棒:Out[2]: False这个时候,不要惊慌,先想一想我上面说的CUDA、cuDNN和tensorflow的版本有没有对应一致...
在目标检测和分割的任务中,我们都喜欢用多尺度 特征融合操作来提高准确率。以语义分割为例,大家在看到U-Net 以后想到的第一个自认为的创新就是加上 ASPP 结构。加上一个特征金字塔结构。然后做实验发现整个效果还是不错的。其实这个特征金字塔的结构就是一个多尺度特征融合的例子。在这里也可以证明了多尺度特征融合在深度学习中的好处。那为什么多尺度融合有效果呢。我们知道现在的检测和分割网络基本都喜欢用卷积
本项目基于MATLAB实现了一种结合时间向量嵌入(T2V)和Transformer编码器的多变量时间序列预测方法。该模型通过T2V模块将时间信息编码为连续向量,捕捉时间动态特征,再利用Transformer的自注意力机制建模多变量间的复杂依赖关系。项目包含完整的数据预处理、模型构建、训练评估流程,并提供了可视化GUI界面。实验结果表明,该方法在智能制造、金融预测等领域具有较高精度和泛化能力,为时间
毕业设计:基于机器学习的蔬菜生长状态检测方法利用机器学习技术,通过图像处理和分析,实现对蔬菜生长状态的自动化监测。首先,通过采集不同生长阶段蔬菜的图像数据,构建多样化的数据集,并对数据进行预处理和标注。涵盖了深度学习、机器学习、算法、人工智能、大数据、信息安全、推荐系统、目标检测等多个热门领域。对于计算机专业、软件工程专业、人工智能专业、大数据专业的毕业生而言,毕业设计选题至关重要。对深度学习技术
(MInimizing cross-entropy)等价于最大化可能性(maximizing likelihood);)来进行表示:解决了某些class关系密切(在树值上),而另一些关系疏远;即使没有临界点(critical point),神经网络的训练也十分困难。通常人们认为训练卡住了是因为参数更新到一个临界值,梯度太小不更新了;:如class1对应数字“1”,class2对应数字“2”……MS
利用显著性作为伪像素监督的弱监督和半监督语义分割#
- **🍨 本文为[]中的学习记录博客**>- **🍖 原作者:[]**● 难度:夯实基础● 语言:Python3、TensorFlow2🍺 要求:1. 使用categorical_crossentropy(多分类的对数损失函数)完成本次选题2. 探究不同损失函数的使用场景与代码实现🍻 拔高(可选):1. 自己搭建VGG-16网络框架2. 调用官方的VGG-16网络框架3. 使用VGG-1
本项目提出了一种基于麻雀搜索算法(SSA)优化的卷积神经网络(CNN)结合格拉姆角场(GAF)和最小二乘支持向量机(LSSVM)的混合故障诊断模型。该模型通过GAF将一维时序信号转换为二维图像,利用CNN提取深度特征,再由LSSVM进行分类预测,并通过SSA算法自动优化模型参数。实验结果表明,该混合模型在机械设备故障诊断任务中表现出较高的准确率和鲁棒性。项目构建了完整的MATLAB实现框架,包括数
OVA-DETR是一种用于航空目标检测的高效率开放词汇检测器,它利用图像-文本对齐和融合技术。具体来说,为了打破传统检测器中预定义类别的限制,将类别语义整合到检测器中,并构建了一个区域-文本对比损失,以对齐图像和文本特征。进一步引入了一种双向视觉-语言融合方法,包括双注意力融合编码器和多级文本引导融合解码器,它们共同构成了一个文本引导的编码器-解码器结构。双注意力融合编码器旨在增强前景特征提取,而
第13章介绍了如何将深度学习模型从实验室环境过渡到实际应用中,达到最佳性能。本章涵盖了超参数优化、模型集成、混合精度训练、多GPU和TPU训练等技术,帮助读者从机器学习学生过渡到专业的机器学习工程师。
根据“编码器-解码器”架构的设计, 我们可以使用两个循环神经网络来设计一个序列到序列学习的模型。在实现编码器和解码器时,我们可以使用多层(GRU)循环神经网络。
基于YOLOv8模型PCB电子线路板缺陷目标检测系统可用于日常生活中检测与定位PCB线路板瑕疵,利用深度学习算法可实现图片、视频、摄像头等方式的目标检测,另外本系统还支持图片、视频等格式的结果可视化与结果导出
继RCNN,fast RCNN之后,目标检测界的领军人物Ross Girshick在2015年提出faster RCNN。目标检测速度达到15fps。
摘要:本项目提出一种基于GXO淘金优化算法优化的CNN-BiLSTM-Attention混合模型,用于多变量时间序列预测。通过模拟金矿开采过程设计全局优化算法,结合卷积神经网络提取局部特征、双向LSTM捕获长时依赖关系,并引入注意力机制聚焦关键信息。实验表明该方法在预测精度、计算效率和模型可解释性方面具有优势。系统采用模块化设计,包含数据预处理、模型训练、实时推理和可视化界面等功能模块,支持GPU
本章节包含在上一章中,学习了多头注意力机制并对其进行了编码,它是LLMs的核心组件之一。在本章中,将编写 LLM 的其他构建块,并将它们组装成类似 GPT 的模型。
BERT,全称 Bidirectional Encoder Representations from Transformers,是 Google 于 2018 年提出的一种预训练语言模型。它的核心思想是使用Transformer 编码器结构,通过双向上下文建模学习文本的语义表示。传统的语言模型往往是单向的,比如左到右(GPT)或右到左(ELMo),因此在预测一个词时只能看到部分上下文。
大型语言模型横行,之前非常焦虑,现在全面拥抱。目前也有很多开源项目进行大模型微调等,笔者也做了一阵子大模型了,特此来介绍一下ChatGLM-6B模型微调经验,并汇总了一下目前开源项目&数据。笔者与很多人微调结论不同,本人在采用单指令上进行模型微调,发现模型微调之后,
本文设计实现了一套基于深度学习的人脸识别课堂签到系统。系统采用PyQt5构建前端界面,结合face_recognition库实现核心识别功能,通过128维特征向量完成学生身份验证。主要功能包括:学生信息管理模块支持数据批量导入导出,课堂签到模块利用摄像头实时捕捉人脸并记录考勤,后台采用SQLite数据库存储人脸特征及签到记录。系统实现了多线程处理机制保障界面流畅性,教师端可查看签到统计报表。该解决
CNN是深度学习的里程碑式成果,专门针对图像处理优化。其核心架构包含卷积层(提取局部特征)、池化层(降维增强鲁棒性)和全连接层(输出预测)。相比全连接网络,CNN通过局部连接和权值共享显著减少参数量(降90%+),提升训练效率(快5-10倍)和准确率(提升30%+)。主要应用包括图像分类、目标检测和分割。CNN还衍生出膨胀卷积、空间/深度可分离卷积等变体,在保持精度的同时进一步优化计算效率。其出色
本文主要介绍了循环神经网络及其变体门控循环单元,并在简单的数据集上实现了GRU模型。与其他的神经网络结构相比,RNN充分利用了数据中的序列特性,将中间向量按时间步不断向后传播,从而具有捕捉序列型关联的能力。
这些边缘设备可以是物联网传感器、智能网关、边缘服务器等,它们能够对本地生成的数据进行实时处理和分析,仅将必要的数据上传到云端,从而减少数据传输量和延迟。同时,构建一个开放的边缘计算平台,吸引更多的开发者和企业参与,共同推动边缘计算技术的发展。例如,通过在患者佩戴的医疗设备上部署边缘计算模块,实时监测患者的生命体征数据,并在发现异常时立即通知医护人员,为患者提供及时的医疗救助。边缘计算通过在本地处理
本文档详细介绍了使用 PyTorch 框架搭建一个简单的手写数字识别系统的全过程。从环境准备到模型训练与测试,每一步都包含详细的代码示例和操作指南。该系统利用卷积神经网络(CNN)处理 MNIST 数据集,旨在为初学者提供一个易于理解且可操作的项目案例。
本文采用YOLOv8作为核心算法框架,结合PyQt5构建用户界面,使用Python3进行开发。YOLOv8以其高效的实时检测能力,在多个目标检测任务中展现出卓越性能。本研究针对行人目标数据集进行训练和优化,该数据集包含丰富的行人目标图像样本,为模型的准确性和泛化能力提供了有力保障。通过深度学习技术,模型能够自动提取行人目标的特征并进行分类识别。PyQt5界面设计简洁直观,便于用户操作和实时查看检测
25年8月来自Galaxea 的技术报告论文“Galaxea Open-World Dataset and G0 Dual-System VLA Model”。Galaxea 开放-世界数据集,是一个在真实的人类生活和工作环境中记录的大规模、多样化的机器人行为集合。所有演示均使用一致的机器人具身而收集,并搭配精确的子任务级语言注释,以方便训练和评估。在此数据集的基础上,推出 G0,这是一个双-系统
人工智能与大数据专业毕业设计(论文)选题指导 选题合集涵盖了深度学习、机器学习、算法、人工智能、大数据、信息安全、推荐系统、目标检测等多个热门领域。对于计算机专业、软件工程专业、人工智能专业、大数据专业的毕业生而言,选择一个合适的毕业设计选题至关重要。在这个毕业设计选题合集中,我们精心收集了各种有趣且具有挑战性的选题,旨在帮助学生们在毕业设计中展现他们的技术实力和创新能力。不论是对于对深度学习技术
为深度学习神经网路的图像数据集配置标签,使用labelimg/makesence为图像数据集做标注