登录社区云,与社区用户共同成长
邀请您加入社区
因为要做机械臂抓取相关的课题,了解到GRASPNet这个来自上交大佬课题组的开源项目,打算配置环境复现一下,中间在安装NVIDIA显卡驱动和cuda过程中遇到不少问题,所以写个帖子记录以下。大家配置环境前,也需要了解自己要跑的项目所需的pytorch版本。
Arcface 虹软人脸识别系统多网卡激活后出现102405错误解决方法
https://elinux.org/Jetson_Zoo#ONNX_Runtimehttps://onnxruntime.ai/getting-started
从MATLAB仿真到C++部署:实现CBF/MVDR/MUSIC与深度学习(ONNX)测向(初学)
LabVIEW搞视觉项目总被人说是"小儿科",但这次咱用YOLOv5+ONNXRuntime整了个活——视频/图像目标检测框架,CPU/GPU随意切换,x86/x64通吃,还能多个模型同时开跑。labview yolov5目标检测onnxruntime推理,封装dll,labview调用dll,支持同时加载多个模型并行推理,可cpu/gpu, x86/x64位,识别视频和图片,cpu和gpu可选,
本次项目使用YOLO11对目标进行检测,具体实现了模型加载、图像加载、ONNX Runtime环境初始化、图像预处理和后处理、检测框的绘制、图像显示等功能。代码注释详细。
模型优化充分使用TensorRT的FP16/INT8量化实现动态形状支持优化预处理/后处理流水线内存管理严谨使用智能指针管理TensorRT对象实现GPU内存池避免内存泄漏和碎片化错误处理完善检查所有CUDA API返回值实现异常安全设计提供详细的日志信息。
OpenVINO(Open Visual Inference and Neural Network Optimization)是英特尔开发的一款用于优化和部署深度学习模型的工具套件,能够显著提升模型在英特尔硬件上的推理性能。转换完成后,使用CMake编译项目,并配置好项目的包含目录和库目录,确保能够正确链接到OpenVINO和OpenCV的库。示例程序会加载转换后的IR模型,并对输入的图像进行目标
摘要:在VS中编写CUDA代码时,调用核函数"<<<>>>"会提示E0029错误但能正常编译运行。这是由于VS的C++语法检查不识别CUDA语法所致,实际不影响程序功能。文中示例代码展示了这一现象,建议忽略该错误提示。目前未发现由此引发的实际问题,表明这种语法差异不会影响CUDA程序的正常执行。
windows C++ VS2019配置openvino Archives 调用intel cpu或者intel 集成显卡
代码语言:javascript。代码语言:javascript。
摘要: 题目描述了一个关于数据核心矩阵运算力的问题。给定一个n×m的矩阵,每个元素代表数据块的强度(可能为负)。要求处理Q次查询,每次给出左上角坐标(x,y),找出以该点为左上角的子矩阵中运算力(元素和)的最大值。使用二维前缀和预处理数据,对每个查询遍历可能的子矩阵求解最大值。C++实现中采用了前缀和优化计算,并通过哈希表存储已计算的结果以提高效率。数据范围较大(n×m≤1e5),需要注意算法的时
随着人工智能模型规模持续膨胀,单设备算力和内存已难以满足大模型(如LLaMA、Stable Diffusion)的推理需求。如何高效利用多AI加速单元(如多芯片、多卡)协同完成同一任务,成为提升吞吐与降低延迟的关键路径。CANN(Compute Architecture for Neural Networks)不仅支持单设备极致优化,还提供了完整的多设备协同计算框架,涵盖设备管理、任务切分、通信调
Hercy 想要为购买第一辆车存钱。他 每天 都往力扣银行里存钱。最开始,他在周一的时候存入 1块钱。从周二到周日,他每天都比前一天多存入 1块钱。在接下来每一个周一,他都会比 前一个周一 多存入 1块钱。给你n,请你返回在第 n天结束的时候他在力扣银行总共存了多少块钱。示例 1:输入:n = 4输出:10解释:第 4 天后,总额为 1 + 2 + 3 + 4 = 10 。示例 2:输入:n =
原题题目代码实现(首刷自解)class Solution {public:int totalMoney(int n) {int count = 0,ret = 0,start = 1;int pre = 21;while(count < n){int temp = (n-count <= 7 ? n-count : 7);count += temp;
CUDA是英伟达开发的一种并行计算平台和编程模型,使用它可以让编程人员非常方便地利用GPU强大的算力。支持CUDA的GPU有数百个内核,可以同时运行数千个计算线程,这些内核拥有共享的资源,包括寄存器文件和共享内存,片上共享内存允许在这些内核上运行的并行任务共享数据而无需通过系统内存总线发送数据。
在 AI 异构计算场景中,跨架构设备互联的低效性、通信范式与多场景的适配难题,以及传统通信库在高并发、大带宽场景下的性能瓶颈,一直是制约训练与推理效率的核心痛点。本次大会共设立现代 C++ 最佳实践、架构与设计演化、软件质量建设、安全与可靠、研发效能、大模型驱动的软件开发、AI 算力与优化、异构计算、高性能与低时延、并发与并行、系统级软件、嵌入式系统十二大主题,全面覆盖从语言标准到工程落地、从算法
摘要: SIMD(单指令多数据)通过单条指令并行处理多个数据(如8个float),显著提升数据密集型任务(如图像处理、数值计算)的性能。以AVX指令集为例,向量化代码(如浮点加法)相比传统循环可提速6倍(1亿次计算从120ms降至20ms)。关键点包括:使用编译器Intrinsics(如_mm256_add_ps)、确保数据32字节对齐、处理剩余元素。典型场景中,图像亮度调整(600万像素)耗时从
Prefer 5 years above,算法能力、coding能力、设计、解决问题等各方面都要比较强,HC很多,只看同行(优先北京,量化公司的高级c++同行才可以base上海)。高频方向(必须要模板编程写得多),senior-staff,做底层优化,C++要精通,必须一线coding(不大量自己写代码的不看),看有高频交易经验的同行,HC多。算力集群相关的能力全面一些,做过k8s开发和运维,底层
我们在通常处理a^b问题中,一般来说第一时间想到的就是通过循环来暴力解决,但是这样的话时间复杂度就是o(n)。c++代码一秒的算力大概是1e7–1e8之间,倘若数据较大,题目就会超时导致TLE。因此,我们在这里介绍一下快速幂的算法。题目引入AcWing a^b求 a 的 b 次方对 p 取模的值。输入格式三个整数 a,b,p ,在同一行用空格隔开。输出格式输出一个整数,表示a^b mod p的值。
摘要: 《Arduino 手册(思路与案例)》栏目提供丰富的电子制作与智能控制内容,涵盖Arduino BLDC、IoT、PID控制等多项技术,并包含近4000篇案例博客。重点介绍的ESP32 DeepSeek 智能安防监控系统采用边缘-云端协同架构,结合AI模型实现多模态分析,支持家庭、商业及工业场景,具备低功耗、高可靠性及隐私保护特性。系统通过轻量化模型优化(如YOLOv5s-ESP32)和动
因为当赛道从「制程竞赛」转向「系统优化」,拥有最复杂「路况」(应用场景)、最多「探路者」(人才)和最持续「修路投入」(战略资源)的体系,自然会在定义「新路怎么修」上拥有更大的话语权。但如果未来的主流计算模式不再是单一的矩阵乘法,而是更稀疏、更动态、更接近生物神经元的计算,那么围绕旧范式建立的生态,其价值就会被急剧稀释。· 结果:英伟达的「存量经验」在AI的「探索能力」面前,相对价值下降。结论:当游
题目大意:n台计算机,第i台计算机的运算能力为vi。任务分配:第i个任务在ai时刻分配,指定计算机编号为bi,耗时为ci ,算力消耗为di。如果此任务成功分配,将立刻开始运行,期间持续占用bi号计算机di的算力,持续ci秒。对于每次任务分配,如果计算机剩余的运算能力不足则输出−1,并取消这次分配,否则输出分配完这个任务后这台计算机的剩余运算能力。输入样例:2 65 51 1 5 32 2 2 63
在处理大规模实体时,将“对象的数组”(Array of Structures)转换为“数组的结构”(Structure of Arrays)是性能优化的黄金法则。在这个软件定义一切的时代,掌握这些深度特性的开发者,才是真正握有“计算火种”的人。C++20 引入的 Concepts(概念)不仅仅是模板的语法糖,它是一场关于“如何定义接口”的革命,解决了泛型编程中多年来的痛点。在面向对象设计中,动态多
本次大会共设立现代C++ 最佳实践、架构与设计演化、软件质量建设、安全与可靠、研发效能、大模型驱动的软件开发、AI算力与优化、异构计算、高性能与低时延、并发与并行、系统级软件、嵌入式系统十二大主题,共同构建了一个全面而立体的知识体系,确保每一位参会者——无论是语言爱好者、系统架构师、性能优化工程师,还是技术管理者——都能在这里找到自己的坐标,收获深刻的洞见与启发。此后,C++ 沿着时代的脉络慢慢向
最引人注目的是平台与国家超算的深度融合 —— 当 "神威・太湖之光" 超级计算机接入量子加速模块后,在材料科学计算中实现了 "双算力引擎" 协同:传统算力处理经典数据矩阵,量子算力专攻量子态叠加问题,两者通过自主研发的 "乾坤" 接口实现数据无缝流转,使石墨烯超导特性模拟效率提升 150 倍。站在 2025 年的时间节点,量子计算的实用化进程呈现出鲜明的 "双螺旋" 特征:技术创新与产业应用相互缠
《软硬协同渲染机制突破微多边形渲染瓶颈》摘要:本文揭示了传统GPU硬件光栅化在处理微多边形(投影面积<1像素)时存在的Quad Overdraw性能陷阱(75%算力浪费),并提出革命性的软硬协同渲染解决方案。该方案通过计算着色器实现软件光栅化,结合Visibility Buffer架构,实现像素级精准写入;同时采用动态路由机制,根据三角形屏幕面积智能分配渲染路径(大三角形走硬件光栅化,微多边
AI 大模型时代,当所有人都在讨论 Python 如何提高生产力的时候,真正懂底层算力的人都明白:在 GPU、NPU、TPU 的指令流水里奔涌的,是 C++ 将算子、内存与调度精确压进每一个周期的力量。Michael Wong 的演讲——《AI 计算之战:如何在大模型时代建立有竞争力的标准化 C++ 技术栈》值得所有技术人关注,因为我们正处在一个算力通胀与生态割裂并存的时代。全球顶尖技术领袖齐聚,