登录社区云,与社区用户共同成长
邀请您加入社区
随着人工智能模型规模的爆炸式增长,单个GPU已无法满足训练和推理的算力与存储需求,需要多个GPU协同工作。这催生了GPU之间高速互连总线技术的发展,以实现“scale-up”(单台服务器内部多GPU互联)和(多台服务器GPU集群互联)的性能扩展。在scale-up场景中,GPU–GPU直接互连总线可绕过传统经过CPU内存的通信路径,大幅提升带宽、降低延迟;在scale-out场景中,则需高速网络将
摘要: 2015至2025年,车载计算平台从分散式ECU(70-100个)发展为中央计算架构(1-3个域控),算力从几百MIPS跃升至2000+ TOPS。中国厂商(华为、比亚迪等)从零起步到全球领跑,推动架构从“模块堆叠”到“端到端统一智能”。2019年后,单/双域平台(NVIDIA Orin、华为MDC)加速集成,2025年中央计算(如比亚迪玄界)实现全车大脑化,成本下沉至10万级车型,渗透率
2025年,我国"东数西算"工程进入规模化落地阶段,大模型应用从"云端试点"转向"本地深耕"。本地化部署面临端口适配难题,包括接口异构性、安全风险、国产硬件适配不足和扩展性受限等问题。纯国产架构算力平台通过标准端口开发技术创新,实现接口归一化、国产硬件深度优化和全链路安全防护三大突破。医疗、制造等行业实践表明,标准端口可显著提升业务效率。
线控底盘技术(2015-2025)实现了从局部电控到全域数字化的革命性跨越。五大子系统(转向、制动、悬架等)全面升级:转向系统进入纯线控时代,制动系统转向干式线控,悬架实现智能预判调节。架构上,从分散控制演进为VMC集成控制,具备微秒级响应和OTA升级能力。2025年的数字底盘实现三轴六自由度融合、滑板底盘模块化及预测性运动控制,中国市场预计突破700亿元。这一演进将底盘从机械传动转变为算力执行中
CTR模型在互联网的搜索、推荐、广告等场景有着广泛的应用。近年来,随着深度神经网络的引入,CTR模型的推理对硬件算力的要求逐渐增加。本文介绍了美团在CTR模型优化的实践。通过分析模型结构特点,结合GPU硬件架构,我们设计了一系列流程对模型进行定制优化,达到了降低延迟、提高吞吐、节省成本的目标。
黑芝麻智能推出两大车规级芯片系列:华山系列专注自动驾驶(A1000系列支持L2+/L3级,A2000系列7nm工艺算力达1000TOPS),武当系列实现跨域融合(C1236单芯片集成NOA域控功能,C1296支持三域集成)。技术亮点包括异构计算架构、自研NPU引擎(能效比>5TOPS/W)、Transformer硬加速及ASIL-D安全认证。通过山海工具链优化算法部署,7nm工艺实现超高性能
GPU 处理if elseSIMT 架构要求线程束内线程同步执行相同指令,而分支语句导致线程束分歧,迫使分支代码序列化执行,导致其组内大量线程被闲置,算力利用率大幅降低。
AI芯片可按架构分为CPU、GPU、FPGA、ASIC,各架构的优缺点可参考以下文章:CPU、GPU、FPGA、ASIC等AI芯片特性及对比_cpu gpu fpga_maopig的博客-CSDN博客最近,新名词 DSA(Domain Specific Architecture,特定领域架构),可参考以下文章:https://mp.weixin.qq.com/s/dw0Btk126Ime6BF3z
吞吐量最大化:通过大容量、多分区、非阻塞设计,以极高的带宽满足所有SM的并发请求,保障计算单元的吞吐量。流量优化与节能:通过强大的请求合并能力,减少对显存的访问次数和流量,提升有效带宽,降低功耗。全局协调与串行化:作为全局内存系统的枢纽,高效、正确地处理原子操作和多SM之间的数据交互。最终,一个成功的L2 Cache设计是让SM“感觉”不到Global Memory的巨大延迟,仿佛在访问一个吞吐量
这一技术突破,不仅解决了异构芯片间的兼容性问题,更通过算力超分、全局缓存、智能预取等先进技术的应用,大幅提升了云平台的性能表现。无论是计算任务的高效执行,还是数据存储与传输的飞速提升,StarVCenter都展现出了卓越的能力,为能源电力行业的高并发、大数据处理需求提供了坚实的支撑。项目不仅要求采用全国产化的基础设施,还强调在单一云平台中实现对多种异构国产芯片的高效纳管,以及分布式架构的灵活部署与
在芯片行业总体下行周期,汽车电子赛道保持相对坚挺,在新品推出和投融资方面都表现出积极的态势。细追背后缘由,是软件定义硬件、算力驱动马力、比特管理瓦特的时代变革下,传统汽车产业链格局受到冲击,汽车电子需求不断扩大所致。
随着大模型产业的发展,AI 训练 & 推理对算力的需求越来越大,AI 的计算也越来越离不开 GPU 的支持。CPU(通用处理器);GPU(通用图形处理器);NPU / TPU(AI 专用处理器)。那么 CPU 和 GPU 有什么区别呢?从硬件设计上来看,GPU 的 DRAM 时延(数据搬运、指令执行的延迟)远高于 CPU,但 GPU 的线程数远高于 CPU(有非常多的线程,为大量大规模任务并行而去
智能算力是由GPU、FPGA、ASIC等AI芯片组成的加速计算平台提供的算力,主要用于人工智能的训练和推理计算,比如图像、视频的处理。2022年,我国人工智能芯片市场规模占比中GPU占比达89%,NPU、ASIC、FPGA占比分别为9.6%、1.0%、0.4%。在处理数据过程中,主要是通过控制器中的指令集对数据进行解码,在通过运算器中的微架构(电路)进行运算得到结果,因此指令集和微架构是。,即中央