芯展速AI90亮相WAIC 2026,破解大模型算力内存墙瓶颈

7月18日,全栈自研存储厂商芯展速在世界人工智能大会上宣布推出AI 90-FaaS for AI训推一体化加速方案,以释放消费级GPU算力潜力化解行业普遍存在的“内存墙”痛点。 

据芯展速FAE leader杨泽宏介绍,AI90采用软硬件分层协同架构,其中软件层由智能P2P互联驱动、FaaS智能KV Cache调度算法两大模块组成,分别负责打通多卡通信通道、动态缓存调度;硬件层以自研PT200Z AI SSD为核心扩展存储,可搭配配套Redriver芯片优化链路信号。二者深度联动,一方面打通消费级显卡多卡并行通路,另一方面依托TB级虚拟显存承载超长上下文缓存,以亲民硬件组合实现对标高端数据中心集群的训推性能,将有力推动算力普惠、算力平权,大幅降低中小企业与专业开发者本地大模型落地成本。

《芯展速AI90亮相WAIC 2026,破解大模型算力内存墙瓶颈》

标准GPU硬件,本质是多方约束下的商业妥协

AI90的诞生,源于行业普遍的认知误区——“顶级数据中心GPU可彻底解决大模型算力瓶颈” 和被默许了很久的“结构性妥协”。

从工程底层追溯根源,二十年间GPU算力实现六万倍指数级增长,但显存容量仅提升十余倍,显存带宽增幅不足三十倍,算力与存储性能形成三个数量级的巨大落差,“内存墙”由此产生。芯片制造层面,HBM、GDDR存储单元在芯片上占用面积远大于逻辑计算单元,大规模集成高容量显存显著拉低良率、抬升成本,因此GPU搭配的存储始终无法满足实际需求。

在前期调研中芯展速发现一个令人意外的数据:无论是消费级的RTX 5090,还是企业级的A100、H200,乃至英伟达最新旗舰B300,它们在真实AI任务中的算力利用率普遍只有40%,最高也不过65%,导致大量算力因等待数据闲置。单纯堆砌高端GPU不仅采购成本指数级上涨,加速硬件供货的紧缺性。

因此,在芯展速高级FAE总监杨泽宏看来,无论消费级还是旗舰数据中心GPU,出厂标准配置均是厂商在成本、功耗、芯片良率、市场定位之间权衡后的商业妥协,算力利用率偏低是先天缺陷。

自研技术闭环,系统性打破AI计算内存桎梏

杨泽宏在接受媒体采访时表示,面对算力与存储失衡这个全行业共性难题,芯展速另辟蹊径,创新性地构建五层自研技术体系,从多卡通信、缓存调度、存储介质、框架适配、分层存储架构同步优化,全方位消解内存墙瓶颈。

1. 智能P2P互联,解锁消费显卡原生多卡直连能力

消费级显卡出厂未开放NVLink卡间直连通道,传统多卡数据交互须经过CPU、内存中转,传输延迟是直连模式的十倍以上。芯展速依靠驱动层纯软件优化实现智能P2P互联,无需改写显卡BIOS、不影响硬件原厂质保,重新定向卡间数据传输链路,绕开CPU冗余中转路径。

优化后卡间通信延迟由十微秒压缩至百纳秒至一微秒区间,八卡RTX5090并行环境下,综合算力达到单卡性能的5.8倍,近乎线性增长,集群并行效率大幅提升。当前方案已完整适配英伟达3090/4090/5090系列,同步完成AMD 7900系列验证;拓展算力卡无需重构底层架构,仅需调试PCIe通道分配驱动,单卡独占PCIe 16通道即可释放全部加速性能。

2. FaaS智能KV Cache调度,显存利用率提升2至3倍

传统推理方案采用静态显存预留机制,无论实时token 负载高低均固定划分缓存空间,显存利用率常年不足40%;显存满载时系统会直接丢弃KV缓存,重复计算带来巨大性能损耗。芯展速自研FaaS调度算法,搭建独立数据传输通道,隔绝操作系统内存回收机制对GPU缓存的干扰。

系统对KV Cache分层管理,高频访问缓存留存GPU本地显存,低频、长上下文缓存自动卸载至TB级AI SSD,叠加内存碎片整理、多用户缓存共享机制,动态按需分配显存资源,显存利用率稳定提升至85%-95%。实测Llama3 70B模型推理,单租户条件下峰值token吞吐量由120tk/s提升至610tk/s,性能提升5倍,多租户条件下提升更为显著,经测试,可达数十倍;32K上下文首token延迟由12.89秒压缩至0.252秒,响应速度也提升近50倍。

3. PT200Z AI SSD搭载SCM介质,适配高频反复擦写场景

KV Cache存在高频循环读写需求,每日全盘写入次数DWPD仅为1-3的通用TLC/QLC SSD无法支撑7×24小时不间断缓存擦写,芯展速自研的PT200Z AI SSD选用SCM存储级介质,DWPD可达60-100,单盘每日可完整覆写60至100次,保障五年稳定运行无耐久隐患。

介质层面,SCM支持字节级寻址,规避传统闪存4K/8K最小写入块带来的写放大损耗,读延迟仅45微秒,较通用SSD降低50%,随机写IOPS接近百万级,完美匹配KV缓存读写特征。配套Redriver芯片可优化PCIe高速传输信号衰减,整套软硬件组合部署后,系统综合性能可再提升30%。杨泽宏表示,SCM单TB硬件采购成本高于普通闪存,但超高耐久度提升了整体写入寿命,并大幅降低长期更换成本,综合使用收益具备十倍级优势。

4. 全主流推理框架原生兼容,开箱即用无需改代码

AI90底层完成vLLM、TensorRT-LLM等主流推理框架适配,软件层在驱动与硬件间搭建统一调度接口,完全兼容框架原生运行逻辑。企业部署现有推理业务时,无需修改模型代码、调整调度逻辑,仅安装配套驱动即可完成加速落地。针对视觉、视频多模态推理,FaaS调度算法可拓展适配图像帧缓存卸载,底层逻辑与KV Cache调度同源,拓展空间充足,同时兼顾模型微调、全量训练等训练场景需求。

5. FaaS三级分层存储,构建TB级虚拟显存池

整套FaaS架构搭建三级存储分层体系:GPU本地显存高速缓存、CPU内存中转缓冲区、AI SSD大容量扩展显存,三层资源统一编址、系统自动调度。GPU本地显存占满时,缓存数据自动下发至AI SSD,147GB/s读取带宽使得获取KV Cache的时延远优于重复计算历史token的耗时。单台4卡5090工作站可搭配两块1.6TB AI SSD,搭建3.21.6TB以上虚拟显存池,原生仅支持8K上下文的消费显卡,可稳定承载128K超长文本输入,单条上下文等效20万字中文文档,同步支撑多用户并发推理。

覆盖多元产业,打造轻量化本地AI生产力底座

AI90并非单纯面向个人开发者,其核心落地市场聚焦中小企业、行业机构、科研院校,轻量化集群部署模式适配多类细分产业场景,落地门槛远低于云厂商大型集群方案。其应用场景非常丰富。 

一是企业私有数据本地化微调。制造、金融、能源、医疗企业拥有大量行业专属数据,受合规与数据安全约束无法上公有云,搭载AI90的工作站可完成本地LoRA微调,快速搭建行业垂类大模型,无需采购多台高端服务器。

二是企业知识库与智能客服场景。企业可将产品手册、内部培训资料等海量长文本存入本地系统,128K超长上下文能力完整读取全套资料,同时并发服务内部员工与外部客户,削减人力成本。

三是工业视觉质检、多模态数据分析。工厂视频、图像检测任务存在海量缓存需求,FaaS缓存卸载技术可持续承载图像帧存储,支撑全天候不间断推理检测。

四是高校AI科研教学。借助AI90改造,高校存量的4090/5090显卡可低成本搭建实训平台,满足大模型实验、课程教学需求,大幅压缩科研算力预算。

五是AI初创商用推理服务。小型团队依靠单台8卡工作站搭建推理API服务,token产出提升五倍,单设备可同时服务十余名并发用户,缩短硬件回本周期。

六是专业创作者本地私人AI助理。文案、程序员、设计师可搭建本地AI工具,超长上下文支持长文档创作、代码解析,数据全程本地存储,安全有保障。

产业展望:依托自研积淀,持续推进算力普惠落地

芯展速是国内少数能够自主覆盖企业级SSD、Redriver信号芯片、嵌入式存储研发的厂商,依托完整自研存储与信号完整性产品矩阵,打造面向本地化边缘AI的成套解决方案。虽然公司成立时间不长,但核心成员均为存储、芯片行业资深从业者,拥有希捷、西数等头部存储企业研发落地经验,具备存储介质自研、固件开发、AI系统调优全链条能力,构建起差异化竞争壁垒。

《芯展速AI90亮相WAIC 2026,破解大模型算力内存墙瓶颈》

产品布局上,AI90主打边缘中小企业市场,企业同步规划多条产品线:面向个人PC的轻量化AI30方案、适配超大规模数据中心的高端系列产品;同时推进国产算力卡、AMD显卡生态适配,联合整机、主板厂商搭建产业合作生态,持续迭代调度算法,拓展多模态场景专属优化。

芯展速坚信算力不应该是一种特权。我们的使命,是让每一个开发者和每一家企业,都能用负担得起的成本,获得强大的AI算力——让算力平权,真正释放每一个人的创造力,赋能千行百业轻量化智能化转型。

点赞

发表评论

邮箱地址不会被公开。 必填项已用*标注