从算力孤岛到智能底座:GPUStack赋能葛洲坝集团AI工程化实践

 从2024年的一问一答,到2025年的多步推理与工具调用,再到2026年面对“帮我分析这3000页合同”一类的复杂业务需求,AI正从“对话工具”加速迈向“生产力底座”。在2026年GPUStack AI Infra生态与技术创新大会上,葛洲坝集团股份有限公司AI算法工程师架构师聂雄伟在题为“GPUStack赋能企业AI工程化与算力管控实践”的演讲中认为,企业对AI的要求已从“能不能聊”转变为“能不能干活、干多快、干多少”。这一变迁,对企业的AI基础设施建设提出了全新的、更高的要求。

《从算力孤岛到智能底座:GPUStack赋能葛洲坝集团AI工程化实践》

在这一趋势之下,葛洲坝集团作为大型传统制造业企业,其AI基建面临四重挑战。据聂雄伟介绍,首先是算力孤岛问题:集团与子公司各自建设算力,资源分散,重复部署,算力难以共享互通;其次是异构算力难题:多型号显卡硬件混合部署,跨硬件统一调度困难;第三是多样模型的管理压力:基座大模型、轻量化小模型、多态模型并存,运维适配复杂;第四是海量文档解析需求:作为传统制造业企业,葛洲坝集团拥有大量长篇幅工程文档、合同等非结构化文本,如何高效、高并发地解析这些PDF文件,成为制约AI应用落地的关键瓶颈。

开源破局:GPUStack的引入与算力回收策略

面对上述挑战,葛洲坝集团最初尝试自行编写逻辑来解决问题,但效果有限。后来在GitHub上发现了GPUStack这一开源项目,最终决定选择开源方案——将算力和模型收进一个平台,实现统一管理。聂雄伟表示,他非常喜欢GPUStack首页的一张示意图:左侧是异构算力,通过GPUStack平台,转化为右侧的模型服务和Token输出。

“这一图景正是我们的所需。”聂雄伟说。

在具体实践中,葛洲坝集团首先推进了集团统一托管算力的工作。第一步是回收纳管:将子公司闲置的GPU机器统一接入集团,网络打通,物理机无需搬迁,远程接入集团大资源池;第二步是模型共享:集团与子公司的模型实现负载均衡,一套模型服务全集团,各子公司通过API共享调用;第三步是配额替代占机器:不再将GPU机器直接分配给子公司,而是分配Token和GPU时长配额,避免算力浪费,最终目标是实现统一接入、统一服务、统一配额、统一运营。

《从算力孤岛到智能底座:GPUStack赋能葛洲坝集团AI工程化实践》

葛洲坝集团股份有限公司AI算法工程师架构师聂雄伟

然而,在推进过程中,项目团队发现子公司的托管动力并不强。为此,他们设计了激励机制:子公司出少量算力,即可共享集团算力池中的多样模型生态;同时,统一托管运维减轻了子公司的运维负担;此外,集团还提供了算力权益激励——将子公司提供的算力卡折算成GPU卡时和Token配额,根据工作时间进行峰谷差异计算,超出配额的部分则进行差异化计价。

异构算力管理与文档解析服务集成

在解决异构算力管理方面,葛洲坝集团借助GPUStack的容器化能力,构建了分层架构。业务请求层通过模型网关接收外部请求,调度控制层依据资源需求进行路由分发,Docker容器隔离层运行独立的模型服务,硬件归集层则将不同型号的算力卡归入不同算力池,如通用计算型、高性能计算型、推理优化型等。所有模型走统一网关,业务应用只看到一个接口,极大简化了调用复杂度。

海量文档解析是葛洲坝集团在AI工程化中遇到的一个“不起眼但关键”的问题。集团内部存在大量长篇幅、非结构化的工程文档、合同和扫描件,传统解析方式难以满足高并发、高效率的需求。为此,团队自研了一套文档解析服务,并将其封装成pipeline,挂载到GPUStack的通用代理上。该服务的处理流程包括:从多格式(如PDF、Word、Excel、图片、扫描件等)输入,到API网关统一接入与安全认证,到文件分类与智能路由(根据文件特征选择最优解析策略),到文件分块(大文件切分提高解析效率),到OCR识别(提取图片/扫描件中的文本内容),到文件拼接(整合分块结果,重建完整内容),最终输出标准Markdown文件。

此外,该服务还支持PDF、Word、Markdown三种格式的互相转换。

打通算力平台数据,有效支撑资源调配和成本管控

经过优化,单GPU推理节点每分钟可解析200页文档,3000页的合同数十秒即可完成解析。目前该服务日均调用量超过1万次,稳定支撑集团核心业务场景。

在平台运营层面,葛洲坝集团利用GPUStack平台的接口,将算力相关数据实时推送到业务系统中。他们每3到5秒请求一次接口,实时追踪AI模型的调用次数和Token消耗情况,包括各业务部门、各子公司的消耗明细。这一能力使集团管理层能够直观地观测整个AI基建的运行状态,为资源调配和成本管控提供了数据支撑。

迄今为止,葛洲坝集团AI平台已累计调用接口137万3541次,部署智能体49个,词元累计调用量达134亿3078万4421个,接入模型60个。

相信开源的力量”

聂雄伟特别强调了开源社区的力量,他本人为GPUStack开源社区贡献了三个相关功能,其中两个与文档解析相关——因为OCR解析对葛洲坝集团的业务带来了实实在在的价值。他认为,千问、智谱等开源模型正在为各行各业带来强大赋能,而平台的能力同样需要开源。

他引用了“相信开源的力量”这一理念,指出无论是模型还是平台,开源都在推动AI基础设施的发展,同时,他还呼吁更多开发者加入社区,共同贡献,让开源生态更加繁荣。

葛洲坝集团的实践表明,引入开源项目GPUStack,大型企业集团能够有效解决算力孤岛、异构算力、多样模型管理及海量文档解析等工程化难题,实现从“对话”到“生产力”的AI能力跃升,为集团数字化转型提供了坚实底座。

【关于GPUStack】

GPUStack是一个面向企业级AI场景的开源AI算力与模型服务平台,提供异构GPU/NPU算力管理、算力服务与虚拟化切分、大模型与多模态模型部署推理、可插拔推理引擎统一管理及AI服务化开放能力。平台支持NVIDIA、AMD、华为昇腾、阿里PPU、海光DCU、寒武纪、摩尔线程、沐曦MetaX等多种国内外AI加速硬件,兼容Docker、Kubernetes及公有云GPU环境,实现异构算力资源的统一纳管与弹性调度。

GPUStack支持大语言模型、多模态模型、Embedding、Reranker、图像、语音、OCR等各种类型AI模型的统一部署与服务化管理,原生支持vLLM、SGLang、MindIE等主流推理引擎,并支持通过标准化接口扩展社区推理后端与自定义推理框架。平台具备模型与算力双服务模式、提供分布式推理、GPU虚拟化切分、多实例高可用、模型路由、性能优化、一键压测、权限控制、多租户隔离、计量计费及统一监控等能力,可满足企业在AI模型服务化、GPU资源共享、私有化AI平台建设及AI智算运营等场景下的需求。

点赞

发表评论

邮箱地址不会被公开。 必填项已用*标注