9月3日,摩尔线程与趋境科技签署战略合作协议。双方以摩尔线程MTT S5000智算卡与MUSA软件平台为基础,深度融合趋境科技自研国产PD异构技术,将持续推进和扩大基于ATaaS平台的国产化高品质AI Token工厂建设,并共同联合研发和推广以Token Pod(Token 超节点)为载体的联合解决方案。
目前,相关方案已投入生产,并承接头部模型厂商官方业务的真实Token流量。在同等生产服务标准下,该方案兼顾国产算力的生产级性能与单位AI Token成本优势,整体性价比超越国际先进算力方案。这一进展也标志着摩尔线程携手趋境科技,率先推动国产PD异构推理进入生产环境。摩尔线程全功能GPU也成功跑通“从规模化Token生产到真实业务应用”的全流程闭环。

摩尔线程创始人、董事长兼CEO张建中,高级副总裁董龙飞,趋境科技创始人兼CEO艾智远、总裁兼CFO武文洁、首席架构师谢威宇等出席签约仪式。摩尔线程战略销售事业部副总经理费靖然、趋境科技Token事业部总经理刘显赫代表双方签署协议。
国产卡跑出高品质AI Token生产级性能,性价比超越国际先进算力
随着大模型应用进入规模化商业落地阶段,基础设施的竞争正在从单卡性能转向系统级 Token 生产效率。衡量一套方案商业价值的关键,不只是硬件能否运行模型,还要衡量在既定服务目标下,每一枚高品质AI Token的生产成本。
“高品质Token”应同时满足四项生产级标准:时延稳定,在高并发和长上下文场景下仍可保障 SLO;精度可信,避免异构适配和量化带来的结果偏差;高吞吐、高利用率,充分释放单位算力产能;以及成本可控,具备规模化交付的商业可行性。四者共同构成生产级AI Token服务的核心衡量标准。
摩尔线程与趋境科技联合构建了PD分离异构推理架构:由摩尔线程MTT S5000负责Prefill阶段的输入计算与KV Cache生成,与承担Decode阶段Token生成的高带宽GPU协同工作。
在该P/D异构组合中,MTT S5000凭借高密度AI算力、原生FP8精度,以及MUSA完善的软件栈与生态适配能力,支持Prefill从传统推理链路中解耦,构建为可独立供给、独立计费、独立优化的算力资源池。趋境科技则通过依托PD异构推理系统实现KVCache 的跨设备高效流转,最终将不同类型的算力资源整合为统一、稳定的、高性价比的端到端推理服务。
双方联合方案的性价比优势,并不简单来自硬件价格差异,而是源于对Prefill与Decode两个阶段的资源优化。在当前项目同等生产服务标准下,由4至5台MTT S5000组成的Prefill资源池,输入Token处理性价比超越国际先进算力方案。
MTT S5000:Prefill as a Service场景的高性价比算力选择
MTT S5000是摩尔线程推出的通用AI加速卡,其产品特性与Prefill阶段的计算密集特征高度契合。在异构PD分离架构中,S5000承担输入计算和KV Cache生成,将Prefill从推理流程剥离为可独立供给、独立计费、独立优化的算力产品,为超大参数模型长上下文推理提供了可规模化落地的成本优化路径。
这意味着,国产算力的竞争力正在从单卡性能延伸至系统级Token生产效率。通过国产硬件与PD异构技术的深度协同,摩尔线程与趋境科技为万亿参数大模型的规模化推理提供了一条兼顾生产级性能与成本效率的国产算力路径。
从”实验环境验证”走向”规模化生产落地”,真实业务检验方案价值
性价比是否成立,最终仍要由真实业务检验。生产环境需要面对高并发、超长上下文和持续流量波动等复杂要求,这对国产算力的显存管理、跨设备协同和服务稳定性提出了更高要求。
生产运行数据显示,摩尔线程MTT S5000与趋境科技自研国产PD异构方案协同运行,在国产头部大模型复杂的业务场景下,实现了平均超过50 TPS的生成速度、超90%的KV Cache命中率、99.9%的稳定性,以及生产级低首Token时延(TTFT)保障,真正将国产算力转化为规模化、高品质AI Token生产能力。
在摩尔线程与趋境科技多轮性能迭代和专项优化下,MTT S5000跨过模型兼容和测试验证阶段,正式进入高品质AI Token生产链路。
“少模型、深优化”理念持续验证,从实验参数转化为稳定产出
上述生产成果,也是趋境科技“少模型、深优化”技术路线的一次集中体现。通过围绕重点模型持续优化,摩尔线程与趋境科技将国产GPU的硬件能力转化为稳定、可交付的AI Token生产能力。
所谓“少模型、深优化”,是将核心工程聚焦具有明确规模化需求的重点模型,围绕模型、芯片、推理系统和真实业务负载开展持续优化。其最终衡量标准,是能否在实际运行中兼顾时延、吞吐、稳定性、精度、长上下文处理与成本,持续产出高品质AI Token。
这一理念也贯穿本次国产PD异构方案的设计与落地。摩尔线程根据Prefill与Decode不同阶段的任务特征提供MTT S5000算力底座,并与趋境科技共同完成MTT S5000与模型、推理系统及运行环境的深度优化。双方以线上流量持续检验优化效果,并依据运行结果迭代模型配置和服务策略,使性能提升从实验参数转化为稳定的高品质AI Token产出,进一步验证了”少模型、深优化”在国产异构生产场景中的有效性。
在此过程中形成的模型配置、流量特征和运行策略,进一步沉淀到摩尔线程MUSA软件栈,趋境科技ATaaS 平台与联合研发的Token Pod等综合解决方案和产品中,形成可复用的生产能力。
强强联合,打造国产化高品质AI Token工厂
摩尔线程与趋境科技此次战略合作,旨在充分发挥双方在国产 GPU 软硬件平台、推理系统与生产运营方面的优势,共同打造可稳定承接真实业务流量、持续输出高品质AI Token的国产化 AI Token 工厂。
围绕这一目标,双方将联合推出基于Token Pod(Token超节点)的软硬一体化Token 生产解决方案。摩尔线程提供MTT S5000智算卡、后续更高性能GPU产品及MUSA软件平台;趋境科技以Token Pod为标准化交付载体,融合自研国产PD异构推理系统、ATaaS平台与运营服务,构建覆盖算力基础设施、推理优化、平台管理及持续运营的专属推理集群。
基于双方已投产项目的实践经验,联合方案将进一步沉淀模型适配、跨设备协同和生产运营能力,并标准化集成至Token Pod。依托共享 KV Cache、流量感知配置、弹性扩展及故障隔离等能力,Token Pod 可适配国产及国际主流硬件组合,形成可按业务规模灵活配置、按需扩展的 Token 生产单元,加速在具体生产项目中的部署与落地。
作为国产全功能GPU的创新引领者,摩尔线程致力于以全功能GPU构建先进AI计算基础设施。此次合作将充分释放MTT S5000的算力与软件生态优势,并与趋境科技的PD异构推理系统深度协同,在保障功能完备与精度可信的基础上,为真实生产业务提供稳定、高效的推理服务能力。
未来,双方将持续深化技术联合、标准共建与生态协作,拓展在互联网企业、前沿基础模型公司、运营商等国家关键基础行业的合作,推动国产PD异构推理在更多生产级场景中规模化应用。
- 芯联生态 智合共赢|2026 AMD EPYC 行业生态峰会・上海站制造业专场圆满举办 – 2026年9月4日
- 摩尔线程 × 趋境科技|共建高品质AI Token工厂,国产异构方案性价比超越国际先进算力 – 2026年9月4日
- SAP ERP云助力港深创科园打造高效、可持续的世界级创新中枢 – 2026年9月4日
