Skip to content

KTransformers 在珠峰1.0平台上部署

1. KTransformers简介

随着混合专家(MoE)大模型规模的持续增长——如DeepSeek-V3/R1达到671B参数——如何在有限GPU资源下高效部署成为业界核心挑战。清华大学与趋境科技联合开源的KTransformers,为这一难题提供了系统级解决方案。该成果已入选计算机系统领域顶级会议SOSP 2025,标志着中国在AI系统软件栈的创新获得国际学术界认可。

KTransformers的核心思想是实现CPU与GPU的平等协作。传统推理过度依赖GPU,CPU仅承担轻量任务;KTransformers则让GPU负责注意力机制和主干网络的高并行计算,CPU承担稀疏MoE专家的推理任务,形成高效协同执行。

本地图

KTransformers已实现显著的工程化成果。硬件层面,搭载单张RTX 4080 + 双路Xeon即可流畅运行DeepSeek-V3全量模型;生态层面,2025年10月与SGLang完成架构合并,用户通过一条命令即可同时获得全GPU和异构推理能力。

2. 基于珠峰1 移植和性能优化

2.1 功能移植

近期,由趋境科技与清华大学 KVCache.AI 团队开源的 KTransformers 推理架构与中兴微电子自研芯片 珠峰 1.0 完成适配,首次在arm 平台实现该框架功能完整支持,原始版本只支持x86平台,在arm环境没有运行过。

经过中兴微电子软件团队移植,完成12处代码点修改,解决8处环境适配问题,最终成功在珠峰1.0 环境完成功能适配。

移植过程遇到cpufeature库ARM架构识别问题,最终通过增加ARM架构支持解决。 本地图

移植成功后,KTransformers框架可以在珠峰1平台正常启动运行。 本地图

基于珠峰1环境搭建对话服务,后台推理引擎使用珠峰1环境部署KTransformers提供openai兼容api,功能运行正常。 本地图

2.2 性能优化

同时,趋境科技与中兴微电子共同推出搭载 珠峰 1.0 处理器的一体机。在KTransformers 0.2.4 版本,单个GPU+珠峰128C的配置上,运行DeepSeek 671B-R1/V3 实现 decode 性能单并发最高达到 14 token/s,并支持多并发使用。

在技术方面团队完成了以下两个方向的优化工作,性能提升25%-30%:

NUMA亲和优化。

NUMA 众多,需要对算子进行NUMA亲和改造,以减少跨NUMA的访问和同步,以此降低访问延迟,提升推理吞吐。

并行加速。

NUMA 线程池的并行加速,且进行特定的绑核处理。

3. 战略合作

趋境科技与中兴微电子达成合作,KTransformers高效适配中兴微电子珠峰1.0,携手探索算力提升新可能 https://mp.weixin.qq.com/s/2ek05fpy6Tn9g2EfG1uvXg

本地图

3.1 中兴微电子珠峰1.0

珠峰1.0 是基于 ARMv9.0 架构的领域定制异构处理器(Domain Specific Heterogeneous Processor),具有业内领先的计算性能,核数多,高主频,高带宽,高算力,IO丰富等特点,为企业级应用及数据中心提供出色的基础设施支撑,可针对云计算,大数据处理、大规模计算、视频编解码、云游戏等应用场景提供更低的总体拥有成本(TCO),轻松应对企业复杂场景的工作挑战。

本地图

3.2 KTransfomers与趋境科技

KTransformers(https://github.com/kvcache-ai/ktransformers)是由趋境科技联合清华大学KVCache.AI 团队开源的高性能大模型推理框架,能够通过单张消费级GPU+CPU的异构推理,在本地运行千亿级别大模型。

本地图

当前除珠峰外,KTransformers也跟沐曦等国产硬件均完成了适配。趋境科技始终秉承开放兼容的生态合作理念,未来,我们将持续拓展产品生态,在此诚邀更多行业伙伴与开发者加入生态构建。