H3C MegaCube · AI Cluster
Kimi-K3 · Production Validation Report · 2026.08

16台 H3C MegaCube
成功部署 Kimi-K3

16 台 H3C MegaCube × H3C S9855-40B,通过 200G RoCE 构建统一算力集群,成功承载 2.8 万亿参数 Kimi-K3。完成性能、长上下文、并发、Agent 与稳定性全套实测。

2.8T MoE / 激活 104BTP161.45TB 权重MXFP4OpenAI 兼容接口
16-NODE FABRICVALIDATED
CUBE 01
CUBE 02
CUBE 03
CUBE 04
CUBE 05
CUBE 06
CUBE 07
CUBE 08
CUBE 09
CUBE 10
CUBE 11
CUBE 12
CUBE 13
CUBE 14
CUBE 15
CUBE 16
200G RoCE · MTU 9000
H3C S9855-40B双路各 109 Gb/s 实测
333K
服务配置上下文 tokens
22.7
短输入解码 tok/s
0.57s
短问答首字延迟
100%
128K 长文检索命中
01 / 承载力

把 2.8T 旗舰模型,完整装进 H3C MegaCube 集群

16 台 H3C MegaCube 通过 TP16 协同工作,每台分担约 93GB 权重。统一内存与高速 RoCE 网络共同跨过单机无法承载的容量边界。

2.8T

模型参数规模

Kimi-K3 MoE,每 token 激活约 104B 参数。

1.45TB

模型权重

MXFP4 原生量化权重,由 16 台 H3C MegaCube 共同承载。

128K

已验证长上下文

测试套件上限;服务 KV 池配置为 333,126 tokens。

234

模型测试请求

五阶段全套执行,覆盖性能、并发、长文与 Agent。

集群基础设施

计算节点16 × H3C MegaCube
单节点统一内存128 GB LPDDR5
高性能交换H3C S9855-40B
互联协议双路 ConnectX-7 · 200G RoCE v2
网络口径双路分别协商 200G · 各实测 109 Gb/s

可部署、可接入、可服务

vLLM TP16 + DSpark 投机解码,对外提供 OpenAI 兼容服务;既验证了超大模型的加载能力,也验证了实际输出与业务接入能力。

模型承载
PASS
API 服务
PASS
输出连贯
PASS
权重校验
PASS
02 / 性能

交互流畅,长上下文下依然稳住速度

短问答 0.57 秒开始出字、解码 22.7 tok/s;128K 输入下仍保持 21.2 tok/s,生成速度仅较短输入下降约 7%。

内容生成速度实测

投机解码对结构化、可预测内容收益明显,代码与模板内容均超过 20 tok/s。

瞬时峰值
41.5
模板内容
25.3
代码生成
22.9
中文写作
18.0

单流上下文性能

输入长度首字延迟解码速度
1280.573 s22.69 tok/s
1K0.727 s25.28 tok/s
32K10.903 s23.48 tok/s
128K44.216 s21.20 tok/s

长文首次处理时间随输入规模增长,适合合同、代码库、知识库等“提交—分析”型任务;进入生成后,输出速度保持稳定。

03 / 长文理解

12 个长文检索点,全部命中

在 4K、16K、32K、128K 文本的开头、中部、结尾分别埋入关键信息,Kimi-K3 全部准确取回。

从 4K 到 128K,
从开头到结尾,
检索命中率 100%。

对长合同审阅、企业知识库问答、大型代码库理解与多文档综合分析,这是 H3C MegaCube 集群最具说服力的能力证据。

Needle-in-a-Haystack

10%
50%
90%
4K
命中
命中
命中
16K
命中
命中
命中
32K
命中
命中
命中
128K
命中
命中
命中
04 / 并发

4 路交互流畅,16 路释放吞吐

当前配置面向“超大模型 + 长上下文”服务。4 人同时交互仍满足体验门槛;离线批处理在 16 路达到 54.3 tok/s 系统总吞吐。

短上下文并发系统总吞吐TTFT P95成功率建议定位
1 路21.8 tok/s0.70 s100%独享流畅
2 路32.9 tok/s0.93 s100%协作流畅
4 路42.7 tok/s1.31 s100%体验达标上限
8 路48.4 tok/s56.05 s100%队列任务
16 路54.3 tok/s104.47 s100%吞吐最优 / 批处理
05 / 可靠性

高负载运行两小时,零泄漏、零降频

约两小时连续测试逐秒采样,验证统一内存、温度、频率与集群服务的稳定状态。

0.008GB

稳态内存漂移

可视为零泄漏,峰值占用 118.5GB/节点。

70℃

峰值温度

持续高负载下温度健康,未发生热降频。

2275

最低 SM 频率 MHz

平均 2277MHz,锁频策略全程生效。

95.7%

GPU 平均利用率

算力被持续、充分调度,集群工作状态健康。

06 / 业务价值

一套集群,覆盖三类高价值 AI 工作负载

BEST FIT

长文档与知识库

128K 大海捞针全命中,服务配置支持 333K 上下文,适合合同、报告、档案与企业知识库。

RECOMMENDED

代码与研发助手

代码生成实测 22.9 tok/s,代码测试 100%,可用于代码理解、定位问题与开发辅助。

RECOMMENDED

Agent 与工具调用

71 条 Agent 场景综合得分 89.2%;结构化输出、工具调用与真实流量行为均经过验证。

H3C MegaCube 不是单点算力。
它是一套可扩展的 AI 基础设施。

16 台 H3C MegaCube 借助 H3C S9855-40B 高速网络形成统一集群,完成 2.8T 旗舰模型从“装得下”到“跑得快、找得准、服务稳”的完整验证,充分证明 H3C MegaCube 的集群承载、协同与扩展能力。

16 × H3C MEGACUBE
VALIDATED
← 返回模型列表