16台 H3C MegaCube
成功部署 Kimi-K3
16 台 H3C MegaCube × H3C S9855-40B,通过 200G RoCE 构建统一算力集群,成功承载 2.8 万亿参数 Kimi-K3。完成性能、长上下文、并发、Agent 与稳定性全套实测。
把 2.8T 旗舰模型,完整装进 H3C MegaCube 集群
16 台 H3C MegaCube 通过 TP16 协同工作,每台分担约 93GB 权重。统一内存与高速 RoCE 网络共同跨过单机无法承载的容量边界。
模型参数规模
Kimi-K3 MoE,每 token 激活约 104B 参数。
模型权重
MXFP4 原生量化权重,由 16 台 H3C MegaCube 共同承载。
已验证长上下文
测试套件上限;服务 KV 池配置为 333,126 tokens。
模型测试请求
五阶段全套执行,覆盖性能、并发、长文与 Agent。
集群基础设施
可部署、可接入、可服务
vLLM TP16 + DSpark 投机解码,对外提供 OpenAI 兼容服务;既验证了超大模型的加载能力,也验证了实际输出与业务接入能力。
交互流畅,长上下文下依然稳住速度
短问答 0.57 秒开始出字、解码 22.7 tok/s;128K 输入下仍保持 21.2 tok/s,生成速度仅较短输入下降约 7%。
内容生成速度实测
投机解码对结构化、可预测内容收益明显,代码与模板内容均超过 20 tok/s。
单流上下文性能
| 输入长度 | 首字延迟 | 解码速度 |
|---|---|---|
| 128 | 0.573 s | 22.69 tok/s |
| 1K | 0.727 s | 25.28 tok/s |
| 32K | 10.903 s | 23.48 tok/s |
| 128K | 44.216 s | 21.20 tok/s |
长文首次处理时间随输入规模增长,适合合同、代码库、知识库等“提交—分析”型任务;进入生成后,输出速度保持稳定。
12 个长文检索点,全部命中
在 4K、16K、32K、128K 文本的开头、中部、结尾分别埋入关键信息,Kimi-K3 全部准确取回。
从 4K 到 128K,
从开头到结尾,
检索命中率 100%。
对长合同审阅、企业知识库问答、大型代码库理解与多文档综合分析,这是 H3C MegaCube 集群最具说服力的能力证据。
Needle-in-a-Haystack
4 路交互流畅,16 路释放吞吐
当前配置面向“超大模型 + 长上下文”服务。4 人同时交互仍满足体验门槛;离线批处理在 16 路达到 54.3 tok/s 系统总吞吐。
| 短上下文并发 | 系统总吞吐 | TTFT P95 | 成功率 | 建议定位 |
|---|---|---|---|---|
| 1 路 | 21.8 tok/s | 0.70 s | 100% | 独享流畅 |
| 2 路 | 32.9 tok/s | 0.93 s | 100% | 协作流畅 |
| 4 路 | 42.7 tok/s | 1.31 s | 100% | 体验达标上限 |
| 8 路 | 48.4 tok/s | 56.05 s | 100% | 队列任务 |
| 16 路 | 54.3 tok/s | 104.47 s | 100% | 吞吐最优 / 批处理 |
高负载运行两小时,零泄漏、零降频
约两小时连续测试逐秒采样,验证统一内存、温度、频率与集群服务的稳定状态。
稳态内存漂移
可视为零泄漏,峰值占用 118.5GB/节点。
峰值温度
持续高负载下温度健康,未发生热降频。
最低 SM 频率 MHz
平均 2277MHz,锁频策略全程生效。
GPU 平均利用率
算力被持续、充分调度,集群工作状态健康。
一套集群,覆盖三类高价值 AI 工作负载
长文档与知识库
128K 大海捞针全命中,服务配置支持 333K 上下文,适合合同、报告、档案与企业知识库。
代码与研发助手
代码生成实测 22.9 tok/s,代码测试 100%,可用于代码理解、定位问题与开发辅助。
Agent 与工具调用
71 条 Agent 场景综合得分 89.2%;结构化输出、工具调用与真实流量行为均经过验证。
H3C MegaCube 不是单点算力。
它是一套可扩展的 AI 基础设施。
16 台 H3C MegaCube 借助 H3C S9855-40B 高速网络形成统一集群,完成 2.8T 旗舰模型从“装得下”到“跑得快、找得准、服务稳”的完整验证,充分证明 H3C MegaCube 的集群承载、协同与扩展能力。
VALIDATED