CoreWeave Leads MLPerf 0.7 Endpoints Benchmark with DeepSeek-R1

TL;DR · AI 摘要
CoreWeave在MLPerf 0.7 Endpoints基准测试中,使用68块NVIDIA Blackwell GPU实现每秒44万输出token,验证了DeepSeek-R1模型的高效推理能力。
核心要点
- CoreWeave在MLPerf 0.7测试中使用68块NVIDIA Blackwell GPU实现了441,740 token/s的吞吐量
- 每GPU吞吐量6,496 token/s,直接影响推理服务的经济性
- DeepSeek-R1是6710亿参数的专家混合模型,为当前最难的服务工作负载
结构提纲
按章节快速跳转。
- §引言
使用68块NVIDIA Blackwell GPU实现441,740 token/s吞吐量。
减少GPU使用量、优化成本模型、提升并发性能。
基于生产集群而非实验室环境,确保结果可信度。
每GPU吞吐量直接反映推理服务经济性。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- CoreWeave MLPerf 0.7测试
- 测试结果
- 441,740 token/s吞吐量
- 6,496 token/s/GPU
- 影响
- 减少GPU使用
- 优化成本模型
- 测试环境
- 生产集群验证
- 无隔离环境
金句 / Highlights
值得收藏与分享的关键句。
Sustained performance, not a burst number: plan capacity and cost models around steady-state serving
6,496 tokens per second per GPU is the metric that reflects real inference economics
DeepSeek-R1 is a 671-billion-parameter mixture-of-experts model, hardest serving workload in the suite
CoreWeave 在 MLPerf 0.7 Endpoints 基准测试中领先 | CoreWeave 博客
发布于
2026年7月28日
min read
CoreWeave 在 MLPerf 0.7 Endpoints 基准测试中领先 DeepSeek-R1
作者
Shadi Saba
Copied
NVIDIA GB200 NVL72 系统配置特写
CoreWeave 在 MLPerf 0.7 Endpoints 基准测试中领先 DeepSeek-R1
CoreWeave 在首届 MLPerf® 0.7 Endpoints 基准测试中取得领先成果,使用 NVIDIA GB200 NVL72 系统中 68 个 NVIDIA Blackwell GPU 运行前沿的 DeepSeek-R1 推理模型。在 16,384 个并发请求下,CoreWeave 保持每秒 441,740 个输出标记的系统吞吐量,每个 GPU 最高达到每秒 6,496 个标记。每个 GPU 的吞吐量是衡量实际推理服务经济性的最直接指标,因为它对应每个加速器的标记服务量和每 GPU 成本。
对推理服务的意义
- 持续性能,而非瞬时峰值:围绕稳定状态服务规划容量和成本模型,而非仅依赖生产环境中无法持续的极端峰值
- 更少 GPU,更高吞吐:客户可通过更小、更经济的 GPU 配置实现相同或更高的标记输出
- 高并发场景下更优 GPU 经济性:在最高并发测试中每个 GPU 的吞吐量提升,意味着随着流量增长,每个加速器每小时可服务更多标记
- 减少过度配置,提升可用容量:无需预留额外 GPU 容量或为负载下的请求丢失设置重试逻辑
首届 MLPerf 0.7 Endpoints 测试
Endpoints 是 MLCommons 最新的基准测试,旨在衡量早期训练和推理测试套件未能覆盖的指标:推理服务在真实并发在线负载下的表现。该基准测试报告了从 16,384 个并发请求的完整吞吐量-延迟曲线,而非单一数据点。
该基准测试通过引入 DeepSeek-R1 提高了模型难度,这是一个包含 6710 亿参数的专家混合推理模型,每个响应可生成数千个标记,是该套件中最难的服务工作负载。
在生产基础设施而非实验室环境中测试
基准测试结果的可信度取决于其运行环境。CoreWeave 没有创建专门优化以产生单一理想数值的隔离环境,而是像验证 NVIDIA GB200 NVL72 训练性能一样,遵循 NVIDIA 的参考设计,在标准生产集群上验证结果。
DeepSeek-R1 在客户实际使用的网络架构、调度器、存储和 CoreWeave Mission Control 编排系统上运行,未为此次测试单独搭建基准集群。该工作负载的参考配置目标是完整的 18 节点 72-GPU 机架;CoreWeave 在 17 个节点上提交结果,利用 GB200 NVL72 机架中的 68 个 Blackwell GPU。
CoreWeave Mission Control 的持续遥测、预测性故障检测和自动化 GPU 拖尾检测功能在所有生产集群中运行(包括本次测试集群),因此吞吐量数据反映的是集群随时间的持续表现,而非理论极限值。
为什么每 GPU 吞吐量和每输出标记时间至关重要
DeepSeek-R1 是一个推理模型。单个响应可能包含数千个输出标记,CoreWeave 的测试平均每个请求超过 2000 个标记。对于推理模型,两个指标决定了用户体验和交付成本:每 GPU 吞吐量和每输出标记时间(TPOT)。
每块GPU的吞吐量是效率和成本的关键所在。TPOT决定了推理响应流一旦开始后的速度;对于长文本推理输出,它主导着端到端延迟,因此是用户实际感知到的性能指标。在最大并发情况下,CoreWeave在保持每块GPU更高负载的同时,仍保持了该轮测试中最低的TPOT值。正因如此,MLPerf Endpoints对整个吞吐量与延迟曲线进行评分,而非仅仅关注某一点。
支撑这些结果的CoreWeave云平台
CoreWeave云平台以统一架构构建,从底层金属到模型层均进行了性能优化。此次基准测试运行在相同架构上,而非为获取单一数值而特别配置的独立环境:
- CoreWeave裸金属服务器提供无虚拟化层的GPU直接访问能力,消除了虚拟化环境在服务路径中增加的开销和延迟。
- 基于NVIDIA Quantum-2 InfiniBand构建的CoreWeave网络,通过高带宽将机架内所有GPU连接,满足随着并发量和上下文长度增长的多节点服务需求。
- CoreWeave Kubernetes服务(CKS)为集群提供基础运行环境,并与CoreWeave任务控制平台深度集成,最大限度降低开销并提升计算性能。
- CoreWeave SUNK实现拓扑感知调度,使服务工作负载分配到能最小化跨节点通信开销的GPU上。
- CoreWeave分布式文件存储(DFS)为DeepSeek-R1在所有68块GPU上提供高吞吐、低延迟的共享文件系统访问,避免了标准共享卷带来的节点间资源争用。
这套架构同样支撑着CoreWeave AI推理的生产环境。团队可根据工作负载选择执行路径:
- 无服务器推理:按token付费访问精选开源模型库,无需管理集群。
- 专用推理:支持生命周期管理的自定义权重执行,具备明确的GPU和运行时控制能力。
- CKS上推理:完全自主管理的服务,具备完整的Kubernetes原生控制能力。
DeepSeek-R1运行在上述相同的裸金属、网络、CKS、SUNK和存储层,而非为测试单独构建的路径。由于三种路径共享相同基础架构,团队无论是在无服务器推理上测试模型,还是在专用推理上以该规模运行模型,都能获得一致的可预测性能,并可在工作负载增长时在不同路径间无缝切换,无需重新平台化。
阅读CoreWeave在MLPerf训练v6.0中创造新AI训练记录的详情
了解为何CoreWeave是唯一在训练和推理方面均领先的AI云平台
1 MLPerf Endpoints v0.7 DeepSeek-R1 671B,发布于2026年7月28日;2026年7月从Coreweave获取。结果ID:0.7 6535925d-129c-42f5-b5a8-5fb6211e0e4c,运行ID:6646e4e5-afd0-4442-a52c-fd2f2aa06315。结果并发量=16,384个查询,TTFT P95=5.77秒,系统TPS=441,740 token/秒。结果经MLCommons协会验证。MLPerf名称和标识是MLCommons协会在美国和其他国家注册及未注册的商标。版权所有,未经许可禁止使用。更多信息请访问www.mlcommons.org。
2 MLPerf Endpoints v0.7 DeepSeek-R1 671B,发布于2026年7月28日;2026年7月从Coreweave获取。结果ID 0.7 6535925d-129c-42f5-b5a8-5fb6211e0e4c,运行ID 6646e4e5-afd0-4442-a52c-fd2f2aa06315:并发数=16,384个查询,未经验证的性能为每GPU每秒6,496个标记。每GPU吞吐量是通过将系统TPS除以GPU数量(68)计算得出的未经验证指标。MLPerf名称和标识是MLCommons协会在美国和其他国家注册及未注册的商标。版权所有,未经许可禁止使用。更多信息请访问www.mlcommons.org。
CoreWeave在首届MLPerf 0.7 Endpoints基准测试中,凭借NVIDIA GB200 NVL72提交的DeepSeek-R1模型实现了每GPU最高的吞吐量,测试在生产基础设施上进行。
分享本文: /think