钽铥TANDIU
COMPUTE MARKET DATA

DeepSeek V4 Flash 本地部署测算

DeepSeek V4 Flash(DeepSeek)在不同算力卡上的本地部署配置、预估性能与适用场景。

数据更新时间:2026-09-16

← 返回本地部署测算总览

总参数291B决定权重显存占用
激活参数13B决定解码算力与速度
公开评测AA 35.0 · LiveBench 65.5官方API/渠道端输出速度 236.0 tok/s(非本页本地部署测算)

B300 288GB

288GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)
建议精度
FP16/BF16原始精度
所需卡数
4张
预估解码速度
1,231 tok/s单流理论估算
硬件出厂价
¥1,440,000–¥1,728,000云端时租(实时)×4张:¥254.4–¥254.4/时(2026-09-17)
硬件市场价
¥48,000,000–¥56,000,000
适用场景
机构级超大规模训练与高并发推理集群

GB200 192GB(单卡等效)

192GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)
建议精度
FP16/BF16原始精度
所需卡数
4张
预估解码速度
1,231 tok/s单流理论估算
硬件出厂价
¥800,640–¥1,200,960
硬件市场价
¥2,400,000–¥4,800,000
适用场景
超大规模万亿参数模型训练与推理集群(与Grace CPU协同组网)

B200 180GB

180GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)
建议精度
FP16/BF16原始精度
所需卡数
4张
预估解码速度
1,231 tok/s单流理论估算
硬件出厂价
资料不足云端时租(实时)×4张:¥237.2–¥237.2/时(2026-09-17)
硬件市场价
¥1,500,000–¥1,750,000
适用场景
机构级大规模在线推理与训练

H200 141GB

141GB · 4,800GB/s带宽 · 顶级出口管制卡(对华渠道多变)
建议精度
FP16/BF16原始精度
所需卡数
8张
预估解码速度
1,477 tok/s单流理论估算
硬件出厂价
¥1,612,800–¥2,592,000云端时租(实时)×8张:¥107.2–¥268.0/时(2026-09-17)
硬件市场价
¥1,500,000–¥1,560,000
适用场景
企业级生产环境高并发推理

H100 SXM5 80GB

80GB · 3,350GB/s带宽 · 顶级出口管制卡(对华无官方渠道)
建议精度
INT8量化
所需卡数
8张
预估解码速度
2,062 tok/s单流理论估算
硬件出厂价
¥2,016,000–¥2,304,000云端时租(实时)×8张:¥116.8–¥325.6/时(2026-09-17)
硬件市场价
¥2,700,000–¥2,800,000
适用场景
企业级生产环境高并发推理/训练

H800 SXM 80GB

80GB · 3,350GB/s带宽 · 顶级出口管制卡(已停供)
建议精度
INT8量化
所需卡数
8张
预估解码速度
2,062 tok/s单流理论估算
硬件出厂价
¥1,960,000–¥2,080,000
硬件市场价
¥2,700,000–¥2,800,000
适用场景
企业级生产部署(原对华合规型号,现已停供)

H20 96GB

96GB · 4,000GB/s带宽 · 出口合规特供卡(算力大幅阉割)
建议精度
FP16/BF16原始精度
所需卡数
8张
预估解码速度
1,231 tok/s单流理论估算
硬件出厂价
资料不足
硬件市场价
¥640,000–¥880,000
适用场景
出口合规环境下的次优选择,中大规模推理部署(FP16算力仅约H100的15%,但内存带宽较高,解码密集场景相对占优)

A800 PCIe 80GB

80GB · 1,935GB/s带宽 · 合规特供卡(出口合规状态多次调整)
建议精度
INT8量化
所需卡数
8张
预估解码速度
1,191 tok/s单流理论估算
硬件出厂价
¥800,000–¥832,000
硬件市场价
¥560,000–¥680,000
适用场景
出口合规环境下的中等规模推理/训练部署

昇腾910B 64GB

64GB · 400GB/s带宽 · 国产替代(不受美国出口管制)
建议精度
INT8量化
所需卡数
8张
预估解码速度
246 tok/s单流理论估算
硬件出厂价
资料不足
硬件市场价
¥880,000–¥960,000
适用场景
国产替代,不受美国出口管制,中大规模推理/训练部署,内存带宽明显低于同显存量级NVIDIA卡

L40S 48GB

48GB · 864GB/s带宽 · 合规推理卡
建议精度
INT8量化
所需卡数
8张
预估解码速度
532 tok/s单流理论估算
硬件出厂价
¥360,000–¥520,000云端时租(实时)×8张:¥36.0–¥43.2/时(2026-09-17)
硬件市场价
¥360,000–¥520,000
适用场景
中小团队自建推理服务,中低并发

L20 48GB

48GB · 864GB/s带宽 · 合规推理卡
建议精度
INT8量化
所需卡数
8张
预估解码速度
532 tok/s单流理论估算
硬件出厂价
¥192,000–¥256,000
硬件市场价
¥200,000–¥280,000
适用场景
中小团队自建推理服务,中低并发

RTX 5090D 24GB

24GB · 1,344GB/s带宽 · 消费级/小规模自建
建议精度
INT4量化(AWQ/GPTQ)
所需卡数
8张
预估解码速度
1,654 tok/s单流理论估算
硬件出厂价
¥164,000–¥167,992云端时租(实时)×8张:¥20.0–¥28.8/时(2026-09-17)
硬件市场价
¥240,000–¥320,000
适用场景
个人开发/小规模验证/POC,不建议生产级高并发

RTX 4090D 24GB

24GB · 1,008GB/s带宽 · 消费级/小规模自建
建议精度
INT4量化(AWQ/GPTQ)
所需卡数
8张
预估解码速度
1,241 tok/s单流理论估算
硬件出厂价
¥103,992–¥151,992云端时租(实时)×8张:¥13.6–¥25.6/时(2026-09-17)
硬件市场价
¥208,000–¥240,000
适用场景
个人开发/小规模验证/POC,不建议生产级高并发
解码速度是理论测算,不是压测结果

预估解码速度=(显存带宽×卡数)÷(激活参数×精度字节数),是内存带宽瓶颈下单条请求吞吐量的理论上限(roofline模型),按卡数线性放大,未计入多卡并行通信开销、批处理并发与框架效率损耗,实际压测结果通常明显低于此值,且卡数越多折损通常越大;这个线性放大假设对配备NVLink/NVSwitch的数据中心卡(H系列/B系列)相对合理,对消费级卡(RTX 5090D/4090D等常见PCIe互联、无NVLink)明显过于乐观——多张消费卡跑张量并行的实际速度会因通信瓶颈大打折扣,因此同一模型下消费卡看起来"卡数一样、速度不输数据中心卡"是理论上限的假象,不能据此认为消费级方案性能相当,仅用于不同硬件之间的数量级横向比较,不是承诺性能指标。「建议精度」按可在单机常见的8张卡以内容纳的最高精度自动选择,超过8张即标注"需多节点";实际大规模生产部署也常用更多卡换取更高并发,而非单纯追求最高精度。硬件出厂价/市场价按所需卡数折算总额,人工整理定期复核;"云端时租(实时)"取自vast.ai公开市场API每日自动刷新,是国际云端市场时租价×卡数,不代表中国大陆整卡采购价,仅供横向趋势参考。完整硬件明细来源见 本地部署测算总览 底部硬件对照表。