混元 A13B 本地部署测算
混元 A13B(腾讯)在不同算力卡上的本地部署配置、预估性能与适用场景。
数据更新时间:2026-09-16B300 288GB
288GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 1张
- 预估解码速度
- 308 tok/s单流理论估算
- 硬件出厂价
- ¥360,000–¥432,000云端时租(实时):¥63.6–¥63.6/时(2026-09-17)
- 硬件市场价
- ¥12,000,000–¥14,000,000
- 适用场景
- 机构级超大规模训练与高并发推理集群
GB200 192GB(单卡等效)
192GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 1张
- 预估解码速度
- 308 tok/s单流理论估算
- 硬件出厂价
- ¥200,160–¥300,240
- 硬件市场价
- ¥600,000–¥1,200,000
- 适用场景
- 超大规模万亿参数模型训练与推理集群(与Grace CPU协同组网)
B200 180GB
180GB · 8,000GB/s带宽 · 顶级Blackwell卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 2张
- 预估解码速度
- 615 tok/s单流理论估算
- 硬件出厂价
- 资料不足云端时租(实时)×2张:¥118.6–¥118.6/时(2026-09-17)
- 硬件市场价
- ¥750,000–¥875,000
- 适用场景
- 机构级大规模在线推理与训练
H200 141GB
141GB · 4,800GB/s带宽 · 顶级出口管制卡(对华渠道多变)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 2张
- 预估解码速度
- 369 tok/s单流理论估算
- 硬件出厂价
- ¥403,200–¥648,000云端时租(实时)×2张:¥26.8–¥67.0/时(2026-09-17)
- 硬件市场价
- ¥375,000–¥390,000
- 适用场景
- 企业级生产环境高并发推理
H100 SXM5 80GB
80GB · 3,350GB/s带宽 · 顶级出口管制卡(对华无官方渠道)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 515 tok/s单流理论估算
- 硬件出厂价
- ¥1,008,000–¥1,152,000云端时租(实时)×4张:¥58.4–¥162.8/时(2026-09-17)
- 硬件市场价
- ¥1,350,000–¥1,400,000
- 适用场景
- 企业级生产环境高并发推理/训练
H800 SXM 80GB
80GB · 3,350GB/s带宽 · 顶级出口管制卡(已停供)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 515 tok/s单流理论估算
- 硬件出厂价
- ¥980,000–¥1,040,000
- 硬件市场价
- ¥1,350,000–¥1,400,000
- 适用场景
- 企业级生产部署(原对华合规型号,现已停供)
H20 96GB
96GB · 4,000GB/s带宽 · 出口合规特供卡(算力大幅阉割)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 2张
- 预估解码速度
- 308 tok/s单流理论估算
- 硬件出厂价
- 资料不足
- 硬件市场价
- ¥160,000–¥220,000
- 适用场景
- 出口合规环境下的次优选择,中大规模推理部署(FP16算力仅约H100的15%,但内存带宽较高,解码密集场景相对占优)
A800 PCIe 80GB
80GB · 1,935GB/s带宽 · 合规特供卡(出口合规状态多次调整)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 298 tok/s单流理论估算
- 硬件出厂价
- ¥400,000–¥416,000
- 硬件市场价
- ¥280,000–¥340,000
- 适用场景
- 出口合规环境下的中等规模推理/训练部署
昇腾910B 64GB
64GB · 400GB/s带宽 · 国产替代(不受美国出口管制)- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 62 tok/s单流理论估算
- 硬件出厂价
- 资料不足
- 硬件市场价
- ¥440,000–¥480,000
- 适用场景
- 国产替代,不受美国出口管制,中大规模推理/训练部署,内存带宽明显低于同显存量级NVIDIA卡
L40S 48GB
48GB · 864GB/s带宽 · 合规推理卡- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 133 tok/s单流理论估算
- 硬件出厂价
- ¥180,000–¥260,000云端时租(实时)×4张:¥18.0–¥21.6/时(2026-09-17)
- 硬件市场价
- ¥180,000–¥260,000
- 适用场景
- 中小团队自建推理服务,中低并发
L20 48GB
48GB · 864GB/s带宽 · 合规推理卡- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 4张
- 预估解码速度
- 133 tok/s单流理论估算
- 硬件出厂价
- ¥96,000–¥128,000
- 硬件市场价
- ¥100,000–¥140,000
- 适用场景
- 中小团队自建推理服务,中低并发
RTX 5090D 24GB
24GB · 1,344GB/s带宽 · 消费级/小规模自建- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 8张
- 预估解码速度
- 414 tok/s单流理论估算
- 硬件出厂价
- ¥164,000–¥167,992云端时租(实时)×8张:¥20.0–¥28.8/时(2026-09-17)
- 硬件市场价
- ¥240,000–¥320,000
- 适用场景
- 个人开发/小规模验证/POC,不建议生产级高并发
RTX 4090D 24GB
24GB · 1,008GB/s带宽 · 消费级/小规模自建- 建议精度
- FP16/BF16原始精度
- 所需卡数
- 8张
- 预估解码速度
- 310 tok/s单流理论估算
- 硬件出厂价
- ¥103,992–¥151,992云端时租(实时)×8张:¥13.6–¥25.6/时(2026-09-17)
- 硬件市场价
- ¥208,000–¥240,000
- 适用场景
- 个人开发/小规模验证/POC,不建议生产级高并发
预估解码速度=(显存带宽×卡数)÷(激活参数×精度字节数),是内存带宽瓶颈下单条请求吞吐量的理论上限(roofline模型),按卡数线性放大,未计入多卡并行通信开销、批处理并发与框架效率损耗,实际压测结果通常明显低于此值,且卡数越多折损通常越大;这个线性放大假设对配备NVLink/NVSwitch的数据中心卡(H系列/B系列)相对合理,对消费级卡(RTX 5090D/4090D等常见PCIe互联、无NVLink)明显过于乐观——多张消费卡跑张量并行的实际速度会因通信瓶颈大打折扣,因此同一模型下消费卡看起来"卡数一样、速度不输数据中心卡"是理论上限的假象,不能据此认为消费级方案性能相当,仅用于不同硬件之间的数量级横向比较,不是承诺性能指标。「建议精度」按可在单机常见的8张卡以内容纳的最高精度自动选择,超过8张即标注"需多节点";实际大规模生产部署也常用更多卡换取更高并发,而非单纯追求最高精度。硬件出厂价/市场价按所需卡数折算总额,人工整理定期复核;"云端时租(实时)"取自vast.ai公开市场API每日自动刷新,是国际云端市场时租价×卡数,不代表中国大陆整卡采购价,仅供横向趋势参考。完整硬件明细来源见 本地部署测算总览 底部硬件对照表。