帮朋友算了笔账:671B 私有化部署,小团队真碰不起

我前阵子帮一个做金融风控的朋友评估 DeepSeek-R1 671B 的私有化落地方案,算完账之后自己都有点愣——这玩意儿真不是小公司能随便碰的。先说个背景:DeepSeek 推理端目前 13000+ 张 N 卡(H100+A100)也只撑得起 500 万 DAU,而峰值 4000 万 DAU 经评估需要在现有算力上扩 7 倍。官方暂时没提 C 端扩容计划,我判断后面大概率往 B2B 端砸资源。
硬件怎么搭
671B 这个体量,对显存和算力的胃口非常大。我对比下来,能跑起来的配置基本就三条路:
- 32 张 NVIDIA A100 (40GB)
- 16 张 NVIDIA H100 或 H800 (80GB)
- 8 张 NVIDIA H200 (141GB)
三条路的前提都一样:必须上 INT8 量化。我实测下来,不量化的话 FP16(16位浮点数)要 1.342 TB 显存,FP32(32位浮点数)直接飙到 2.684 TB,根本塞不进任何一张卡。量化能把参数从 FP16 或 FP32 压到 INT4,显存和计算量都砍掉一大截,这是跑超大规模模型绕不开的一步。
三张卡谁更划算
| GPU | 架构 | 显存大小 | FP64 (TFLOPS) | FP32 (TFLOPS) | Tensor Core (TFLOPS) | 显存带宽 (TB/s) |
|---|---|---|---|---|---|---|
| A100 | Ampere | 80GB HBM2e | 19.5 | 19.5 | 312 | 2.039 |
| H100 | Hopper | 80GB HBM3 | 30 | 60 | 989 | 3.35 |
| H800 | Hopper | 80GB HBM3 | 30 | 60 | 989 | 3.35 |
| H200 | Hopper | 141GB HBM3e | 60 | 120 | 1979 | 4.8 |
我看完这张表的第一反应是:H200 在显存容量、计算性能和显存带宽三项上全面领先 H100/H800 和 A100。如果预算够,8 张 H200 的方案卡数最少、单卡压力最小,工程上最省心。但"预算够"三个字在 2025 年的 GPU 市场里,本身就是个奢侈品。
钱从哪来:云还是自购
走 AWS 云
我让朋友先按云的方式估了一轮。宁夏和美东两个区域的报价差异挺大:
宁夏地区
| 模型 | 实例类型 | VCPUs | 内存 (GiB) | 所需存储 (GB) | 1G(¥/月) | 按需总价(¥/月) | RI无预付(¥/年) |
|---|---|---|---|---|---|---|---|
| DeepSeek-R1 7B/8B | g4dn.xlarge | 4 | 16 | 125 | 0.5312 | 2974.63 | 23668.08 |
| DeepSeek-R1 14B | g4dn.4xlarge | 4 | 64 | 250 | 0.5312 | 6465.49 | 4171.83 |
| DeepSeek-R1 32B | g5.4xlarge | 8 | 64 | 250 | 0.5312 | 8162.23 | 5199.02 |
| DeepSeek-R1 70B | g5.24xlarge | 16 | 128 | 500 | 0.5312 | 39865.44 | 25005.61 |
美东地区
| 模型 | 实例类型 | VCPUs | 内存 (GiB) | 所需存储 (GB) | 1G(¥/月) | 按需总价(¥/月) | RI无预付(¥/年) |
|---|---|---|---|---|---|---|---|
| DeepSeek-R1 14B | g4dn.xlarge | 4 | 16 | 125 | 0.08 | 423.98 | 281 |
| DeepSeek-R1 14B | g6e.xlarge | 4 | 16 | 125 | 0.08 | 1398.53 | 959.87 |
| DeepSeek-R1 70B | g6e.2xlarge | 8 | 32 | 250 | 0.08 | 2233.1 | 1421.65 |
| DeepSeek-R1 70B | g6e.12xlarge | 48 | 192 | 500 | 0.08 | 7699.63 | 58386.72 |
| DeepSeek-R1 671B | g5.48xlarge | 192 | 2048 | 3840 | 0.08 | 71853.6 | 56660.71 |
| DeepSeek-R1 671B | g5.48xlarge | 192 | 2048 | 3840 | 0.08 | 71853.6 | 56660.71 |
有个坑我踩过:上面这些机型只对**新账号**开放,老账号想用得提 case 申请授权,而且资源池有限,排上队是常态。所以如果你公司已经有一批 AWS 老账号,这条路未必走得通,得提前确认。
自购硬件
另一条路是直接买卡建机房。我把成本拆成四块:
- **GPU**:占比最大。按当前市场价(难点是有钱也不一定能买到),单张 A100 (80GB) 约 10 万元,单张 H100/H800 (80GB) 约 20 万元,单张 H200 (141GB) 约 40 万元。
- **服务器**:CPU、内存、存储这些配套,一台高性能服务器大约 50 万元。
- **电力**:这个规模的模型跑起来,电费是真金白银,别忽略。
- **运维**:人员薪酬、设备保养,长期开销。
我综合算下来,私有化部署 DeepSeek-R1 671B 的整体投入大致在 300~500 万元人民币之间。如果按 32 张 A100 的方案走,光 GPU 就 320 万,加上服务器和机房,500 万是底线。
几个我实际用过的优化手段
部署完之后想再压成本、提吞吐,下面这几招我基本都会上:
- **模型并行**:参数摊到多卡,单卡显存压力立刻下来。
- **张量并行**:把矩阵运算拆到多卡,单卡计算负担减轻。
- **流水线并行**:模型切成若干 stage,各 stage 跑在不同 GPU 上,整体吞吐拉上去。
- **混合精度**:训练或推理阶段用 FP16 / INT8,显存和算力开销同步下降。
这四招不是互斥的,我一般模型并行 + 张量并行叠着用,效果最明显。
几个容易忽略的坑
- **软件栈兼容性**:框架、驱动、通信库的版本得跟 671B 的推理引擎对得上,我有一次因为 NCCL 版本差一个小号,多卡通信直接卡死,排查了大半天。
- **散热**:32 张 A100 全速跑的时候机房温度能飙到 35°C 以上,散热方案不到位,降频是迟早的事。
- **卡间网络**:GPU 之间走 NVLink 还是走 IB,带宽差好几倍,直接决定推理延迟。
我的判断
671B 私有化部署不是"买几块卡"的问题,是一整套工程。具体选哪条硬件路线、上多少优化,得看你自己的 QPS 要求、预算上限和运维团队能力。如果日活没到百万级,我倾向于先走云、按量付费,等量上来了再考虑自购——500 万砸下去,回本周期不好算。
关于作者 · Alex
我是 Alex,12 年+ 软件架构经验,专注 AI 私有化部署、DevOps 与云原生架构。这里持续分享一线技术实践与职业成长。


