# 帮朋友算了笔账：671B 私有化部署，小团队真碰不起

- 发布日期: 2025-02-23 · 分类: AI

我前阵子帮一个做金融风控的朋友评估 DeepSeek-R1 671B 的私有化落地方案，算完账之后自己都有点愣——这玩意儿真不是小公司能随便碰的。先说个背景：DeepSeek 推理端目前 13000+ 张 N 卡（H100+A100）也只撑得起 500 万 DAU，而峰值 4000 万 DAU 经评估需要在现有算力上扩 7 倍。官方暂时没提 C 端扩容计划，我判断后面大概率往 B2B 端砸资源。

## 硬件怎么搭

671B 这个体量，对显存和算力的胃口非常大。我对比下来，能跑起来的配置基本就三条路：

- 32 张 NVIDIA A100 (40GB)
- 16 张 NVIDIA H100 或 H800 (80GB)
- 8 张 NVIDIA H200 (141GB)

## 三张卡谁更划算

<table> <thead> <tr> <th>GPU</th> <th>架构</th> <th>显存大小</th> <th>FP64 (TFLOPS)</th> <th>FP32 (TFLOPS)</th> <th>Tensor Core (TFLOPS)</th> <th>显存带宽 (TB/s)</th> </tr> </thead> <tbody> <tr> <td>A100</td> <td>Ampere</td> <td>80GB HBM2e</td> <td>19.5</td> <td>19.5</td> <td>312</td> <td>2.039</td> </tr> <tr> <td>H100</td> <td>Hopper</td> <td>80GB HBM3</td> <td>30</td> <td>60</td> <td>989</td> <td>3.35</td> </tr> <tr> <td>H800</td> <td>Hopper</td> <td>80GB HBM3</td> <td>30</td> <td>60</td> <td>989</td> <td>3.35</td> </tr> <tr> <td>H200</td> <td>Hopper</td> <td>141GB HBM3e</td> <td>60</td> <td>120</td> <td>1979</td> <td>4.8</td> </tr> </tbody> </table>

我看完这张表的第一反应是：H200 在显存容量、计算性能和显存带宽三项上全面领先 H100/H800 和 A100。如果预算够，8 张 H200 的方案卡数最少、单卡压力最小，工程上最省心。但"预算够"三个字在 2025 年的 GPU 市场里，本身就是个奢侈品。

## 钱从哪来：云还是自购

### 走 AWS 云

我让朋友先按云的方式估了一轮。宁夏和美东两个区域的报价差异挺大：

## 宁夏地区

<table> <thead> <tr> <th>模型</th> <th>实例类型</th> <th>VCPUs</th> <th>内存 (GiB)</th> <th>所需存储 (GB)</th> <th>1G（￥/月）</th> <th>按需总价（￥/月）</th> <th>RI无预付（￥/年）</th> </tr> </thead> <tbody> <tr> <td>DeepSeek-R1 7B/8B</td> <td>g4dn.xlarge</td> <td>4</td> <td>16</td> <td>125</td> <td>0.5312</td> <td>2974.63</td> <td>23668.08</td> </tr> <tr> <td>DeepSeek-R1 14B</td> <td>g4dn.4xlarge</td> <td>4</td> <td>64</td> <td>250</td> <td>0.5312</td> <td>6465.49</td> <td>4171.83</td> </tr> <tr> <td>DeepSeek-R1 32B</td> <td>g5.4xlarge</td> <td>8</td> <td>64</td> <td>250</td> <td>0.5312</td> <td>8162.23</td> <td>5199.02</td> </tr> <tr> <td>DeepSeek-R1 70B</td> <td>g5.24xlarge</td> <td>16</td> <td>128</td> <td>500</td> <td>0.5312</td> <td>39865.44</td> <td>25005.61</td> </tr> </tbody> </table>

## 美东地区

<table> <thead> <tr> <th>模型</th> <th>实例类型</th> <th>VCPUs</th> <th>内存 (GiB)</th> <th>所需存储 (GB)</th> <th>1G（￥/月）</th> <th>按需总价（￥/月）</th> <th>RI无预付（￥/年）</th> </tr> </thead> <tbody> <tr> <td>DeepSeek-R1 14B</td> <td>g4dn.xlarge</td> <td>4</td> <td>16</td> <td>125</td> <td>0.08</td> <td>423.98</td> <td>281</td> </tr> <tr> <td>DeepSeek-R1 14B</td> <td>g6e.xlarge</td> <td>4</td> <td>16</td> <td>125</td> <td>0.08</td> <td>1398.53</td> <td>959.87</td> </tr> <tr> <td>DeepSeek-R1 70B</td> <td>g6e.2xlarge</td> <td>8</td> <td>32</td> <td>250</td> <td>0.08</td> <td>2233.1</td> <td>1421.65</td> </tr> <tr> <td>DeepSeek-R1 70B</td> <td>g6e.12xlarge</td> <td>48</td> <td>192</td> <td>500</td> <td>0.08</td> <td>7699.63</td> <td>58386.72</td> </tr> <tr> <td>DeepSeek-R1 671B</td> <td>g5.48xlarge</td> <td>192</td> <td>2048</td> <td>3840</td> <td>0.08</td> <td>71853.6</td> <td>56660.71</td> </tr> <tr> <td>DeepSeek-R1 671B</td> <td>g5.48xlarge</td> <td>192</td> <td>2048</td> <td>3840</td> <td>0.08</td> <td>71853.6</td> <td>56660.71</td> </tr> </tbody> </table>

有个坑我踩过：上面这些机型只对**新账号**开放，老账号想用得提 case 申请授权，而且资源池有限，排上队是常态。所以如果你公司已经有一批 AWS 老账号，这条路未必走得通，得提前确认。

### 自购硬件

另一条路是直接买卡建机房。我把成本拆成四块：

- **GPU**：占比最大。按当前市场价（难点是有钱也不一定能买到），单张 A100 (80GB) 约 10 万元，单张 H100/H800 (80GB) 约 20 万元，单张 H200 (141GB) 约 40 万元。
- **服务器**：CPU、内存、存储这些配套，一台高性能服务器大约 50 万元。
- **电力**：这个规模的模型跑起来，电费是真金白银，别忽略。
- **运维**：人员薪酬、设备保养，长期开销。

## 几个我实际用过的优化手段

部署完之后想再压成本、提吞吐，下面这几招我基本都会上：

- **模型并行**：参数摊到多卡，单卡显存压力立刻下来。
- **张量并行**：把矩阵运算拆到多卡，单卡计算负担减轻。
- **流水线并行**：模型切成若干 stage，各 stage 跑在不同 GPU 上，整体吞吐拉上去。
- **混合精度**：训练或推理阶段用 FP16 / INT8，显存和算力开销同步下降。

## 几个容易忽略的坑

- **软件栈兼容性**：框架、驱动、通信库的版本得跟 671B 的推理引擎对得上，我有一次因为 NCCL 版本差一个小号，多卡通信直接卡死，排查了大半天。
- **散热**：32 张 A100 全速跑的时候机房温度能飙到 35°C 以上，散热方案不到位，降频是迟早的事。
- **卡间网络**：GPU 之间走 NVLink 还是走 IB，带宽差好几倍，直接决定推理延迟。

671B 私有化部署不是"买几块卡"的问题，是一整套工程。具体选哪条硬件路线、上多少优化，得看你自己的 QPS 要求、预算上限和运维团队能力。如果日活没到百万级，我倾向于先走云、按量付费，等量上来了再考虑自购——500 万砸下去，回本周期不好算。

