GPU 算力商业化最终报告
GPU 算力商业化最终报告
调研范围:
/Users/aaron/Documents/GPU-Compute-Plans全部 53 份文档 报告时间:2026-07-05 版本:v1.1.0-factchecked(数据事实核查版) 定位:对“从 40 卡 RTX 5090 到万卡 AI 云集群”全生命周期的综合提炼
版本说明
本报告为 v1.1.0-factchecked 数据事实核查版。全量数字已通过 Agent Swarm 分工核查并修正,主要修正项包括:
- Plan B Token 营收约 10 倍计算错误修正;
- 电费公式统一为
功耗(kW) × 24 × 30 × 电价 × PUE; unit-economics.csv公式与数值重写;- Cap Table 股权比例修正为每轮合计 100%;
- 毛利率统一按直接成本口径计算;
- 全文档不专业用语清理。
如需查看原始迭代痕迹,见 迭代日志.md。
一、执行摘要
本项目是一套面向 GPU 算力商业化的完整运营手册,覆盖商业模式、部署路径、运营体系、财务模型、安全合规、销售获客、组织架构、融资退出与风险管理等 12 个维度。
核心结论:
- 推荐路线:Plan C(混合模式)。底层算力共池,同时经营 IaaS 长租与 MaaS API,可将空置率风险转化为低价/抢占收入,综合毛利率 40–55%,抗风险能力最强。
- 当前抓手:40 卡 5090 不是小规模验证,而是真实商业化起点。5 台 × 8 卡 = 40 卡,总显存 1.28 TB,可跑 Qwen3-235B FP8 单机;按混合模型负载、¥5/M 混合价,月理论营收上限 20–35 万,实际 60% 利用率约 12–21 万。
- 三件事情要并行:60% 资源跑真实 MaaS 商业化、30% 做万卡决策的 Benchmark Lab、10% 私有/内部使用。
- 万卡路径清晰但不可跳过步骤:40 卡验证(3–6 月)→ Seed 5000 万–1 亿 → 80–160 卡或 100 H100(12 月)→ A 轮 2–5 亿 → 2000 卡 H200(24 月)→ 万卡(36 月)。Phase 2 必须“租 100 卡 H100 实测”,5090 数据不足以支撑万卡采购。
- 护城河在 AI 安全 + 中立第三方 + 企业服务:复用 OpenClaw Security Console 现有资产,做 Prompt 注入/越狱/RAG 污染/MCP Agent 安全,是国内 MaaS 较稀缺的差异化能力。
二、商业模式:三条路线对比
| 维度 | Plan A:卖算力 IaaS | Plan B:卖 Token MaaS | Plan C:混合模式(推荐) |
|---|---|---|---|
| 商业模式 | 按卡时/卡月租用 | 按 token / 请求计费 | 底层共池,双产品线 |
| 主要客户 | 训练团队、科研、渲染 | AI 应用开发者、SaaS | 两类都覆盖 |
| 毛利率 | 40–60% | 50–70%(v2 后) | 40–55% 综合 |
| 上线周期 | 2–3 个月 | 1–2 个月 | 1 个月 B + 2 个月 A |
| 客户粘性 | 低(价格战) | 中高(API 集成) | 中高 |
| 议价能力 | 弱 | 中 | 中强 |
| 主要风险 | 空置率、电费波动 | 模型迭代、token 定价战 | 调度复杂度 |
| 核心护城河 | 供应链 + 长约客户 | 推理工程 + 模型速度 | 弹性调度 + 客户组合 |
快速决策树: 有闲置卡 → 客户结构决定路径 → 大 B 训练选 A、应用开发者选 B、两者都有 90% 情况选 C。
三个关键判断:
- 电价 < 0.35 元/度 → Plan A 有利润空间;
- 30 天内能吃下所有算力的大客户 → 先做 A;
- 有推理优化团队 → Plan B/C 有竞争力。
三、三条路线的演进节奏
Plan A:卖算力 IaaS
| 阶段 | 交付形态 | 关键升级 | 周期 |
|---|---|---|---|
| v1 | 单机整租 / 裸金属 | MAAS 装机、按天/月计费、工单制 | 8 周 |
| v2 | K8s 容器分租 | 1 卡起租、MIG/Time-slicing、Volcano 调度、竞价市场 | 12 周 |
| v3 | 跨区域规模化 | 多 Region、Karmada、多币种、灾备、私有部署 | 6–12 月 |
- v1 单机 8×H800 月成本 ≈ 5.1 万(北京机房),满租 20 万/月,60% 出租率毛利约 58%;
- v2 通过混合租 + 抢占灌 Plan B,毛利可提到 54% 左右;
- v3 规模化指标:单卡月营收 ≥ 1.5 万、出租率 ≥ 85%、毛利率 ≥ 45%。
Plan B:卖 Token MaaS
| 阶段 | 模型数 | 引擎 | 关键特性 | 单机月营收(8×H800) |
|---|---|---|---|---|
| v1 | 3–5 个 | vLLM | OpenAI 兼容 API、按 token 计费 | 6.2 万 |
| v2 | 15–25 个 | vLLM + SGLang + TRT-LLM | 智能路由、prefix cache、抢占 3 折、批量 API | 15–19 万 |
| v3 | 10000+(含社区) | 多引擎 | 模型市场、微调工作室、Agent/RAG 托管、应用商店 | 生态 GMV 30%+ |
- v1 目标 6 周上线;
- v2 是核心提效阶段,同一台机器营收从 6.2 万拉到 15–19 万,靠软件工程;
- v3 不建议早做,需“营收 5000 万/年 + 开发者过万”再启动。
引擎选型结论: vLLM 是 must-have(70% 请求),SGLang 补长上下文/结构化输出(20%),TRT-LLM 谨慎选(低延迟小模型),TGI 别用。
Plan C:混合模式(首推)
优先级设计:
- P0:IaaS 长租客户,不可抢占,SLA 99.9%;
- P1:MaaS 保障 API,付费用户默认;
- P2:Plan A 抢占实例 + 弹性训练,3–4 折,30s grace;
- P3:Plan B 抢占 API + 批量任务,3–5 折。
核心约束: P0 + P1 总量 ≤ 物理容量 80%,预留 20% 弹性;P2/P3 跑剩余容量。
经济模型(单机 8×H800,月成本 5.1 万):
- 纯 A 满租:20 万营收,约 75% 毛利;
- 纯 A 60% 出租:12 万营收,约 58% 毛利;
- Plan C 混合:12–13.5 万营收,约 54–62% 毛利。
实施节奏: M1–M3 逻辑分区 → M4–M6 算力池化 → M7–M9 完整动态调度 → M10–M12 抢占市场化。
四、当前实际场景:40 卡 RTX 5090
硬件能力
- 5 台 × 8 卡 RTX 5090,合计 40 卡,总显存 1.28 TB;
- 可单机跑 Qwen3-235B FP8、DeepSeek-V2 236B FP8、Qwen2.5-72B FP8;
- 不建议跑 DeepSeek-V3 671B(无 NVLink,跨机通信慢);
- 单机满载 32B FP8 约 3000–5000 tok/s,5 台合计 1.5–2.5 万 tok/s;跑 7B/14B 小模型或多副本混合负载时,月吞吐可达 390–650 亿 tokens。
成本
单机月成本 ≈ 2.0 万,5 台合计 ≈ 10 万/月(硬件折旧 1 万 + 电费 0.33 万 + 机柜 0.2 万 + 带宽 0.2 万 + 运维分摊 0.3 万)。
机器分工
| 机器 | 用途 | 部署 |
|---|---|---|
| M1 | 生产 MaaS 旗舰 | Qwen3-72B FP8 TP=8 单副本 |
| M2 | 生产 MaaS 中型主力 | 4 副本 × Qwen2.5-32B FP8 TP=2 |
| M3 | 生产 MaaS 小型舰队 | 8 副本 × 单卡(14B/9B/嵌入/视觉) |
| M4 | Benchmark 测试专用 | 8 周跑 500+ 数据点 |
| M5 | 弹性池 + 微调 | LoRA/QLoRA + Spot API |
商业化目标
| 时点 | 付费开发者 | 月流水 | 阶段目标 |
|---|---|---|---|
| 3 个月 | 100 人 | 3–8 万 | 验证 PMF |
| 6 个月 | 200 人 | 8–15 万 | 探索提价/扩容 |
| 12 个月 | 500 人 | 12–20 万 | 可复制商业化 |
五、规模化场景关键数字
| 场景 | 规模 | 月成本 | 月营收 | 毛利率 | 回本周期 | 核心假设 |
|---|---|---|---|---|---|---|
| S1 创业起步 | 100 卡 H800 | ~82 万 | 96–160 万 | 15–40% | 24–36 月 | Plan C 混合,60% 出租率 |
| S2 中型混合 | 500 卡 | ~287 万 | 560 万 | ~35% | 20–30 月 | 多卡型混合 |
| S3 千卡跨区域 | 1000 卡 | ~667 万 | 1450 万 | ~42% | 18–30 月 | 三地三中心 |
| S4 国内自持机房 | 200 卡 昇腾 | ~240 万 | 320 万 | ~25% | 3–5 年 | 内部 + 外部定制 |
| S5 东南亚出海 | 300 卡 H100 | ~324 万 | 600 万 | ~46% | 25–35 月 | 新加坡/印尼/越南 |
| S6 万卡目标 | 10000 卡 | 8000 万–1.5 亿 | 1.5–2.5 亿 | 35–45% | 4–5 年 | H200/H100/昇腾混合 |
注:S6 万卡为静态回本估算,实际受融资节奏、供需关系、卡价波动影响较大。
六、财务与融资
单机经济模型(8×H800,北京机房)
| 模式 | 满载月营收 | 实际 80% | 毛利率 |
|---|---|---|---|
| Plan A 独占 | 20.2 万 | 16.1 万 | ~75% |
| Plan A 60% 出租 | 12.1 万 | 9.7 万 | ~58% |
| Plan B v2 | 19 万 | 15 万 | ~118%(仅 GPU 直接成本口径) |
| Plan C 混合 | 12–13.5 万 | 10–11 万 | ~54–62% |
Plan B 毛利率超过 100% 是因为未摊入全部团队/管理费用;若摊入 10 人团队成本,毛利率约 60–70%。
融资节奏
| 轮次 | 时间 | 融资额 | 投后估值 | 关键里程碑 |
|---|---|---|---|---|
| Seed | 现在 | 5000 万–1 亿 | 3–5 亿 | 40 卡数据 + 月流水 20 万+ |
| A 轮 | M6 | 2–3 亿 | 15–20 亿 | 首批 2000 卡上线 |
| B 轮 | M12 | 8–10 亿 | 50–80 亿 | 扩 5000 卡 |
| C 轮 | M24 | 15–25 亿 | — | 万卡满载 + 出海 |
Cap Table 示例
| 阶段 | 创始人 + Co-founder | 投资人 | 期权池 |
|---|---|---|---|
| Seed 前 | 85% | — | 15% |
| Seed 后 | 65% | 20% | 15% |
| A 轮稀释后 | 50% | 40% | 10% |
| B 轮稀释后 | 30% | 60% | 10% |
七、关键风险与应对
| 风险 | 影响 | 应对 |
|---|---|---|
| 大厂降价 30% | Plan A 毛利被压缩 | 绑定长约客户 + 差异化服务 |
| 模型官方 API 降价 | Plan B 价格压力 | 私有化部署 + 安全合规 + 低延迟 |
| 出租率不足 60% | 现金流紧张 | 抢占实例 + Plan C 混合消化闲置 |
| 供应链断供 | 无法扩卡 | 多卡型/多区域/国产替代 |
| 人才流失 | 推理工程/安全团队 | 期权池 + 技术护城河 |
八、下一步行动建议
- 立即:在 40 卡 5090 上跑通 3–5 个生产模型,验证 MaaS PMF;
- 8 周内:完成 Benchmark Lab,产出 H100/5090 对比数据;
- 3 个月内:实现月流水 3–8 万,积累首批付费开发者;
- 6 个月内:决定是否上 H100 路线,启动 Seed 融资;
- 持续:把 AI 安全能力产品化,作为差异化卖点。