GPU Compute Plans

GPU 算力商业化最终报告

GPU 算力商业化最终报告

调研范围:/Users/aaron/Documents/GPU-Compute-Plans 全部 53 份文档 报告时间:2026-07-05 版本:v1.1.0-factchecked(数据事实核查版) 定位:对“从 40 卡 RTX 5090 到万卡 AI 云集群”全生命周期的综合提炼


版本说明

本报告为 v1.1.0-factchecked 数据事实核查版。全量数字已通过 Agent Swarm 分工核查并修正,主要修正项包括:

  • Plan B Token 营收约 10 倍计算错误修正;
  • 电费公式统一为 功耗(kW) × 24 × 30 × 电价 × PUE
  • unit-economics.csv 公式与数值重写;
  • Cap Table 股权比例修正为每轮合计 100%;
  • 毛利率统一按直接成本口径计算;
  • 全文档不专业用语清理。

如需查看原始迭代痕迹,见 迭代日志.md


一、执行摘要

本项目是一套面向 GPU 算力商业化的完整运营手册,覆盖商业模式、部署路径、运营体系、财务模型、安全合规、销售获客、组织架构、融资退出与风险管理等 12 个维度。

核心结论:

  1. 推荐路线:Plan C(混合模式)。底层算力共池,同时经营 IaaS 长租与 MaaS API,可将空置率风险转化为低价/抢占收入,综合毛利率 40–55%,抗风险能力最强。
  2. 当前抓手:40 卡 5090 不是小规模验证,而是真实商业化起点。5 台 × 8 卡 = 40 卡,总显存 1.28 TB,可跑 Qwen3-235B FP8 单机;按混合模型负载、¥5/M 混合价,月理论营收上限 20–35 万,实际 60% 利用率约 12–21 万。
  3. 三件事情要并行:60% 资源跑真实 MaaS 商业化、30% 做万卡决策的 Benchmark Lab、10% 私有/内部使用。
  4. 万卡路径清晰但不可跳过步骤:40 卡验证(3–6 月)→ Seed 5000 万–1 亿 → 80–160 卡或 100 H100(12 月)→ A 轮 2–5 亿 → 2000 卡 H200(24 月)→ 万卡(36 月)。Phase 2 必须“租 100 卡 H100 实测”,5090 数据不足以支撑万卡采购。
  5. 护城河在 AI 安全 + 中立第三方 + 企业服务:复用 OpenClaw Security Console 现有资产,做 Prompt 注入/越狱/RAG 污染/MCP Agent 安全,是国内 MaaS 较稀缺的差异化能力。

二、商业模式:三条路线对比

维度Plan A:卖算力 IaaSPlan B:卖 Token MaaSPlan C:混合模式(推荐)
商业模式按卡时/卡月租用按 token / 请求计费底层共池,双产品线
主要客户训练团队、科研、渲染AI 应用开发者、SaaS两类都覆盖
毛利率40–60%50–70%(v2 后)40–55% 综合
上线周期2–3 个月1–2 个月1 个月 B + 2 个月 A
客户粘性低(价格战)中高(API 集成)中高
议价能力中强
主要风险空置率、电费波动模型迭代、token 定价战调度复杂度
核心护城河供应链 + 长约客户推理工程 + 模型速度弹性调度 + 客户组合

快速决策树: 有闲置卡 → 客户结构决定路径 → 大 B 训练选 A、应用开发者选 B、两者都有 90% 情况选 C。

三个关键判断:

  • 电价 < 0.35 元/度 → Plan A 有利润空间;
  • 30 天内能吃下所有算力的大客户 → 先做 A;
  • 有推理优化团队 → Plan B/C 有竞争力。

三、三条路线的演进节奏

Plan A:卖算力 IaaS

阶段交付形态关键升级周期
v1单机整租 / 裸金属MAAS 装机、按天/月计费、工单制8 周
v2K8s 容器分租1 卡起租、MIG/Time-slicing、Volcano 调度、竞价市场12 周
v3跨区域规模化多 Region、Karmada、多币种、灾备、私有部署6–12 月
  • v1 单机 8×H800 月成本 ≈ 5.1 万(北京机房),满租 20 万/月,60% 出租率毛利约 58%;
  • v2 通过混合租 + 抢占灌 Plan B,毛利可提到 54% 左右;
  • v3 规模化指标:单卡月营收 ≥ 1.5 万、出租率 ≥ 85%、毛利率 ≥ 45%。

Plan B:卖 Token MaaS

阶段模型数引擎关键特性单机月营收(8×H800)
v13–5 个vLLMOpenAI 兼容 API、按 token 计费6.2 万
v215–25 个vLLM + SGLang + TRT-LLM智能路由、prefix cache、抢占 3 折、批量 API15–19 万
v310000+(含社区)多引擎模型市场、微调工作室、Agent/RAG 托管、应用商店生态 GMV 30%+
  • v1 目标 6 周上线;
  • v2 是核心提效阶段,同一台机器营收从 6.2 万拉到 15–19 万,靠软件工程;
  • v3 不建议早做,需“营收 5000 万/年 + 开发者过万”再启动。

引擎选型结论: vLLM 是 must-have(70% 请求),SGLang 补长上下文/结构化输出(20%),TRT-LLM 谨慎选(低延迟小模型),TGI 别用。

Plan C:混合模式(首推)

优先级设计:

  • P0:IaaS 长租客户,不可抢占,SLA 99.9%;
  • P1:MaaS 保障 API,付费用户默认;
  • P2:Plan A 抢占实例 + 弹性训练,3–4 折,30s grace;
  • P3:Plan B 抢占 API + 批量任务,3–5 折。

核心约束: P0 + P1 总量 ≤ 物理容量 80%,预留 20% 弹性;P2/P3 跑剩余容量。

经济模型(单机 8×H800,月成本 5.1 万):

  • 纯 A 满租:20 万营收,约 75% 毛利;
  • 纯 A 60% 出租:12 万营收,约 58% 毛利;
  • Plan C 混合:12–13.5 万营收,约 54–62% 毛利。

实施节奏: M1–M3 逻辑分区 → M4–M6 算力池化 → M7–M9 完整动态调度 → M10–M12 抢占市场化。


四、当前实际场景:40 卡 RTX 5090

硬件能力

  • 5 台 × 8 卡 RTX 5090,合计 40 卡,总显存 1.28 TB
  • 可单机跑 Qwen3-235B FP8、DeepSeek-V2 236B FP8、Qwen2.5-72B FP8;
  • 不建议跑 DeepSeek-V3 671B(无 NVLink,跨机通信慢);
  • 单机满载 32B FP8 约 3000–5000 tok/s,5 台合计 1.5–2.5 万 tok/s;跑 7B/14B 小模型或多副本混合负载时,月吞吐可达 390–650 亿 tokens。

成本

单机月成本 ≈ 2.0 万,5 台合计 ≈ 10 万/月(硬件折旧 1 万 + 电费 0.33 万 + 机柜 0.2 万 + 带宽 0.2 万 + 运维分摊 0.3 万)。

机器分工

机器用途部署
M1生产 MaaS 旗舰Qwen3-72B FP8 TP=8 单副本
M2生产 MaaS 中型主力4 副本 × Qwen2.5-32B FP8 TP=2
M3生产 MaaS 小型舰队8 副本 × 单卡(14B/9B/嵌入/视觉)
M4Benchmark 测试专用8 周跑 500+ 数据点
M5弹性池 + 微调LoRA/QLoRA + Spot API

商业化目标

时点付费开发者月流水阶段目标
3 个月100 人3–8 万验证 PMF
6 个月200 人8–15 万探索提价/扩容
12 个月500 人12–20 万可复制商业化

五、规模化场景关键数字

场景规模月成本月营收毛利率回本周期核心假设
S1 创业起步100 卡 H800~82 万96–160 万15–40%24–36 月Plan C 混合,60% 出租率
S2 中型混合500 卡~287 万560 万~35%20–30 月多卡型混合
S3 千卡跨区域1000 卡~667 万1450 万~42%18–30 月三地三中心
S4 国内自持机房200 卡 昇腾~240 万320 万~25%3–5 年内部 + 外部定制
S5 东南亚出海300 卡 H100~324 万600 万~46%25–35 月新加坡/印尼/越南
S6 万卡目标10000 卡8000 万–1.5 亿1.5–2.5 亿35–45%4–5 年H200/H100/昇腾混合

注:S6 万卡为静态回本估算,实际受融资节奏、供需关系、卡价波动影响较大。


六、财务与融资

单机经济模型(8×H800,北京机房)

模式满载月营收实际 80%毛利率
Plan A 独占20.2 万16.1 万~75%
Plan A 60% 出租12.1 万9.7 万~58%
Plan B v219 万15 万~118%(仅 GPU 直接成本口径)
Plan C 混合12–13.5 万10–11 万~54–62%

Plan B 毛利率超过 100% 是因为未摊入全部团队/管理费用;若摊入 10 人团队成本,毛利率约 60–70%。

融资节奏

轮次时间融资额投后估值关键里程碑
Seed现在5000 万–1 亿3–5 亿40 卡数据 + 月流水 20 万+
A 轮M62–3 亿15–20 亿首批 2000 卡上线
B 轮M128–10 亿50–80 亿扩 5000 卡
C 轮M2415–25 亿万卡满载 + 出海

Cap Table 示例

阶段创始人 + Co-founder投资人期权池
Seed 前85%15%
Seed 后65%20%15%
A 轮稀释后50%40%10%
B 轮稀释后30%60%10%

七、关键风险与应对

风险影响应对
大厂降价 30%Plan A 毛利被压缩绑定长约客户 + 差异化服务
模型官方 API 降价Plan B 价格压力私有化部署 + 安全合规 + 低延迟
出租率不足 60%现金流紧张抢占实例 + Plan C 混合消化闲置
供应链断供无法扩卡多卡型/多区域/国产替代
人才流失推理工程/安全团队期权池 + 技术护城河

八、下一步行动建议

  1. 立即:在 40 卡 5090 上跑通 3–5 个生产模型,验证 MaaS PMF;
  2. 8 周内:完成 Benchmark Lab,产出 H100/5090 对比数据;
  3. 3 个月内:实现月流水 3–8 万,积累首批付费开发者;
  4. 6 个月内:决定是否上 H100 路线,启动 Seed 融资;
  5. 持续:把 AI 安全能力产品化,作为差异化卖点。

On this page