AI TRAINING CALCULATOR| AI 訓練計算器
模型的下一步,
需要多少顯存?
比較推論與 LoRA 微調的容量需求,從模型權重、KV Cache 到 GPU 張數逐項估算。
MEMORY ESTIMATE| 記憶體估算
估算總顯存 · GB
- 模型權重
- 16.00 GB
- KV Cache
- 0.54 GB
- Activations
- 3.20 GB
- Framework Overhead
- 1.50 GB
容量規劃示意,不代表實測結果。可選擇預留 10% 顯存,或以原站總容量算法估算。
GPU CAPACITY| GPU 容量
需要幾張 GPU?
| GPU | VRAM / 卡 | 所需卡數 | 總 VRAM | 利用率 |
|---|---|---|---|---|
| RTX 4090 | 24 GB | 1× | 24 GB | 88% |
| A100 40GB | 40 GB | 1× | 40 GB | 53% |
| L40S | 48 GB | 1× | 48 GB | 44% |
| A100 80GB | 80 GB | 1× | 80 GB | 27% |
| H100 SXM5 | 80 GB | 1× | 80 GB | 27% |
| H100 NVL | 94 GB | 1× | 94 GB | 23% |
| H200 | 141 GB | 1× | 141 GB | 15% |
| B200 | 192 GB | 1× | 192 GB | 11% |
此表僅依顯存總容量推算;多卡配置仍需模型切分、框架及互連支援,並不保證直接運行。
ASSUMPTIONS| 假設條件
把估算的前提說清楚
查看計算公式與限制
本版沿用 dev.konsttech.ai 的模型設定與顯存公式。GB 採十進位;權重 = 參數量 × 精度 bytes;KV Cache = 2 × 層數 × KV Heads × Head Dim × 上下文長度 × Batch Size × 2 bytes。Cache 固定採 FP16。
推論 activation 以權重的 20% 估算;LoRA 微調啟用 Gradient Checkpointing 時為 25%,停用時為 60%。LoRA Rank 8/16/32/64 對應原站 2%/4%/6%/8% 的估算比例,LoRA 狀態 = 參數量 × 比例 × 2 × 13 bytes。框架固定預留 1.5 GB。原站微調模式也計入 KV Cache,此處保留其計算口徑,並不等於實際訓練時的 cache 行為。
新增「顯存預留」設定:預設留 10% 規劃餘裕;選擇不預留時,張數與原站的總容量算法一致。自訂模型沿用原站依參數量推算架構的近似方式,無法取代模型設定檔。
LoRA 比例與 activation 均為粗估。不同框架、模型架構、量化及最佳化器會影響實際用量。INT8/INT4 微調需相容的量化 LoRA 工具鏈。本工具不估算訓練時間,也不執行訓練工作。