Day 11 同一個 AI 模型,Training 和 Inference 為什麼需要不同的 GPU??
我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。 如果用同一個 AI 模型,Training 和 Inference 為什麼需要不同的 GPU? 前幾天一直在談 GPU、VRAM、模型大小與 Quantization(量化),我開始發現一個很容易被忽略的問題: 同一個 AI 模型,拿來 Training 和拿來 Inference,真的需要一樣的 GPU 嗎? 我自己接觸 AI 模型實作後,才逐漸理解兩者的工作完全不同。 Training 不只是把模型放進 GPU 裡跑,而是需要計算梯度、更新參數,過程中還會產生額外的記憶體需求,因此通常更重視 GPU 的運算能力、記憶體與多 GPU 平行處理能力。 Inference 則是模型已經訓練完成,接下來要面對的是「如何有效率地服務使用者」。這時候問題變成延遲、吞吐量、同時請求數、GPU 使用率與每次請求的成本。而Google Cloud 目前的 AI workload 指南也將 Training 與 Inference 分別描述為不同的 Infrastructure 需求。 這讓我重新思考以前「AI 就是需要一張很強的 GPU」這種想法。 真正的問題其實是: 你的 GPU 到底是在訓練模型,還是在服務模型? 如果只是自己做模型推論,可能不需要為 Training 等級的硬體付費;但如果要大量服務使用者,又必須重新考慮 throughput、latency、batching 與成本。Google Cloud 目前的 LLM inference 最佳實務,也把 latency、throughput 與 cost-efficiency 視為不同的最佳化目標。Training 偏向高運算、高記憶體與平行處理;LLM Inference 則更重視 latency、throughput 與成本。 所以問題來了: 如果 Training 和 Inference 的需求完全不同,我們還能用「GPU 越強越好」這種方式選擇 AI Infrastructure 嗎? 這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》中,我希望從 GPU 與 Infrastructure 的角度,帶讀者重新理解 AI 硬體選擇的原因。同一個 ...