Day 07 如果把記憶體當股票買,為什麼 AI 一直在談 VRAM呢?
我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。 為什麼 AI 一直在談 VRAM呢? 開始研究 AI Infrastructure 後,我發現大家討論 GPU 時,經常提到另一個名詞:VRAM。 一開始我也以為,只要 GPU 運算能力夠強,AI 模型自然就能跑得快。但實際測試不同 LLM、圖片影像多模態生成模型(Gemma 4等)與Google AI Studio/Gemini AI 後,我才發現,很多時候不是 GPU 不夠快,而是模型根本放不進 GPU 的記憶體。 模型參數、Context Length、Batch Size,甚至推論方式,都會影響 VRAM 的需求。有時候只是模型變大一點,或是希望一次服務更多使用者,就可能因為 VRAM 不足而無法載入,甚至需要重新思考模型選擇或部署方式。 這也讓我開始理解,GPU 的價值不只是運算速度,更重要的是它是否有足夠的 VRAM,支撐模型穩定完成推論。 所以我開始思考一個問題: AI 模型到底是因為「算力不足」而跑不起來,還是其實真正的瓶頸一直都是 VRAM? 這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》書中第五章希望帶大家一起理解的重要觀念。當理解 VRAM 在 AI Infrastructure 中扮演的角色後,後續討論模型大小、量化(Quantization)、Context Length 與 GPU 選型,就會更容易理解。 GPU Memory(VRAM)是獨立於主機 RAM 的高速記憶體,是否能容納模型、支援推論工作負載,是選擇 GPU 的重要考量之一。而VRAM跟RAM的差別,想必大家也有些概念,就在近期有國外科技社群引發熱列討論的一項投資操作,如果把記憶體當股票買,討論十年後、十五年後的未來呢? 因為人工智能產業的爆發性成長,短期已經把記憶體價格推升三到五倍了,雖然有科技發展帶來的突破,如MAC電腦的M1架構、UMA架構的機器(如SPARKPC、STRIX Halo...)、Gemini Enterprise Agent Platform等,隨著更多的專家參與,未來會有更新的模型架講和推理框架等,還有霍爾定律?等等。 當然我寫的內容僅作一些客觀的分析在鐵人文上,也在新書上,發文也不...