Day 07 如果把記憶體當股票買,為什麼 AI 一直在談 VRAM呢?
我有多年 IT 技術與跨域學習經驗,現在把 AI、Cloud、Infrastructure 串起來。
為什麼 AI 一直在談 VRAM呢?
開始研究 AI Infrastructure 後,我發現大家討論 GPU 時,經常提到另一個名詞:VRAM。
一開始我也以為,只要 GPU 運算能力夠強,AI 模型自然就能跑得快。但實際測試不同 LLM、圖片影像多模態生成模型(Gemma 4等)與Google AI Studio/Gemini AI 後,我才發現,很多時候不是 GPU 不夠快,而是模型根本放不進 GPU 的記憶體。
模型參數、Context Length、Batch Size,甚至推論方式,都會影響 VRAM 的需求。有時候只是模型變大一點,或是希望一次服務更多使用者,就可能因為 VRAM 不足而無法載入,甚至需要重新思考模型選擇或部署方式。
這也讓我開始理解,GPU 的價值不只是運算速度,更重要的是它是否有足夠的 VRAM,支撐模型穩定完成推論。
所以我開始思考一個問題:
AI 模型到底是因為「算力不足」而跑不起來,還是其實真正的瓶頸一直都是 VRAM?
這也是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》書中第五章希望帶大家一起理解的重要觀念。當理解 VRAM 在 AI Infrastructure 中扮演的角色後,後續討論模型大小、量化(Quantization)、Context Length 與 GPU 選型,就會更容易理解。
GPU Memory(VRAM)是獨立於主機 RAM 的高速記憶體,是否能容納模型、支援推論工作負載,是選擇 GPU 的重要考量之一。而VRAM跟RAM的差別,想必大家也有些概念,就在近期有國外科技社群引發熱列討論的一項投資操作,如果把記憶體當股票買,討論十年後、十五年後的未來呢?
因為人工智能產業的爆發性成長,短期已經把記憶體價格推升三到五倍了,雖然有科技發展帶來的突破,如MAC電腦的M1架構、UMA架構的機器(如SPARKPC、STRIX Halo...)、Gemini Enterprise Agent Platform等,隨著更多的專家參與,未來會有更新的模型架講和推理框架等,還有霍爾定律?等等。
當然我寫的內容僅作一些客觀的分析在鐵人文上,也在新書上,發文也不推廣任何炒作快速致富的方案,不構成購買之建議,只分享我的經驗,如有問題請諮詢專業機構或專家,如有錯誤也歡迎指正資訊,正如今天去了NTU 2026 SQAI international Summit on quantum AI,從產業專家與研究員分享中受益良多,我也鼓勵大家多使用Google AI等產品服務或AI工具來搭配我的書一起學習!
關於作者
我是一名 AI × Infrastructure Solution / Integration 技術實作者,專注於 AI、MLOps、Cloud、Docker、Kubernetes、GPU、LLM 與 AI Agent 等技術的整合與落地,跨足 LLM、GPU、Docker、Kubernetes、MLOps 與 AI Agent,持續研究企業 AI 從 Prototype 到 Production 所需要的工程能力。協助企業理解 AI 從 Prototype 到 Production 所需要的技術能力。
本系列同時是《AI Infrastructure 實戰:AI Demo 為什麼上不了 Production?》的延伸實戰筆記。如果想完整理解這些更深的技術問題,未來可以去看這本書(書中包含了一些的範例與提示詞,特別是AMD W7900 48G的使用技術心得,這些是外面很少有的獨家踩坑經驗,未來買書真的賺到!)。敬請期待唷~
留言
張貼留言