Local AI

本地 AI 的工程現場

這裡整理本地 GPU 伺服器、模型部署、記憶體配置、互連拓樸與分散式運算的實作紀錄。重點不是規格表,而是硬體真正裝進系統後,CUDA、NCCL、NUMA 與服務排程如何彼此影響。

4028 上各種 GV100 的性能實測

把五種 GV100、11 張 GPU 裝進同一台雙 NUMA 伺服器後,實測單卡 HBM、PIX/PHB/NV4/SYS,以及 NCCL 從 5、6、10 到 11 GPU 的 scaling transition。

11 GPU336 GiB HBM2
193.5 GB/sNV4 雙向 P2P
5→6第一次 scaling cliff
GV100CUDA P2PNCCLNUMA
閱讀完整實測

後續文章

Local AI 的新測試與部署紀錄會繼續加入這個系列;每篇文章使用獨立檔名,main.html 只維護索引。