面向Neocloud時代的機櫃級AI基礎架構設計

前言
生成式AI與Agentic AI應用持續發展,加上日益加劇的AI訓練與推論工作負載,對運算吞吐量、記憶體、網路與儲存能力提出前所未有的要求。因此,AI基礎架構已無法再以獨立伺服器為核心進行設計。隨著專業化 Neocloud服務供應商興起,產業進一步朝向機櫃級架構發展,將運算、網路與散熱管理整合於同一架構中,以實現高效率且具高度適應性的AI運算能力。
建構機櫃級AI的基礎
成功的機櫃級架構始於高效能且具高度適應性的伺服器節點。隨著AI工作負載持續朝向更高運算強度發展,伺服器必須具備高密度運算能力、高速資料吞吐量、穩健的連接能力,以及彈性的擴充能力,以支援廣泛且多元的應用需求。這些能力將決定單一節點能否有效整合至更大型的AI基礎架構環境,並進一步實現整體規模的擴展。
AEWIN 提供完整的伺服器產品組合,涵蓋AI伺服器、全快閃儲存伺服器、高可用性伺服器及通用型伺服器,支援AMD EPYC 9006系列伺服器處理器與Intel Xeon 6處理器等主流伺服器CPU。透過支援多種加速器、EDSFF NVMe儲存、高吞吐量NIC、加密加速卡及高速記憶體,AEWIN的伺服器平台可因應AI運算、資料處理、儲存及基礎架構等多元工作負載需求。
AEWIN伺服器以快速部署與客製化配置為設計核心,讓Neocloud服務供應商與AI基礎架構營運商能夠根據特定工作負載需求,靈活配置每個伺服器節點。從高運算強度的AI應用,到支撐整體AI基礎架構堆疊的網路與儲存資源,AEWIN提供高度適應性與客製化服務,協助擴展運算容量,同時在效能、系統配置與總持有成本之間取得最佳平衡。
透過先進液冷方案提升運算密度
運算密度的提升勢必帶來更高的功耗密度,使散熱管理成為機櫃級 AI 部署中的關鍵考量。隨著CPU與GPU的功耗需求持續提升,傳統氣冷方案在擴展性,以及維持系統效能、能源效率與機櫃密度方面,正面臨日益嚴峻的挑戰。液冷技術則提供了有效的解決方案,協助高密度 AI 系統管理不斷增加的散熱需求。
AEWIN與旗下子公司Arivor合作,透過先進散熱技術支援高功耗AI運算環境。Arivor的雙相直接液冷(2P DLC)方案可高效帶走高功耗元件產生的熱量,協助搭載高TDP CPU與GPU的伺服器應對高負載散熱需求,同時實現更高的運算密度。在機櫃層級,機櫃內建冷卻液分配單元可智慧分配冷卻液至各部署系統,進一步提升整體效率並降低 PUE。
高密度伺服器結合先進2P DLC方案,為Neocloud基礎架構建立靈活且可靠的基礎。具備豐富I/O與高速 PCIe 擴充能力的伺服器,可支援日益高效能的加速器與周邊元件;同時,機櫃級散熱基礎架構則能因應持續提升的功耗密度與散熱需求。透過兩者的技術整合,AEWIN得以提供更具適應性的高密度AI基礎架構建置與擴展方案。
總結
隨著 AI 工作負載日益複雜且要求不斷提升,產業正從最佳化單一伺服器,逐步邁向機櫃級基礎架構的整體設計。AEWIN與旗下子公司Arivor透過可擴充的伺服器與先進2P DLC液冷方案,為Neocloud服務供應商及AI基礎架構營運商提供靈活的基礎,協助部署與擴展新一代高密度AI運算環境,同時降低總持有成本。

