天天看點

Amazon EC2 Inf2執行個體正式可用 助力更低成本、更高性能的生成式AI推理

作者:中關村線上

深度學習(DL)的創新,特别是大語言模型(LLM)的快速發展,已經席卷了整個行業。深度學習模型的參數已從數百萬增加到數十億,為我們呈現了越來越多激動人心的新能力。它們正在催生新的應用,如生成式AI或醫療保健和生命科學的進階研究。亞馬遜雲科技一直在晶片、伺服器、資料中心互連和軟體服務等多個方面創新,加速深度學習工作負載的大規模應用。

亞馬遜雲科技在2022 re:Invent 全球大會上,以其最新的自研機器學習推理晶片Amazon Inferentia2為基礎,釋出了Amazon EC2 Inf2系列執行個體的預覽版。Amazon EC2 Inf2類型執行個體專門針對全球大規模運作高性能深度學習推理應用程式,為部署在EC2上的生成式AI應用提供最佳成本效益,其中包含GPT-J或開放式預訓練Transformer(OPT)語言模型。

現在,亞馬遜雲科技宣布AmazonEC2 Inf2執行個體正式可用!

Inf2執行個體是Amazon EC2上首個推理優化的執行個體,支援可擴充的分布式推理,可實作多個inferentia2晶片之間的超高速連接配接。使用者可以在Inf2執行個體中跨多個晶片高效部署具有數千億個參數的模型。與AmazonEC2 Inf1執行個體相比,Inf2執行個體的吞吐量提高4倍,延遲降低10倍。

新Inf2執行個體的亮點

Inf2執行個體目前有四種可用執行個體類型,最高擴充至12個Amazon Inferentia2晶片和192個vCPU配置。在BF16或FP16資料類型下,它們能夠提供2.3 petaFLOPS的綜合計算能力,并具有晶片間超高速NeuronLink互連的功能。NeuronLink可在多個Inferentia2晶片上擴充大模型,避免通信瓶頸,實作更高性能的推理。

每個Inferentia2晶片内有32GB的高帶寬記憶體(HBM),最高配置的Inf2執行個體可提供高達384GB的共享加速器記憶體,總記憶體帶寬為9.8TB/s。對于需要大記憶體支援的的大型語言模型而言,這種帶寬對于支援模型推理尤為重要。

基于專門為深度學習工作負載而建構的Amazon Inferentia2晶片的Amazon EC2 Inf2,相比同類執行個體,機關功率性能高出了50%。

Amazon Inferentia2的創新之處

與亞馬遜自研機器學習訓練晶片Amazon Trainium類似,每個Amazon Inferentia2晶片都配有兩個經過優化的NeuronCore-v2引擎、高帶寬記憶體(HBM)堆棧和專用的集體計算引擎,以便在執行多加速器推理時實作計算與通信的并行。

每個NeuronCore-v2都有專為深度學習算法建構的标量、向量和張量三種引擎,其中張量引擎針對矩陣運算進行了優化;标量引擎針對ReLU(修正線性單元)函數等元素性操作進行了優化;向量引擎針對批處理規範化或池化等非元素向量運算進行了優化。

以下是AmazonInferentia2晶片和伺服器硬體其他創新總結:

資料類型——Amazon Inferentia2 支援多種資料類型,包括FP32、TF32、BF16、FP16和UINT8,使用者可以為工作負載選擇最合适的資料類型。它還支援新的可配置FP8(cFP8)資料類型,該資料類型特别适用于大模型,因為它減少了模型的記憶體占用和I/O要求。

動态執行和動态輸入形狀——Amazon Inferentia2 具有支援動态執行的嵌入式通用數字信号處理器(DSP),是以無需在主機上展開或執行控制流運算符。Amazon Inferentia2 還支援動态輸入形狀,這些形狀對于具有未知輸入張量大小的模型(例如處理文本的模型)至關重要。

自定義運算符——Amazon Inferentia2支援用C++語言編寫的自定義運算符。Neuron自定義C++運算符使使用者能夠編寫在NeuronCore上天然運作的C++自定義運算符。使用者可以使用标準的PyTorch自定義運算符程式設計接口将CPU自定義運算符遷移到Neuron并實作新的實驗運算符,所有這些都無需對Neuron Core硬體有任何深入了解。

NeuronLink v2——Inf2執行個體是Amazon EC2類型中首個将NeuronLink V2 用于推理優化的執行個體,NeuronLink v2 為Inferentia2晶片間的提供超高速連接配接,加強分布式推理性能。NeuronLink v2使用all-reduce等聚合通信(CC)運算符,将高性能推理管道擴充到所有的推理晶片上。

新Inf2執行個體現已可用

使用者可在亞馬遜雲科技美東(俄亥俄州)和美東(北弗吉尼亞州)地區啟動Inf2執行個體,以按需、預留和競價執行個體或Savings Plan方式調用。使用者僅需為其實際使用的服務付費。如需了解更多相關資訊,請通路AmazonEC2定價網站。

Inf2執行個體可使用亞馬遜雲科技深度學習鏡像進行部署,并可通過Amazon SageMaker、Amazon Elastic Kubernetes Service(Amazon EKS)、Amazon Elastic Container Service(Amazon ECS)和Amazon ParallelCluster等托管服務調用。

(8163698)

繼續閱讀