<meter id="pryje"><nav id="pryje"><delect id="pryje"></delect></nav></meter>

<label id="pryje"></label>

新聞中心

EEPW首頁 > 嵌入式系統(tǒng) > 設(shè)計應(yīng)用 > 揭秘FPGA：為什么比 GPU 的延遲低這么多？

揭秘FPGA：為什么比 GPU 的延遲低這么多？

作者：時間：2018-06-27 來源：網(wǎng)絡(luò)

加入技術(shù)交流群
- 掃碼加入
  和技術(shù)大咖面對面交流
  海量資料庫查詢

收藏

本文引用地址：http://www.ex-cimer.com/article/201806/382354.htm

　　▲FPGA 構(gòu)成的數(shù)據(jù)中心加速平面，介于網(wǎng)絡(luò)交換層(TOR、L1、L2)和傳統(tǒng)服務(wù)器軟件(CPU 上運行的軟件)之間。來源：[4]

　　通過高帶寬、低延遲的網(wǎng)絡(luò)互聯(lián)的 FPGA 構(gòu)成了介于網(wǎng)絡(luò)交換層和傳統(tǒng)服務(wù)器軟件之間的數(shù)據(jù)中心加速平面。

　　除了每臺提供云服務(wù)的服務(wù)器都需要的網(wǎng)絡(luò)和存儲虛擬化加速，FPGA 上的剩余資源還可以用來加速 Bing 搜索、深度神經(jīng)網(wǎng)絡(luò)(DNN)等計算任務(wù)。

　　對很多類型的應(yīng)用，隨著分布式 FPGA 加速器的規(guī)模擴大，其性能提升是超線性的。

　　例如 CNN inference，當(dāng)只用一塊 FPGA 的時候，由于片上內(nèi)存不足以放下整個模型，需要不斷訪問 DRAM 中的模型權(quán)重，性能瓶頸在 DRAM;如果 FPGA 的數(shù)量足夠多，每塊 FPGA 負(fù)責(zé)模型中的一層或者一層中的若干個特征，使得模型權(quán)重完全載入片上內(nèi)存，就消除了 DRAM 的性能瓶頸，完全發(fā)揮出 FPGA 計算單元的性能。

　　當(dāng)然，拆得過細也會導(dǎo)致通信開銷的增加。把任務(wù)拆分到分布式 FPGA 集群的關(guān)鍵在于平衡計算和通信。

　　▲從神經(jīng)網(wǎng)絡(luò)模型到 HaaS 上的 FPGA。利用模型內(nèi)的并行性，模型的不同層、不同特征映射到不同 FPGA。來源：[4]

　　在 MICRO'16 會議上，微軟提出了 Hardware as a Service (HaaS) 的概念，即把硬件作為一種可調(diào)度的云服務(wù)，使得 FPGA 服務(wù)的集中調(diào)度、管理和大規(guī)模部署成為可能。

　　▲Hardware as a Service (HaaS)。來源：[4]

　　從第一代裝滿 FPGA 的專用服務(wù)器集群，到第二代通過專網(wǎng)連接的 FPGA 加速卡集群，到目前復(fù)用數(shù)據(jù)中心網(wǎng)絡(luò)的大規(guī)模 FPGA 云，三個思想指導(dǎo)我們的路線：

　　硬件和軟件不是相互取代的關(guān)系，而是合作的關(guān)系;

　　必須具備靈活性，即用軟件定義的能力;

　　必須具備可擴放性(scalability)。

　　FPGA在云計算中的角色

　　最后談一點我個人對 FPGA 在云計算中角色的思考。作為三年級博士生，我在微軟亞洲研究院的研究試圖回答兩個問題：

　　FPGA 在云規(guī)模的網(wǎng)絡(luò)互連系統(tǒng)中應(yīng)當(dāng)充當(dāng)怎樣的角色?

　　如何高效、可擴放地對 FPGA + CPU 的異構(gòu)系統(tǒng)進行編程?

　　我對 FPGA 業(yè)界主要的遺憾是，F(xiàn)PGA 在數(shù)據(jù)中心的主流用法，從除微軟外的互聯(lián)網(wǎng)巨頭，到兩大 FPGA 廠商，再到學(xué)術(shù)界，大多是把 FPGA 當(dāng)作跟 GPU 一樣的計算密集型任務(wù)的加速卡。然而 FPGA 真的很適合做 GPU 的事情嗎?

　　前面講過，F(xiàn)PGA 和 GPU 最大的區(qū)別在于體系結(jié)構(gòu)，F(xiàn)PGA 更適合做需要低延遲的流式處理，GPU 更適合做大批量同構(gòu)數(shù)據(jù)的處理。

　　由于很多人打算把 FPGA 當(dāng)作計算加速卡來用，兩大 FPGA 廠商推出的高層次編程模型也是基于 OpenCL，模仿 GPU 基于共享內(nèi)存的批處理模式。CPU 要交給 FPGA 做一件事，需要先放進 FPGA 板上的 DRAM，然后告訴 FPGA 開始執(zhí)行，F(xiàn)PGA 把執(zhí)行結(jié)果放回 DRAM，再通知 CPU 去取回。

　　CPU 和 FPGA 之間本來可以通過 PCIe 高效通信，為什么要到板上的 DRAM 繞一圈?也許是工程實現(xiàn)的問題，我們發(fā)現(xiàn)通過 OpenCL 寫 DRAM、啟動 kernel、讀 DRAM 一個來回，需要 1.8 毫秒。而通過 PCIe DMA 來通信，卻只要 1~2 微秒。

　　▲PCIe I/O channel 與 OpenCL 的性能比較?？v坐標(biāo)為對數(shù)坐標(biāo)。來源：[5]

　　OpenCL 里面多個 kernel 之間的通信就更夸張了，默認(rèn)的方式也是通過共享內(nèi)存。

　　本文開篇就講，F(xiàn)PGA 比 CPU 和 GPU 能效高，體系結(jié)構(gòu)上的根本優(yōu)勢是無指令、無需共享內(nèi)存。使用共享內(nèi)存在多個 kernel 之間通信，在順序通信(FIFO)的情況下是毫無必要的。況且 FPGA 上的 DRAM 一般比 GPU 上的 DRAM 慢很多。

　　因此我們提出了 ClickNP 網(wǎng)絡(luò)編程框架 [5]，使用管道(channel)而非共享內(nèi)存來在執(zhí)行單元(element/kernel)間、執(zhí)行單元和主機軟件間進行通信。

　　需要共享內(nèi)存的應(yīng)用，也可以在管道的基礎(chǔ)上實現(xiàn)，畢竟 CSP(Communicating Sequential Process)和共享內(nèi)存理論上是等價的嘛。ClickNP 目前還是在 OpenCL 基礎(chǔ)上的一個框架，受到 C 語言描述硬件的局限性(當(dāng)然 HLS 比 Verilog 的開發(fā)效率確實高多了)。理想的硬件描述語言，大概不會是 C 語言吧。

　　▲ClickNP 使用 channel 在 elements 間通信，來源：[5]

　　▲ClickNP 使用 channel 在 FPGA 和 CPU 間通信，來源：[5]

　　低延遲的流式處理，需要最多的地方就是通信。

　　然而 CPU 由于并行性的限制和操作系統(tǒng)的調(diào)度，做通信效率不高，延遲也不穩(wěn)定。

　　此外，通信就必然涉及到調(diào)度和仲裁，CPU 由于單核性能的局限和核間通信的低效，調(diào)度、仲裁性能受限，硬件則很適合做這種重復(fù)工作。因此我的博士研究把 FPGA 定義為通信的「大管家」，不管是服務(wù)器跟服務(wù)器之間的通信，虛擬機跟虛擬機之間的通信，進程跟進程之間的通信，CPU 跟存儲設(shè)備之間的通信，都可以用 FPGA 來加速。

　　成也蕭何，敗也蕭何。缺少指令同時是 FPGA 的優(yōu)勢和軟肋。

　　每做一點不同的事情，就要占用一定的 FPGA 邏輯資源。如果要做的事情復(fù)雜、重復(fù)性不強，就會占用大量的邏輯資源，其中的大部分處于閑置狀態(tài)。這時就不如用馮·諾依曼結(jié)構(gòu)的處理器。

　　數(shù)據(jù)中心里的很多任務(wù)有很強的局部性和重復(fù)性：一部分是虛擬化平臺需要做的網(wǎng)絡(luò)和存儲，這些都屬于通信;另一部分是客戶計算任務(wù)里的，比如機器學(xué)習(xí)、加密解密。

　　首先把 FPGA 用于它最擅長的通信，日后也許也會像 AWS 那樣把 FPGA 作為計算加速卡租給客戶。

　　不管通信還是機器學(xué)習(xí)、加密解密，算法都是很復(fù)雜的，如果試圖用 FPGA 完全取代 CPU，勢必會帶來 FPGA 邏輯資源極大的浪費，也會提高 FPGA 程序的開發(fā)成本。更實用的做法是FPGA 和 CPU 協(xié)同工作，局部性和重復(fù)性強的歸 FPGA，復(fù)雜的歸 CPU。

　　當(dāng)我們用 FPGA 加速了 Bing 搜索、深度學(xué)習(xí)等越來越多的服務(wù);當(dāng)網(wǎng)絡(luò)虛擬化、存儲虛擬化等基礎(chǔ)組件的數(shù)據(jù)平面被 FPGA 把持;當(dāng) FPGA 組成的「數(shù)據(jù)中心加速平面」成為網(wǎng)絡(luò)和服務(wù)器之間的天塹……似乎有種感覺，F(xiàn)PGA 將掌控全局，CPU 上的計算任務(wù)反而變得碎片化，受 FPGA 的驅(qū)使。以往我們是 CPU 為主，把重復(fù)的計算任務(wù)卸載(offload)到 FPGA 上;以后會不會變成 FPGA 為主，把復(fù)雜的計算任務(wù)卸載到 CPU 上呢?隨著 Xeon + FPGA 的問世，古老的 SoC 會不會在數(shù)據(jù)中心煥發(fā)新生?

　　「跨越內(nèi)存墻，走向可編程世界」(Across the memory wall and reach a fully programmable world.)

　　參考文獻：

　　[1] Large-Scale Reconfigurable Computing in a Microsoft Datacenter https://www.microsoft.com/en-us/research/wp-content/uploads/2014/06/HC26.12.520-Recon-Fabric-Pulnam-Microsoft-Catapult.pdf

　　[2] A Reconfigurable Fabric for Accelerating Large-Scale Datacenter Services, ISCA'14 https://www.microsoft.com/en-us/research/wp-content/uploads/2016/02/Catapult_ISCA_2014.pdf

　　[3] Microsoft Has a Whole New Kind of Computer Chip—and It’ll Change Everything

　　[4] A Cloud-Scale Acceleration Architecture, MICRO'16 https://www.microsoft.com/en-us/research/wp-content/uploads/2016/10/Cloud-Scale-Acceleration-Architecture.pdf

　　[5] ClickNP: Highly Flexible and High-performance Network Processing with Reconfigurable Hardware - Microsoft Research

　　[6] Daniel Firestone, SmartNIC: Accelerating Azure's Network with. FPGAs on OCS servers.

上一頁 1 2 3 4 5 6 下一頁

<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=114&cb=INSERT_RANDOM_NUMBER_HERE&n=a7a83b30' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=115&cb=INSERT_RANDOM_NUMBER_HERE&n=a3d98779' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=116&cb=INSERT_RANDOM_NUMBER_HERE&n=abca108c' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=117&cb=INSERT_RANDOM_NUMBER_HERE&n=a1775170' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=118&cb=INSERT_RANDOM_NUMBER_HERE&n=a449048b' border='0' alt='' /></a>

關(guān)鍵詞： FPGA 云計算 GPU

評論

相關(guān)推薦

Altera的FPGA下載常見問題經(jīng)驗小結(jié)

資源下載 Altera FPGA 常見問題經(jīng)驗 | 2007-12-13

Meta訓(xùn)練Llama 3遭遇頻繁故障

智能計算 Meta Llama 3 英偉達 H100 顯卡 GPU | 2024-07-29

ALTERA的PCI_IP Core問答集

資源下載 Altera FPGA PCI_IP Core | 2007-12-13

s3c2410+fpga 做視頻無線傳輸

herbertwj | 2004-08-15

基于FPGA的可編程數(shù)字濾波器系統(tǒng)

資源下載 Max FPGA 可編程數(shù)字濾波器 | 2007-12-14

摩根士丹利：僅 GB200 AI 服務(wù)器業(yè)務(wù)，就為英偉達創(chuàng)造 2100 億美元年收入

智能計算 GB200 AI 英偉達 GPU | 2024-07-26

實時的噪聲源定位系統(tǒng)

視頻 NI LabVIEW FPGA | 2009-03-25

help, 44b0+fpga拖死cpu

sandman555 | 2005-02-05

高速ADC與內(nèi)置嵌入式串行收發(fā)器的FPGA接口

視頻 Altera FPGA ADC Linear 串行收發(fā)器 | 2009-05-19

3-DES算法的FPGA高速實現(xiàn)(Xilinx)

資源下載 Xilinx FPGA 3-DES算法 | 2007-12-13

FPGA如何同DDR3存儲器進行接口?

視頻 Altera FPGA DDR3 | 2008-06-18

萊迪思全新推出邏輯優(yōu)化的通用FPGA拓展其小型FPGA產(chǎn)品組合

嵌入式系統(tǒng) 萊迪思 FPGA 小型FPGA | 2024-07-23

高通新中端芯片驍龍7s Gen 3曝光：采用Adreno 810 GPU，下月發(fā)布

EDA/PCB 高通中端芯片驍龍7s Gen 3 Adreno 810 GPU | 2024-07-23

基于FPGA的鎖相環(huán)位同步提取電路

設(shè)計方案電子電路圖，F(xiàn)PGA 鎖相環(huán) | 2012-07-27

help, 44b0+fpga拖死cpu

sandman555 | 2005-02-05

Altera公司cyclone系列FPGA-1C6電路圖

設(shè)計方案 Altera 公司 cyclone 系列 FPGA-1C6 | 2009-07-17

視頻協(xié)議板-FPGA配置基于LatticeECP3的設(shè)計

設(shè)計方案視頻協(xié)議 -FPGA 配置基于 LatticeECP3 | 2014-05-20

打破NVIDIA壟斷！英國公司實現(xiàn)CUDA軟件在AMD GPU上無縫運行

智能計算 NVIDIA CUDA軟件 AMD GPU | 2024-07-22

LatticeECP3設(shè)計的視頻協(xié)議板電路圖-FPGA配置

設(shè)計方案 LatticeECP3 設(shè)計視頻協(xié)議電路圖 -FPGA | 2011-06-27

目標(biāo)完全替代閉源驅(qū)動，英偉達宣布全面轉(zhuǎn)向開源 GPU 內(nèi)核模塊

嵌入式系統(tǒng) 閉源驅(qū)動英偉達開源 GPU 內(nèi)核模塊 Linux | 2024-07-22

國家數(shù)據(jù)局：“東數(shù)西算”工程 10 個國家數(shù)據(jù)中心集群算力總規(guī)模超 146 萬標(biāo)準(zhǔn)機架

智能計算東數(shù)西算數(shù)據(jù)中心云計算 | 2024-07-22

help, 44b0+fpga拖死cpu

sandman555 | 2005-02-05

用C/C++語言開發(fā)大規(guī)模FPGA [轉(zhuǎn)載于www.fpga.com.cn]

xiaohua | 2002-09-24

Altera: 采用全系列40-nm收發(fā)器FPGA和ASIC實現(xiàn)創(chuàng)新

視頻 Altera FPGA ASIC | 2009-07-13

LabVIEW 8.20技術(shù)資料大全簡介

資源下載 NI LabVIEW 射頻和通信 FPGA | 2007-12-11

消息稱英偉達 RTX 4070 及以上顯卡因 GDDR6X 顯存缺貨 8 月供應(yīng)緊張

消費電子英偉達 GPU | 2024-07-29

基于SD7502構(gòu)成的FPGA-ASK電路圖

設(shè)計方案基于 SD7502 構(gòu)成 FPGA-ASK 電路圖 | 2011-07-13

LabVIEW FPGA 模塊簡介

視頻 NI LabVIEW FPGA | 2009-04-01

消息稱英偉達曾向臺積電詢問建設(shè)廠外 CoWoS 先進封裝專線可能，遭拒絕

EDA/PCB 英偉達 GPU 封裝工藝臺積電 | 2024-07-23

利用強大的軟件設(shè)計工具為FPGA開發(fā)者賦能

嵌入式系統(tǒng) 軟件設(shè)計工具 FPGA 萊迪思 | 2024-07-17

焦點

推薦視頻

技術(shù)專區(qū)

看屁屁www成人影院,亚洲人妻成人图片,亚洲精品成人午夜在线,日韩在线欧美成人 (function(){ var bp = document.createElement('script'); var curProtocol = window.location.protocol.split(':')[0]; if (curProtocol === 'https') { bp.src = 'https://zz.bdstatic.com/linksubmit/push.js'; } else { bp.src = 'http://push.zhanzhang.baidu.com/push.js'; } var s = document.getElementsByTagName("script")[0]; s.parentNode.insertBefore(bp, s); })();