12.13 為什麼使用Apache Pulsar而不是Apache Kafka？

2019-12-13 09:40:27 聞數起舞

為什麼Nutanix Beam繼續使用Apache Pulsar而不是Apache Kafka？

在Nutanix Beam（Saas產品）中，我們處理大量數據以查找有關雲支出，以及雲安全性的見解。 Nutanix Beam建立在我們的微服務和服務網格架構上，使用Consul，Nomad，Vault，Envoy和Docker進行同步RPC請求。儘管我們不會在這裡討論我們的微服務架構（這是在不同的日子和不同的帖子：），但是我們將重點關注支持該架構的關鍵技術-團隊和微服務之間的異步通信。

我們使用Disque＆Conductor進行批處理。這兩個系統都是基於隊列的系統。我們希望將發佈/訂閱功能添加到我們的平臺中，這導致我們尋找一種流媒體平臺，在該平臺中我們可以可靠地存儲事件並在需要時重新發送它們。由於我們的某些團隊成員以前有過Kafka的經驗，並且以中等規模運行Kafka，因此選擇Kafka對我們來說很容易。但是，在部署技術之前，我們強烈認為，重要的是要了解當前的形勢並驗證我們的技術選擇，以免我們屈服於可能對項目不利的，熟悉的技術。同樣，務必謹慎地做出此決定，因為流媒體平臺將成為此SaaS產品的關鍵組件。

當我們在Github問題中提到Apache Pulsar時，我們首先了解到它，並決定開始針對我們的流媒體平臺用例對其進行評估。考慮到Pulsar處於Apache旗下，並且已經從Apache的孵化過程中畢業，成為一個頂級項目，我們可以確信它是一項成熟的技術。 Apache pulsar在Yahoo中已投入生產多年，並採用了此處提到的許多公司。我們收集了需要流平臺的用例列表，並且開始深入分析Apache Pulsar的體系結構以及Pulsar的協調性，持久性，可靠性，高可用性，容錯性和客戶端生態系統。

Apache Pulsar簡介

Apache Pulsar是最初在Yahoo創建的開源分佈式pub-sub消息傳遞系統，現已成為Apache Software Foundation的一部分。

Apache Pulsar使用一種將消息處理，服務和存儲分離的架構。存儲層嵌入了Apache BookKeeper，以實現數據持久性，複製和高可用性。消息服務由構成服務層的一組無狀態代理處理，消息處理由該體系結構自己的層中的Pulsar Functions處理。此體系結構的每一層都可以獨立擴展-我們可以獨立擴展BookKeeper（存儲層）以提高存儲容量和吞吐量，Pulsar代理（服務層）以提高消息服務吞吐量，而功能層（處理層）則可以處理更多數據處理。

要了解有關Apache Pulsar的更多信息，請參閱Apache Pulsar網站和文檔。

發展的好處：

收集用例時發現的一件有趣的事情是，我們經常想同時使用消息隊列和pub-sub模型來使用消息。但是，我們不能將Kafka用作排隊系統，因為您可以擁有的最大工作人員數量受到分區數量的限制，並且由於無法在單個消息級別上確認消息。您將需要通過在自己的數據存儲中維護單個消息確認的記錄來手動在Kafka中提交偏移量，這會增加很多額外的開銷—我認為這是太多的開銷。

使用Pulsar，您無需擔心要使用哪種模型來使用數據。在Pulsar中，您可以在偏移級別使用和提交，也可以在消息級別使用和確認。有關其工作原理的更多詳細信息，Streamlio團隊在此處寫了一個不錯的博客。同樣值得注意的是，如果使用者崩潰，Apache Pulsar將如何處理消息傳遞：在訂閱級別定義的延遲之後，Pulsar將再次將消息發佈給另一個使用者。

運營收益：

這就是事情變得有趣的地方。由於我們以中等規模運營Kafka，我們已經瞭解了它的幾個侷限性。我們看到Pulsar可以解決這些限制並更好地滿足我們的需求。

事件重播和落後的消費者：

在Apache Kafka中，當消費者落後時，由於落後的消費者引入了隨機讀取，因此生產者的吞吐量下降了。 Kafka的架構的設計方式是，高吞吐量取決於僅以追加方式順序訪問數據。

Apache Pulsar通過結合使用基於段的架構和讀寫之間的隔離來解決此問題。您可以在此博客中瞭解更多信息。簡而言之，熱讀取由代理的內存中緩存處理，熱寫入由日誌處理。事件重播/滯後使用者從分類帳讀取訪問數據，分類帳與日誌位於不同的磁盤上。

例如，假設有一個主題，我們有5個消費者，他們所有人閱讀愉快，沒有任何滯後。在這種情況下，讀取由代理緩存提供。週期性地，後臺進程將數據從BookKeeper日記帳移到分類帳。現在想象一下，我們的機器學習工程師突然決定從本主題的開始就決定使用它來訓練/重新訓練他的模型，因為他調整了模型的sigma＆mu :)。由於滯後的消費/事件重播是由位於不同磁盤中的分類帳提供的，因此事件重播不會影響消費者讀取主題中最新數據的性能。

保留數據而不會爆炸我們的雲賬單

Apache Pulsar通過其存儲分層功能解決了此問題，該功能可以將較舊的數據卸載到可擴展的存儲系統中，例如Amazon s3，Google Cloud Storage，Minio等。我們可以根據時間和大小配置卸載策略。一旦主題中的數據達到指定的時間或大小閾值，較舊的數據段將移至對象存儲。最好的部分是，當使用者請求已被卸載到對象存儲的數據時，Pulsar會從對象存儲透明地將該數據提供給使用者。使用者不知道數據是來自磁盤還是對象存儲。這樣，您的主題分區大小不僅限於單個代理上的存儲大小。

在線擴展：

將節點添加到Apache Kafka群集不一定能解決與過載節點有關的性能問題。為什麼不？添加到Kafka群集中的新節點將用於添加後創建的新主題，但不會自動減輕過載節點的一些負擔。要使用它們來分散負載，您需要進行手動的，成本高昂的數據重新平衡，以將某些主題從舊節點遷移到新節點。

在Pulsar中，存儲由Apache BookKeeper提供的存儲層處理。 Pulsar使用基於段的體系結構，其中主題分區中的消息被收集為段，然後將其持久化。結果，在主題分區和節點之間不存在與Kafka中一樣的一對一映射。添加新的存儲節點後，某些新段將存儲在新節點上，從而立即減少了先前存在的節點上的負載。

Jack Vanlightly在此博客中有一個很好的圖表，說明了其工作原理。

數百萬個主題：

我們的用例的另一個重要要求是能夠支持數百萬個主題。例如，假設我們要重播一位客戶的數據。只要我們為每個客戶創建一個主題，就可以輕鬆地為特定客戶的主題創建訂閱，然後使用該客戶的數據。就像刪除主題一樣，刪除客戶數據變得非常簡單。

但是，在Apache Kafka中，擴展多個主題是一個實際的體系結構問題。 Kafka為每個主題創建多個文件（資源）。因此，我們可以創建的主題數量將受到限制。但是，如果我們要將來自許多甚至所有客戶的數據放在一個主題中，那麼當我們要重放單個客戶的數據時，我們將被迫重放整個主題並丟棄所有消息，但與消息關聯的消息除外。我們感興趣的單個客戶。即使我們要使用帶有客戶ID的分區主題作為分區鍵，以便我們僅選擇存儲單個客戶數據的分區，也會浪費大量資源。經紀人和消費者方面。

Pulsar不會按主題創建文件。由於它使用Apache BookKeeper的細分存儲架構，因此創建的細分數量不受主題數量決定。我們非常喜歡此功能，因為有了它，我們可以繼續為每個客戶創建一個主題，這是一種更簡單，更有效的設計。

生產部署

Pulsar在生產中運行了最近6個月，並支持用例，例如發佈/訂閱，排隊和架構註冊表。

結論

總的來說，我們對Pulsar的看法是，它極大地簡化了Nutanix Beam中的異步通信設計。憑藉其可伸縮性和設計，我們可以根據業務用例來決定如何在消費者端使用數據，而不是強迫我們在數據提取期間做出這些決定。這種靈活性可以幫助我們更好地支持不斷變化的業務需求。

Apache Pulsar is Next Generation Persisted Streaming Pub/Sub & Queuing Platform.

要了解有關apache pulsar的工作方式的更多信息，請閱讀Jack Vanightly撰寫的這篇很棒的文章。另外，streamlio團隊有不錯的博客文章，深入討論了每個脈衝星建築細節。 Apache Pulsar擁有一個很棒的社區，在幫助我們正確處理併合併合並請求請求時非常受歡迎。

PS：撰寫本文時要記住，每種技術在這個世界上都有其地位。為了突出某些架構差異，我們將其與kafka進行了比較。我們過去曾經使用過kafka，也非常感謝kafka＆kafka社區。

在評論部分讓我知道您的想法。您可以在Twitter上關注我@SkyRocknRoll

(本文翻譯自Yuvaraj Loganathan的文章《Why Nutanix Beam went ahead with Apache Pulsar instead of Apache Kafka?》，參考：https://medium.com/@yuvarajl/why-nutanix-beam-went-ahead-with-apache-pulsar-instead-of-apache-kafka-1415f592dbbb)

分享到:

閱讀更多 聞數起舞 的文章

關鍵字: 為什麼設計使用

Apache Flink中保存點和檢查點之間的3個區別

Apache Hive簡介

Apache Doris在美團外賣數倉中的應用實踐

Apache Kafka內核深度剖析

Apache HBase配置文件

Apache Shiro視頻教程免費獲取

Apache Atlas

一款高性能的OLAP分析工具-Apache Kylin 研究（一）

Apache Pulsar：下一代分佈式消息系統

Apache Windows部署

Apache Tomcat 7.0.x 將於明年3月31日結束生命週期

03.04 Apache Tomcat 7.0.x 將於明年3月31日結束生命週期

Apache Kafka作者談架構演進（Java消息中間件）

Apache shiro反序列化漏洞排查

Apache Dubbo的愛奇藝之旅

Apache FreeMarker模板FusionAuth遠程代碼執行漏洞通告

Apache Flink 1.9.2 發佈，流處理框架

Apache ab壓力測試的知識點

11.23 apache kafka吞吐量高的原因分析

11.22 Apache Kafka和Apache NiFi集成

Apache Kafka快速入門指南

新一代MQ apache pulsar的架構與核心概念

Apache Shiro架構設計

深入瞭解 Apache Flink 的網絡協議棧

Apache Sqoop文檔~管理員手冊

apache 403錯誤 Forbidden解決方法

Apache 基金會將其所有項目遷移至 GitHub

Apache Tomcat修補重要的遠程執行代碼漏洞

CVE-2019-0211：Apache HTTP服務組件提權漏洞分析

Apache Kylin目錄詳解

Apache HTTP存在提權漏洞，威脅共享Web主機安全性

Apache Mavibot

Apache Ignite上的TensorFlow

Apache Spark常見的三大誤解

apache htpasswd命令用

Apache Kafka在大型應用中的20項最佳實踐

apache flume介紹

apache，tomcat以及IIS三者之間的比較

Apache Flink新的穩定版本發佈，流處理更牛了！

Apache Shiro 會話管理指南詳解（一）

Apache Shiro 會話管理指南詳解（二）

apache Hive介紹

Apache Shiro 10分鐘入門教程

Apache Server搭建圖片服務器

04.02 Apache Server搭建圖片服務器

第二章 IoC容器和Bean配置

bean是一個對象，它是由Spring

運算裡不得不說的python模塊—math

Help

Devops度量--DevOps 現狀快速檢查表

今天主要分享一個DevOps

SOP是什麼（解讀）

SOP不是單個的，是一個體系，雖然我們可以單獨地定義每一個SOP，但真正從企業管理來看，SOP不可能只是單個的，必然是一個整體和體系，也是企業不可或缺的。

還不知道交換機上如何配置DHCP，趕緊過來圍觀吧，一分鐘包你學會

隨著終端設備的越來越多，人工干預配置IP地址，不僅工作效率低，而且，還很容易導致IP衝突，影響正常的網絡訪問。到此已經完成了，DHCP服務的配置了，我們可以在終端驗證。

還在手動配置IP地址嗎？太Low了，一分鐘教會您如何配置DHCP

Python爬蟲自學筆記：分析頭條文章網頁源文件

這兩天分析了一下頭條文章網頁的源文件，現在將分析的結果分享給大家。首先以一篇文章為例，其網址如下：https://www.toutiao.com/i6822245428176617998/如上圖網頁所示，文章中包含文字和圖片。

DNS偵查工具

我們只需要打開瀏覽器輸入例如:www.baidu.com就可以解析到該網站.為了便於記住不需要輸入長長的IP地址去訪問這就是DNS域名解析.關於域名域名的層次劃分用點來分割這時DNS把相對應的域名解析成IP地址高的在右邊.例如:www. NS簡介訪問某網站的時候最低在左邊

國人開源的異步 Python ORM：GINO

程序測評：Create React App 3.3中有哪些酷炫新功能？

Create

“明學”的魅力？我只要我覺得：駕馭終端，提高生產力

最後一個要介紹的命令是

（必收藏系列）Linux面試題——命令集

關注，後臺私信【Linux】分享Linux入門到進階電子書、Linux入門到精通視頻教程（免費）。文件管理命令cat

五分鐘學會如何在 IPFS 上部署網站

原文標題:五分鐘學會如何在

「正點原子NANO STM32F103開發板資料連載」第29章內存管理實驗

1）實驗平臺：【正點原子】

小白怎麼學Web前端開發如何成為技術達人

Web前端開發工程師已經成為了很多年輕人心中的理想工作，不僅入行門檻低、而且薪資待遇和發展前景都不錯，自然吸引了大批人加入行業。

如何開發一個web靜態服務器

我們都知道如今的web服務器有很多，比如著名的有apache，有nginx，有tomcat，有resin服務器，有sphere，有iis服務器等等，這些服務器都能提供web服務，並且幾乎都能和多種語言進行搭配使用，那麼一個web服務器都需要那些功能，開發一個web服務器都需要那些

學Java編程還有前景嗎如何才能拿到高薪

需求大、薪資高似乎是Java開發人員的標籤，不過學Java編程還有前景嗎？它架構在操作系統之上，屏蔽了底層的差異，真正實現了“Writeonce run

Python網絡爬蟲之配置篇（一）

pip

SpringBoot 整合SpringSecurity示例實現前後分離權限註解+JWT登錄認證

serverTimezone=UTC&useUnicode=true&characterEncoding=utf-8&zeroDateTimeBehavior=convertTo&useSSL=falseusername:rootpassword:

Python的運行效率太低？幾行代碼快速提升！

return的就是是你所需要的結果2.3、運行這一步就是最後一步了，只要像下面一樣輸入上述函數名，賦予參數值，點擊運行Run，就能得到你想要的結果arg1=5

python的優點是什麼？最新Python400集視頻（附教程）

2020，最新Python零基礎到精通資料教材，乾貨分享，新基礎Python教材，穩穩找到過萬工作，看這裡，這裡有你想要的所有資源哦，最強筆記，教你怎麼入門提升！獲取方式：私信小編“

MySQL中OOM故障應如何下手-愛可生

作者：孫祚龍愛可生南區分公司交付服務部成員，實習工程師。負責公司產品問題排查及日常運維工作。本文來源：原創投稿*愛可生開源社區出品，原創內容未經授權不得隨意使用，轉載請聯繫小編並註明來源。

像專家一樣使用 panic

|go

30種不同的編程語言怎麼寫“Hello, World”

printfn

percona QAN 介紹

一、背景QAN慢查詢日誌分析工具是PMM

面試官：你可以用純CSS判斷鼠標進入的方向嗎？

雖然沒什麼軟用，但是對付面試官應該是夠用了。感謝面試官提出的問題，讓我實現了這個功能，對CSS

網絡工程師職業生涯中，哪兩點是最重要的？

網絡工程師最重要的技能是紮實的基礎和非常開放的思維，微觀知識紮實、宏觀能力突出。項目經驗也會讓網絡工程師基礎更牢靠，網絡工程師是要實戰的，要避免紙上談兵，我認為對基礎理論的理解，比你清楚配置更重要。

交換機中相關術語代表什麼意思，有必要弄清楚

由淺入深瞭解以太坊 2.0：最常見問題和最全學習清單

有關以太坊2.0

【Linux簡單實用小命令001】CentOS 7、8的防火牆端口開放

yuminstall

吃透這些IPFS硬核知識點，日後搶頭礦隨時“彎道超車”

今天的你捉住IPFS機遇了嗎？我們都知道在Filecoin網絡中作為一名存儲礦工，信譽對於我們是非常重要的——信譽越高，爆塊幾率越大。那麼信譽系統現在怎麼樣了呢？

Hive分桶表

fieldsterminated

Spring中資源的加載原來是這麼一回事啊！

自己動手搭建郵件系統：怎樣讓Exchange Server 發出第一封郵件？

編輯Exchange

$【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫$

【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫

在阿里雲控制檯，我們能下載的文件是一個壓縮包，解壓之後，是.idb和.frm文件，你可能要問了，我可以直接把解壓好的問題件覆蓋到MySQL的data目錄下嗎？

NLP算法入門系列：隱含馬爾可夫鏈(HMM)模型的簡單介紹

即，最大化

第一章 Spring Framework概述

您可以在任何web

opencv人工智能深度學習這樣實現人臉的年齡檢測

前期的文章我們分享了人臉的識別以及如何進行人臉數據的訓練，本期文章我們結合人臉識別的模型進行人臉年齡的檢測人臉年齡的檢測步驟1、首先需要進行人臉的檢測2、把檢測到的人臉數據給年齡檢測模型去檢測3、把檢測結果呈現到圖片上人臉年齡檢測import

嵌入式linux網絡編程之——5年程序員給你深度講解socket套接字

圖8-1

深入瞭解ProcessFunction的狀態操作(Flink-1.10)

先反思為何會有上述疑惑上述疑惑產生的原因，應該是受到平時使用HashMap的影響，HashMap獲取值就是在調用get方法時指定key，設置值也是在put時指定key，所以看到state.value，看懂了這些，其實也是在瞭解DataStream/DataSetAPI的設計思路：

Redis內存分析工具--rdr安裝與使用

分析Redis

資深架構師教你源碼講解zookeeper實現分佈式鎖以及集群搭建步驟

//getData發現前一個子節點被刪除，拋出異常

一行代碼提升遷移性能

論文原址：https://arxiv.org/pdf/2003.12237.pdf開源地址：https://github.com/cuishuhao/BNM在發表在CVPR2020

利用相似幾何信息，做可泛化3D形狀分割模型

更具體的有以下三種典型的分割方案：FullyConvolutional-Like

這麼好用的開源計算器SpeedCrunch，沒有不嘗試一下的道理

介紹SpeedCrunch是一款高精度科學計算器，具有快速，鍵盤驅動的用戶界面。獲取方式在GitHub上搜索SpeedCrunch，就可以去到

分佈式緩存，真香

他是前易寶支付架構師、阿里雲MVP、騰訊雲

特徵工程的力量

在本文中，我希望教給您一些有關特徵工程的知識，以及如何使用它來對非線性決策邊界進行建模。為了說明這一點，假設恢復時間與身高和體重具有以下關係：Y=β₀+β₁+β2+β₃+noise從第三項來看，我們可以看到Y與身高和體重沒有線性關係。

java架構：天天寫面向接口編程，你考慮過性能嗎？大神都是這麼寫

public

SpringBoot如何優雅的使用RocketMQ

源碼編譯需要Maven3.2x，JDK8在根目錄進行打包:Copymvn-Prelease-all

css代碼規範工具stylelint

"mixin"