آموزش آپاچی کافکا – تحلیل داده های جریانی با Apache Kafka
5 ساعت
3.9
آپاچی کافکا چیست؟ یکی از بزرگترین چالشهای همراه با کلانداده، تحلیل دادهها است، اما پیش از تحلیل، ابتدا باید بتوان اطلاعات مورد نیاز را برای سیستم جمعآوری نموده و پس از پردازش، اطلاعات را در دسترس کاربران قرار داد، اینجا است که آپاچی کافکا (Apache Kafka) به کار میآید. کافکا برای مدیریت جریان بلادرنگ داده، جمعآوری دادههای کلان یا تحلیل بلادرنگ داده و یا هر دو به کار گرفته میشود. آپاچی کافکا ابتدا در سال 2011 در لینکدین (LinkedIn) به منظور رفع مشکل کندی زمان ضبط دادهها از روی وبسایت و همچنین مدیریت کردن سیستمهای پردازش رویدادهای بلادرنگ توسعه داده شد. در نهایت این سیستم به بنیاد نرمافزار آپاچی اهدا شد. اهمیت یادگیری آپاچی کافکا چیست؟ جالب است بدانید که امروزه یک سوم از شرکتهایی که نام آنها در فهرست Fortune 500 قرار دارد، از کافکا استفاده میکنند. این فهرست، ۱۰ شرکت اول گردشگری، ۷ بانک از فهرست ۱۰ بانک برتر، ۸ شرکت نخست بیمه از مجموع ۱۰ شرکت و ۹ شرکت از مجموع ۱۰ شرکت برتر حوزه تلکام را دربر میگیرد. کافکا امکان کار با Flume ،Flafka ،Spark Streaming ،Storm ،HBase ،Flink و Spark را برای ورودی بلادرنگ، تحلیل و پردازش جریانهای داده فراهم میکند. کافکا جریان دادهای است که برای تغذیه دریاچههای کلان داده Apache Hadoop به کار میرود. بروکرهای کافکا، جریانهای حجیم پیام را به منظور تحلیل آنها در هدوپ (Apache Hadoop) یا اسپارک پشتیبانی مینمایند. سادگی عملیات کافکا یکی از دلایل گسترش روزافزون کاربرد میتواند باشد، اما دلیل اصلی عمومیت آن، کارایی بسیار مناسب آن است. در این فرادرس چه چیزی یاد میگیریم؟ در این آموزش ابتدا با مفاهیم کلانداده و آپاچی کافکا آشنا میشویم؛ در گام بعدی آپاچی کافکا را نصب میکنیم و در ادامه با کافکا پرودیوسر، کافکا کانزیومر، کافکا اینترنال و اینترنال پراسسینگ کار خواهیم کرد.