Apache Spark¶
Bu makalede
Bilgi
Apache Spark; gerçek zamanlı veri akışı işleme, makine öğrenimi ve veritabanı analizi gibi çeşitli görevler için kullanılabilecek, büyük veri işleme için güçlü ve hızlı bir motordur. Spark; Scala, Java, Python ve R dahil olmak üzere birden fazla programlama dilinde esnek bir API sunar.
Apache Spark'ın Temel Özellikleri¶
- Yüksek Performans: Spark, dağıtık veri işleme ve optimize edilmiş algoritmalar kullanarak büyük miktardaki verileri geleneksel çözümlerden daha hızlı işlemenize olanak tanır.
- Dağıtılabilirlik: Spark, birden fazla düğümden oluşan kümelerde çalışabilir ve böylece veri işlemeyi ihtiyaca göre ölçeklendirmenize olanak sağlar.
- Çeşitli API'ler: Spark, çeşitli programlama dillerinde API'ler sunarak farklı senaryolar ve geliştirme ekipleri için uygun hale gelir.
- Çeşitli Veri Türleri İçin Destek: Spark; yapılandırılmış veriler (tablolar), yapılandırılmamış veriler (metin, görüntüler) ve yarı yapılandırılmış veriler (JSON) dahil olmak üzere farklı veri türlerini işleyebilir.
- Spark GraphX: Büyük grafikler üzerinde işlemler yapılmasına olanak tanıyan grafiksel bir API.
Çalıştırma Özellikleri¶
| ID | Yazılım Adı | Uyumlu OS | VM | BM | VGPU | GPU | Min CPU (Çekirdekler) | Min RAM (GB) | Min HDD/SSD (GB) | Özel Alan Adı | Aktif |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 204 | Apache Spark | Ubuntu 22.04 | + | + | + | + | 6 | 8 | 160 | Hayır | SİPARİŞ VER |
Kontrol paneline erişim: https://spark{Server_ID_from_Invapi}.hostkey.in
Not
Aksi belirtilmedikçe, varsayılan olarak yazılımın geliştiricinin web sitesinden veya işletim sistemi depolarından en son sürümünü kuruyoruz.
Apache Spark Kurulumundan Sonra Başlarken¶
Siparişinizin ödemesini yaptıktan sonra, sunucu kullanıma hazır olduğunda e-posta yoluyla (kayıt sırasında kaydedilen adrese) bir bildirim alacaksınız. Bu bildirim, VPS IP adresini ve bağlantı için giriş bilgilerini içerecektir. Şirketimizin müşterileri, ekipmanlarını server control panel and API - Invapi üzerinden yönetirler.
Kimlik doğrulama verilerini, sunucu kontrol panelindeki Configuration >> Tags sekmesinde veya sunucu kullanıma hazır olduğunda size gönderilen e-postada bulabilirsiniz:
- Apache Airflow web arayüzüne erişim bağlantısı: tag webpanel içindeki link;
- Login ve Password: sunucu kullanıma hazır olduğunda kayıtlı e-posta adresinize gönderilen e-postada sağlanır.
Apache Spark Yapılandırması¶
Spark, yerel bir bilgisayarda veya dağıtık bir ortamda başlatılabilir. webpanel tag içindeki bağlantıya tıklamadan önce şunları yapmanız gerekir:
Sunucuya SSH üzerinden bağlanın:
Ardından, Bileşenleri Başlatma bölümündeki tablodaki komutu kullanarak gerekli uygulamayı başlatın.
Aksi takdirde, bağlantıya tıklamak 502 (Bad Gateway) hatası verecektir.
Bileşenleri Başlatma¶
Aşağıdaki tablodaki komutları kullanarak Application, Standalone Master, Standalone Worker ve History Server gibi çeşitli Spark bileşenlerini bir web arayüzü ile başlatabilirsiniz.
| Name | Local Address and Port | External Address | Launch Command |
|---|---|---|---|
| Application | localhost:4040 | https://spark{Server_ID_from_Invapi}.hostkey.in | /root/spark-3.5.3-bin-hadoop3/bin/./spark-shell |
| Standalone Master | localhost:8080 | https://spark{Server_ID_from_Invapi}.hostkey.in/master | /root/spark-3.5.3-bin-hadoop3/sbin/./start-master.sh |
| Standalone Worker | localhost:8081 | https://spark{Server_ID_from_Invapi}.hostkey.in/worker | /root/spark-3.5.3-bin-hadoop3/sbin/./start-master.sh spark://hostname:port |
| History Server | localhost:18080 | https://spark{Server_ID_from_Invapi}.hostkey.in/history | mkdir /tmp/spark-events/root/spark-3.5.3-bin-hadoop3/sbin/./start-history-server.sh |
Lütfen Spark bileşenlerini başlatmak için kullanılan komutların kullanılan sürüme bağlı olarak değişebileceğini unutmayın. Yukarıdaki örnekler Spark 3.5.3 sürümünü kullanmaktadır. Spark'ı güncellerken, komutlardaki yolları buna göre ayarlamanız gerekecektir. Bileşen başlatma komutları hakkında en doğru bilgiler için her zaman en güncel Spark dokümantasyonuna danışmanız önerilir. Sürümü kontrol etmek için sunucuya SSH ile bağlanın ve şu komutu girin:
Bu komutun çıktısı, yüklü sürümü içeren spark dizini de dahil olmak üzere /root dizininin içeriğini listeleyecektir:

Spark bileşenlerini başlattıktan sonra, belirtilen harici adresler üzerinden web arayüzlerine erişebilirsiniz. Spark Application arayüzü örneğini inceleyin:

Bu örnek, https://spark{Server_ID_from_Invapi}.hostkey.in adresinde erişilebilen Spark Application arayüzünü göstermektedir. Bu arayüz; çalışan görevler, işleme aşamaları, bellek kullanımı ve diğer temel metrikler hakkında bilgi görüntüler.
Bu arayüzdeki diğer Spark bileşenlerine (örneğin Standalone Master veya Worker) verilen bağlantıların, başka bir makineden bağlanırken çalışmayacağını belirtmek önemlidir. Bu durum güvenlik ayarlarından kaynaklanmaktadır: bileşenler yerel çalışma için yapılandırılmıştır ve yalnızca alan adı üzerinden erişilebilen web arayüzü dış dünyaya açıktır.
Bu yapılandırmayı değiştirmek ve tüm bileşenlere harici erişimi etkinleştirmek için aşağıdaki adımları izlemeniz gerekir:
/root/nginxdizinindedocker compose up downkomutunu çalıştırarak mevcut Docker konteynerini durdurun ve kaldırın./etc/environmentdosyasındanSPARK_LOCAL_IP="127.0.0.1"satırını silin.
Bu değişikliklerden sonra Spark web arayüzüne, SSL sertifikası olmadan beyaz IP adresi üzerinden erişilebilecektir. Bu modifikasyon, çalışma sırasında oluşması durumunda bileşenler arasındaki bağlantı sorunlarını da çözebilir.
Not
Bu yapılandırmanın Spark kümesinin güvenlik seviyesini düşürdüğünü unutmamak önemlidir. Yalnızca gerektiğinde ve güvenli bir ağ ortamında kullanılmalıdır. Bu yapılandırmayı kullanıyorsanız, Spark'ın kendi içinde SSL bağlantılarını yapılandırmayı veya kümeyi korumak için diğer güvenlik önlemlerini uygulamayı düşünün.
Yolları Özelleştirme¶
/root/nginxdizinindedocker compose up downkomutunu çalıştırarak Docker konteynerini durdurun。- Nginx yapılandırma dosyasında gerekli düzenlemeleri yapın:
/data/nginx/user_conf.d/spark{Server_ID_from_Invapi}.hostkey.in.conf. /root/nginxdizinindendocker compose up -dkomutunu kullanarak Docker konteynerini yeniden başlatın。
Not
Temel Apache Spark ayarları hakkında ayrıntılı bilgi, geliştirici dokümantasyonunda bulunabilir.
API Kullanarak Apache Spark İçeren Bir Sunucu Sipariş Etme¶
Bu yazılımı API kullanarak kurmak için bu talimatları izleyin。