Ana içeriğe geç

Apache Spark

Bu makalede

Bilgi

Apache Spark; gerçek zamanlı veri akışı işleme, makine öğrenimi ve veritabanı analizi gibi çeşitli görevler için kullanılabilecek, büyük veri işleme için güçlü ve hızlı bir motordur. Spark; Scala, Java, Python ve R dahil olmak üzere birden fazla programlama dilinde esnek bir API sunar.

Apache Spark'ın Temel Özellikleri

  • Yüksek Performans: Spark, dağıtık veri işleme ve optimize edilmiş algoritmalar kullanarak büyük miktardaki verileri geleneksel çözümlerden daha hızlı işlemenize olanak tanır.
  • Dağıtılabilirlik: Spark, birden fazla düğümden oluşan kümelerde çalışabilir ve böylece veri işlemeyi ihtiyaca göre ölçeklendirmenize olanak sağlar.
  • Çeşitli API'ler: Spark, çeşitli programlama dillerinde API'ler sunarak farklı senaryolar ve geliştirme ekipleri için uygun hale gelir.
  • Çeşitli Veri Türleri İçin Destek: Spark; yapılandırılmış veriler (tablolar), yapılandırılmamış veriler (metin, görüntüler) ve yarı yapılandırılmış veriler (JSON) dahil olmak üzere farklı veri türlerini işleyebilir.
  • Spark GraphX: Büyük grafikler üzerinde işlemler yapılmasına olanak tanıyan grafiksel bir API.

Çalıştırma Özellikleri

ID Yazılım Adı Uyumlu OS VM BM VGPU GPU Min CPU (Çekirdekler) Min RAM (GB) Min HDD/SSD (GB) Özel Alan Adı Aktif
204 Apache Spark Ubuntu 22.04 + + + + 6 8 160 Hayır SİPARİŞ VER

Kontrol paneline erişim: https://spark{Server_ID_from_Invapi}.hostkey.in

Not

Aksi belirtilmedikçe, varsayılan olarak yazılımın geliştiricinin web sitesinden veya işletim sistemi depolarından en son sürümünü kuruyoruz.

Apache Spark Kurulumundan Sonra Başlarken

Siparişinizin ödemesini yaptıktan sonra, sunucu kullanıma hazır olduğunda e-posta yoluyla (kayıt sırasında kaydedilen adrese) bir bildirim alacaksınız. Bu bildirim, VPS IP adresini ve bağlantı için giriş bilgilerini içerecektir. Şirketimizin müşterileri, ekipmanlarını server control panel and API - Invapi üzerinden yönetirler.

Kimlik doğrulama verilerini, sunucu kontrol panelindeki Configuration >> Tags sekmesinde veya sunucu kullanıma hazır olduğunda size gönderilen e-postada bulabilirsiniz:

  • Apache Airflow web arayüzüne erişim bağlantısı: tag webpanel içindeki link;
  • Login ve Password: sunucu kullanıma hazır olduğunda kayıtlı e-posta adresinize gönderilen e-postada sağlanır.

Apache Spark Yapılandırması

Spark, yerel bir bilgisayarda veya dağıtık bir ortamda başlatılabilir. webpanel tag içindeki bağlantıya tıklamadan önce şunları yapmanız gerekir:

Sunucuya SSH üzerinden bağlanın:

ssh root@<server_ip>

Ardından, Bileşenleri Başlatma bölümündeki tablodaki komutu kullanarak gerekli uygulamayı başlatın.

Aksi takdirde, bağlantıya tıklamak 502 (Bad Gateway) hatası verecektir.

Bileşenleri Başlatma

Aşağıdaki tablodaki komutları kullanarak Application, Standalone Master, Standalone Worker ve History Server gibi çeşitli Spark bileşenlerini bir web arayüzü ile başlatabilirsiniz.

Name Local Address and Port External Address Launch Command
Application localhost:4040 https://spark{Server_ID_from_Invapi}.hostkey.in /root/spark-3.5.3-bin-hadoop3/bin/./spark-shell
Standalone Master localhost:8080 https://spark{Server_ID_from_Invapi}.hostkey.in/master /root/spark-3.5.3-bin-hadoop3/sbin/./start-master.sh
Standalone Worker localhost:8081 https://spark{Server_ID_from_Invapi}.hostkey.in/worker /root/spark-3.5.3-bin-hadoop3/sbin/./start-master.sh spark://hostname:port
History Server localhost:18080 https://spark{Server_ID_from_Invapi}.hostkey.in/history mkdir /tmp/spark-events
/root/spark-3.5.3-bin-hadoop3/sbin/./start-history-server.sh

Lütfen Spark bileşenlerini başlatmak için kullanılan komutların kullanılan sürüme bağlı olarak değişebileceğini unutmayın. Yukarıdaki örnekler Spark 3.5.3 sürümünü kullanmaktadır. Spark'ı güncellerken, komutlardaki yolları buna göre ayarlamanız gerekecektir. Bileşen başlatma komutları hakkında en doğru bilgiler için her zaman en güncel Spark dokümantasyonuna danışmanız önerilir. Sürümü kontrol etmek için sunucuya SSH ile bağlanın ve şu komutu girin:

ls /root

Bu komutun çıktısı, yüklü sürümü içeren spark dizini de dahil olmak üzere /root dizininin içeriğini listeleyecektir:

Spark bileşenlerini başlattıktan sonra, belirtilen harici adresler üzerinden web arayüzlerine erişebilirsiniz. Spark Application arayüzü örneğini inceleyin:

Bu örnek, https://spark{Server_ID_from_Invapi}.hostkey.in adresinde erişilebilen Spark Application arayüzünü göstermektedir. Bu arayüz; çalışan görevler, işleme aşamaları, bellek kullanımı ve diğer temel metrikler hakkında bilgi görüntüler.

Bu arayüzdeki diğer Spark bileşenlerine (örneğin Standalone Master veya Worker) verilen bağlantıların, başka bir makineden bağlanırken çalışmayacağını belirtmek önemlidir. Bu durum güvenlik ayarlarından kaynaklanmaktadır: bileşenler yerel çalışma için yapılandırılmıştır ve yalnızca alan adı üzerinden erişilebilen web arayüzü dış dünyaya açıktır.

Bu yapılandırmayı değiştirmek ve tüm bileşenlere harici erişimi etkinleştirmek için aşağıdaki adımları izlemeniz gerekir:

  1. /root/nginx dizininde docker compose up down komutunu çalıştırarak mevcut Docker konteynerini durdurun ve kaldırın.
  2. /etc/environment dosyasından SPARK_LOCAL_IP="127.0.0.1" satırını silin.

Bu değişikliklerden sonra Spark web arayüzüne, SSL sertifikası olmadan beyaz IP adresi üzerinden erişilebilecektir. Bu modifikasyon, çalışma sırasında oluşması durumunda bileşenler arasındaki bağlantı sorunlarını da çözebilir.

Not

Bu yapılandırmanın Spark kümesinin güvenlik seviyesini düşürdüğünü unutmamak önemlidir. Yalnızca gerektiğinde ve güvenli bir ağ ortamında kullanılmalıdır. Bu yapılandırmayı kullanıyorsanız, Spark'ın kendi içinde SSL bağlantılarını yapılandırmayı veya kümeyi korumak için diğer güvenlik önlemlerini uygulamayı düşünün.

Yolları Özelleştirme

  1. /root/nginx dizininde docker compose up down komutunu çalıştırarak Docker konteynerini durdurun。
  2. Nginx yapılandırma dosyasında gerekli düzenlemeleri yapın: /data/nginx/user_conf.d/spark{Server_ID_from_Invapi}.hostkey.in.conf.
  3. /root/nginx dizininden docker compose up -d komutunu kullanarak Docker konteynerini yeniden başlatın。

Not

Temel Apache Spark ayarları hakkında ayrıntılı bilgi, geliştirici dokümantasyonunda bulunabilir.

API Kullanarak Apache Spark İçeren Bir Sunucu Sipariş Etme

Bu yazılımı API kullanarak kurmak için bu talimatları izleyin。