Sprawdź 108 GWARANTOWANYCH TERMINÓW SZKOLEŃ na rok 2026! Dofinansowanie do 100% — sprawdź możliwości z BUR i KFS!
22 299 53 69
Szkolenie Big Data

Przetwarzanie danych Big Data z Apache Spark - techniki zaawansowane i optymalizacja

Szkolenie poświęcone jest Apache Spark - nowoczesnemu narzędziu do przetwarzania danych, wykorzystywanym przez czołowe firmy z Doliny Krzemowej. Szkolenie odbędzie się w oparciu o...

więcej →

Program, termin i format dostosujemy do Twojego zespołu

1800 PLN netto 2 214 PLN brutto Dofinansowanie BUR/KFS
Czas trwania 2 dni
Dawid Grześków
Dawid Grześków Autor szkolenia

Najbliższe terminy 9:00 – 16:00

24.08 –
Gwarantowany Online
Termin niegwarantowany
Kliknij aby przejść do formularza zapisu
16.11 –
Gwarantowany Online
Termin niegwarantowany
Kliknij aby przejść do formularza zapisu
Powiadamiaj mnie o nowych terminach gwarantowanych tego szkolenia

Powiadomienia o terminach gwarantowanych

Na podany adres e-mail będziesz otrzymywać informacje o pojawiających się terminach gwarantowanych szkolenia Przetwarzanie danych Big Data z Apache Spark - techniki zaawansowane i optymalizacja.

Z powiadomień możesz wypisać się w dowolnym momencie.

Zorganizuj to szkolenie tylko dla swojego zespołu

To szkolenie można zorganizować w formie zamkniętej — z programem dopasowanym do potrzeb Twojego zespołu, w uzgodnionym terminie i formacie.

Dowiedz się więcej

Opis szkolenia


O szkoleniu w skrócie

Szkolenie poświęcone jest Apache Spark - nowoczesnemu narzędziu do przetwarzania danych, wykorzystywanym przez czołowe firmy z Doliny Krzemowej. Szkolenie odbędzie się w oparciu o platformę Databricks, a jego głównym celem jest optymalizacja czasu wykonywania kodu, przy zachowaniu optymalnego kosztu korzystania z narzędzia. To dwudniowe szkolenie skupia się na przedstawieniu szeregu technik pozwalających zapewnić optymalne procesowania danych, przy jednoczesnym zachowaniu wysokiej czystości kodu.


Cel szkolenia

Praca z systemem Spark oraz platformą Databricks. Opanowanie praktycznych umiejętności niezbędnych do skutecznej realizacji projektów danowych w nowoczesnym środowisku, które kształtuje współczesne standardy w obszarze Big Data. Szkolenie uzupełnia wiedzę z zawartą w "Szkolenie Podstawowe Spark" kładąc nacisk na metody optymalizacji wydajności w procesowaniu danych.


Dla kogo przeznaczone jest szkolenie?

  • Inżynierów Danych , którzy chcą pogłębić swoją wiedzę o Apache Spark, ze szczególnym naciskiem na optymalizację kodu
  • Specjalistów Data Science , pragnących lepiej zrozumieć Apache Spark i nauczyć się samodzielnie optymalizować kod w celu zwiększenia wydajności swoich projektów

Gdzie użyjesz nabytej wiedzy?

  • W codziennej pracy z Platformą Databricks oraz Sparkiem
  • W projektach wymagających elastycznego podejścia pod kątem wykorzystywanych zasobów
  • Przy budowaniu systemów analitycznych dla firmy

Czego się nauczysz?

  • Optymalizacji kosztów i wydajności w chmurze - dzięki umiejętności efektywnego zarządzania zasobami Spark na platformie Databricks
  • Optymalizacji egzekucji kodu - co pozwoli widocznie skrócić potrzebny do wykonania procesowania danych
  • Efektywnego debugowania kodu - co pozwoli na ograniczenie błędów oraz ułatwi wprowadzenie nowej funkcjonalności
  • Odnajdowania "wąskich gardeł" w procesie - na przykładach pokażę Ci jak odnajdywać operacje, które ograniczają zdolność i przepustowość całego programu

Wymagania co do uczestnika

  • Podstawowa znajomość Sparka/Databricks; idealnie - uczestnictwo w poprzednim szkoleniu "Szkolenie Podstawowe Spark"
  • Znajomość SQL
  • Podstawowa znajomość Pythona
  • Podstawowa znajomość Git
  • Założenie konta na GitHub
  • Podstawowa znajomość technologii chmurowych nie jest obowiązkowa, ale przydatna


Terminy i definicje

System Rozproszony
System rozproszony to zbiór niezależnych komputerów lub urządzeń, które współpracują ze sobą poprzez sieć komputerową, tworząc logiczną całość. Każdy węzeł w systemie może działać niezależnie, ale wszystkie razem realizują wspólne cele.

Spark
Apache Spark to potężne, masowo skalowalne środowisko do przetwarzania danych, które umożliwia efektywne przetwarzanie dużych zbiorów danych w pamięci oraz na dysku. Jest podstawowym komponentem platformy Databricks.

Databricks
Databricks to platforma do zarządzania danymi, która łączy zalety systemów data lake i data warehouse. Wykorzystuje Apache Spark jako silnik przetwarzania i zapewnia scentralizowane środowisko do analizy danych, uczenia maszynowego i biznesowych zastosowań analitycznych.

Data Lake (jezioro danych)
Data Lake to centralne repozytorium danych przechowujące duże ilości danych w ich pierwotnej, surowej formie. W przeciwieństwie do tradycyjnych hurtowni danych, które wymagają uprzedniej strukturyzacji danych, data lake może przechowywać dane w dowolnym formacie, w tym: strukturyzowane, półstrukturyzowane i niestrukturyzowane.

DAG (Directed Acyclic Graph)
W Spark to podstawowa koncepcja reprezentująca plan wykonania zadania. Jest to graf operacji które, są wykonywane w określonej kolejności, jednocześnie nie zawiera cykli ani pętli w planie wykonania.W Apache Spark DAG składa się z zestawu Jobów, Stagów oraz Tasków.



Przejdź do programu szkolenia

Prowadzący szkolenie

Dawid Grześków

Dawid Grześków

Specjalista IT z pięcioletnim doświadczeniem w środowisku danowym. W swojej karierze przeszedłem przez budowanie narzędzi wewnętrznych, analitykę oraz tworzenie systemów raportowych. Aktualnie pracuje jako Inżynier Danych, gdzie Spark i Databricks stanowią moje główne narzędzia pracy.

Na co dzień pracuje z technologiami chmurowymi na platformie Azure. Programuje w Pythonie, SQL oraz Sparku. Tworzę modele, hurtownie oraz jeziora danych. Integruję rozwiązania DevOps z procesami biznesowymi. Tworzę zaplecza całych platform i rozwijam procesy integracyjne.

Projekty w których brałem udział to m.in.:

  • Integracja przepływów danych wspierających mi.n. SAPa, procesy korporacyjne
  • Budowanie jezior danych w celu scentralizowania zasobów przedsiębiorstwa
  • Budowanie modeli analitycznych, które dotychczas były niemożliwe do zrealizowania bez Sparka.
  • Wdrażanie rozwiązań DevOps/DataOps

Posiadam doświadczenie pracy w międzynarodowych firmach, gdzie wspierałem zespoły w przyswajaniu wiedzy procesowej oraz narzędziowej. Jako praktyk, wychodzę z założenia, że tylko praktyczne szkolenia dają satysfakcjonujące efekty.

Program szkolenia


  • Wprowadzenie do notebooków
    • Przedstawienie kodu i założeń jakie program musi wykonać

  • Omówienie jak Spark planuje wykonanie kodu
    • Driver i Executory
      • Omówienie pracy poszczególnych komponentów
    • Diagram DAG
      • Przedstawienie poszczególnych elementów składowych: Job, Stage, Task
    • Analiza pierwotnej egzekucji z SparkUI
    • Akcje i Transformacje
      • Optymalizacja planu wykonania kodu w Apache Spark
    • Omówienie jak działa partycjonowanie danych w Sparku
    • Warsztat

  • Usprawnianie Joinów
    • Rodzaje joinów
    • Problem data skewness (niesymetryczność danych)
    • Optymalizacja

  • Omówienie jak działa cache, persist oraz checkpoint w Sparku
    • Scenariusze kiedy warto zastosować przedstawione techniki

  • Optymalizacja pracy klastra
    • Wybór odpowiedniego typu klastra
    • Dobieranie właściwej instancji workerów i drivera

  • Warsztat

  • Porównanie rezultatów przed vs po optymalizacji

Zainteresowany? Zapisz się na szkolenie!

Zapisz się — wybierz termin

Szkolenie Przetwarzanie danych Big Data z Apache Spark - techniki zaawansowane i optymalizacja realizowane tylko dla pracowników Twojej firmy?

To szkolenie możemy zorganizować w formie zamkniętej — wyłącznie dla Twojego zespołu. Doświadczony trener-praktyk poprowadzi szkolenie skrojone pod potrzeby Twojej organizacji:

  • Program dopasujemy do potrzeb i poziomu uczestników
  • Termin ustalimy indywidualnie, pod Twój kalendarz
  • Format do wyboru: online na żywo lub stacjonarnie w Twojej lub naszej siedzibie

Zamów bezpłatną, niezobowiązującą wycenę szkolenia zamkniętego.

Zapytaj o bezpłatną wycenę szkolenia
Szkolenie dedykowane dla Twojego zespołu Dopasowany program, termin i format. Napisz lub zadzwoń — wspólnie dobierzemy rozwiązanie dla Twoich pracowników.

Terminy gwarantowane

Szkolenia oznaczone jako "termin gwarantowany" odbędą się w zaplanowanym terminie niezależnie od liczby zgłoszonych uczestników. Nie musisz się martwić, że szkolenie zostanie odwołane z powodu zbyt małej liczby zapisanych osób.

Szkolenia online

Szkolenie realizowane jest w formie zdalnej na żywo poprzez platformę ZOOM. Trener prowadzi szkolenie na żywo, a uczestnicy mogą na bieżąco zadawać pytania i wykonywać ćwiczenia. Format online zapewnia pełną interakcję z trenerem, identyczną jak przy szkoleniu stacjonarnym.

Szkolenie na żywo z trenerem — nie kurs video

To nie jest nagrany kurs video. Przez cały czas trwania szkolenia masz bezpośredni kontakt z doświadczonym trenerem-praktykiem. Możesz na bieżąco zadawać pytania, prosić o wyjaśnienie trudnych zagadnień, konsultować własne projekty i uzyskać odpowiedź na dowolne pytanie związane z tematyką szkolenia. To realne wsparcie eksperta, którego nie zapewni żaden kurs nagrany.

Certyfikat ukończenia szkolenia

Każdy uczestnik po ukończeniu szkolenia otrzymuje imienny certyfikat potwierdzający udział i zdobyte kompetencje. Certyfikat wystawiany jest przez JSystems — firmę z certyfikatem ISO 9001 — i jest honorowany przez pracodawców.

Środowisko robocze

Nie jest wymagane instalowanie żadnego oprogramowania. Każdy uczestnik szkolenia otrzymuje dostęp do gotowego środowiska w chmurze, skonfigurowanego na potrzeby szkolenia. Dostęp realizowany jest poprzez przeglądarkę lub zdalny pulpit, w zależności od szkolenia.

Sprawdź pozostałe szkolenia z kategorii:

Big Data

Opinie uczestników

5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Kompletne, elastyczne z dużą interakcją na zapytania uczestników.

Wojciech Brożyński Energa-Operator S.A.
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Świetne szkolenie, bardzo dobre materiały, rewelacyjny prowadzący posiadający ogromną wiedzę teoretyczną jak i praktyczną.

Jacek Kuligowski Energa-Operator S.A.
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Pan Arek to dobry trener, wie co mówi :)

Szymon Nowacki Energa-Operator S.A.
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Prowadzący bardzo sympatyczny, dobrze przekazywał wiedzę i tłumaczył

Zuzanna Motylińska Asseco Poland S.A.
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Polecam , szkolenie przeprowadzone przez osobe z duza wiedza i bogatym doswiadczeniem , ciekawe zagadnienia i rozwiazania

Arlan Akhmet Ornsson Solutions Sp. z o.o.
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Szkolenie bardzo fachowe, trener merytoryczny, ciekawa tematyka. Naprawdę warto.

Rafał Ślubowski Narodowy Bank Polski
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Szkolenie bardzo ciekawe, zachęcające to dalszego poszerzania swoich kompetencji w Big Data oraz w technologiach z nią związanych.

Mateusz Wiktorek OPITZ CONSULTING Polska Sp. z o.o.
5.0/5
Kompleksowe wprowadzenie do Big Data - szkolenie w formie warsztatowej

Bardzo dobrze przeprowadzone szkolenie. Bardzo użyteczne dla osoby początkującej w obszarze BigData. Pozwoliło na usystematyzowanie wiedzy zdobytej w innych źródłach i rozpoczęcie przygody praktycznej.

Radosław Laskowski Polish Airports Academy Sp. z o.o.
Pokaż wszystkie opinie Google Opinie w Google

Zaufali nam

...i wiele innych

5,0 - średnia ocena na podstawie 290 opinii

Dlaczego warto nas wybrać?

Terminy gwarantowane na 100%

Jeśli termin jest oznaczony jako gwarantowany, odbędzie się we wskazanym czasie — nawet jeśli część grupy wycofa się z udziału. Ryzyko organizacyjne ponosimy my, nie Ty.

100% format warsztatowy

Każde zagadnienie teoretyczne jest poparte ćwiczeniami praktycznymi o rosnącym poziomie trudności. Uczymy przez działanie, nie przez slajdy.

Trenerzy-praktycy z oceną min. 4.75/5

Każdy trener JSystems ma bogate doświadczenie komercyjne w technologiach których uczy i musi utrzymywać średnią z ankiet powyżej 4.75 na 5. Czerwony pasek to u nas minimum ;)

Gotowe środowiska w chmurze

Do każdego szkolenia wymagającego oprogramowania dostarczamy skonfigurowane, gotowe hosty w chmurze. Uczestnik nie musi nic instalować — łączy się przez zdalny pulpit lub SSH.

Dowiedz się dlaczego warto nas wybrać

A może nielimitowane szkolenia za
1 148 PLN brutto / mies.?
Sprawdź Karnet Open
KARNET OPEN na szkolenia
A może nielimitowane szkolenia za
1 148 PLN brutto / mies.?
Sprawdź Karnet Open
KARNET OPEN na szkolenia

📅 Przypomnij mi jutro

Wyślemy Ci przypomnienie z linkiem jutro rano.

Zanim wyjdziesz

Wyślemy Ci podsumowanie tego szkolenia z terminami i ceną — do przemyślenia w spokoju.

Żadnego spamu — tylko jedno podsumowanie.