Cloudera i NVIDIA przyspieszają Apache Spark. 4-krotnie wyższa wydajność danych dla AI bez zmian w kodzie

Cloudera, jedyna firma, wprowadzająca sztuczną inteligencję do danych niezależnie od ich lokalizacji, wprowadziła rozwiązanie zwiększające wydajność Apache Spark 4.1. Dzięki wykorzystaniu procesorów GPU NVIDIA w środowisku Cloudera Data Engineering użytkownicy mogą szybciej przetwarzać dane i przygotowywać je do zastosowań AI. Wtyczka NVIDIA cuDF dla Apache Spark będzie współpracować również z Cloudera Anywhere Cloud, umożliwiając usprawnienie procesów realizowanych z wykorzystaniem Spark bez konieczności modyfikowania istniejącego kodu w PySpark czy SQL. Usprawni to przygotowywanie danych do zastosowań AI, a jednocześnie ograniczy koszty infrastruktury chmurowej w środowiskach hybrydowych.
Przyspieszenie obliczeń Apache Spark bez zmian w kodzie
Przetwarzanie danych na dużą skalę za pomocą frameworka Apache Spark bywa czasochłonne i generuje wysokie koszty w infrastrukturze chmurowej. Dzięki zastosowaniu biblioteki NVIDIA cuDF bezpośrednio w Cloudera Data Engineering, przedsiębiorstwa mogą uzyskać do czterech razy wyższą wydajność w porównaniu ze standardowymi procesorami CPU. Integracja ta przebiega automatycznie i nie wymaga ręcznej konfiguracji sterowników ani wprowadzania zmian w istniejącym kodzie PySpark lub SQL. Pozwala to zespołom odpowiedzialnym za inżynierię danych na bezpośrednie przeniesienie istniejących zadań do wydajniejszego środowiska bez modyfikacji kodu czy sposobu pracy.
Optymalizacja wydatków i obsługa środowisk hybrydowych
Z przeprowadzonego przez firmę Cloudera badania The Great Re-Architecture Survey wynika, że 84% przedsiębiorstw odnotowało wzrost kosztów infrastruktury z powodu obciążeń związanych ze sztuczną inteligencją. Skrócenie czasu przetwarzania surowych informacji przekłada się bezpośrednio na ograniczenie wydatków na zasoby chmurowe oraz wzrost produktywności zespołów. W przeciwieństwie do rozwiązań ograniczonych do jednego dostawcy chmury publicznej, technologia ta działa w środowiskach hybrydowych. Mechanizm Cloudera Unified Data Fabric gwarantuje spójne zasady zarządzania oraz bezpieczeństwo klasy enterprise niezależnie od tego, czy dane znajdują się w chmurze prywatnej, publicznej, środowisku lokalnym czy na brzegu sieci.
Wydajności i wdrożenia
Przedstawiciele obu firm wskazują, że główną przeszkodą we wdrażaniu sztucznej inteligencji jest tempo przekształcania surowych danych w wiarygodne informacje. Leo Brunnick, Chief Product Officer w Cloudera, zauważył, że przyspieszenie procesów Apache Spark pozwala usunąć tę barierę i sprawniej przechodzić od przygotowania danych do ich analizy. Z kolei Pat Lee, Vice President w NVIDIA, podkreślił, że rozwiązanie umożliwia obniżenie kosztów bez konieczności modyfikowania choćby jednej linii kodu.
W przypadku wielu organizacji ograniczeniem w wykorzystaniu AI nie są same modele, lecz tempo, w jakim surowe dane można przekształcić w wiarygodne i użyteczne informacje. Przyspieszenie procesów Apache Spark w środowisku Cloudera Data Engineering pozwala usunąć tę barierę, dzięki czemu organizacje mogą szybciej przechodzić od przygotowania danych do ich analizy i wykorzystania w zastosowaniach AI, zachowując jednocześnie bezpieczeństwo, kontrolę nad danymi i spójność procesów operacyjnych – powiedział Leo Brunnick, Szef ds. rozwoju produktów w Cloudera.
Nowa funkcja będzie dostępna w usłudze Cloudera Data Engineering jako część Cloudera Anywhere Cloud, a prezentacje techniczne zaplanowano podczas wydarzeń NVIDIA GTC Berlin oraz Cloudera EVOLVE New York.




















