27 sty, 2025

AI

Przygotowanie infrastruktury danych przedsiębiorstwa na potrzeby sztucznej inteligencji na dużą skalę

Przygotowanie infrastruktury danych przedsiębiorstwa na potrzeby sztucznej inteligencji na dużą skalę

Obciążenia sztucznej inteligencji generują ogromne ilości ustrukturyzowanych i nieustrukturyzowanych danych. Aby obsługiwać cykle szkolenia, wnioskowania i ponownego szkolenia, przedsiębiorstwa potrzebują skalowalnej pamięci masowej o dużej pojemności, która może obsługiwać ciągły wzrost ilości danych.

Nie ma sukcesu sztucznej inteligencji bez ogromnych ilości danych.

A bez odpowiedniego, wydajnego systemu przechowywania danych nie ma mowy o dużych zbiorach danych. Obciążenia sztucznej inteligencji tworzą ciągłe strumienie danych — od zestawów danych szkoleniowych i dzienników wnioskowania po metadane, osadzenia i wyniki modeli. W miarę rozwoju sztucznej inteligencji generatywnej i dużych modeli językowych (LLM) objętość i różnorodność danych przedsiębiorstw rosną wykładniczo. Tak szybkie skalowanie wymaga architektur pamięci masowych, które mogą obsługiwać ciągłe pobieranie danych, szybki dostęp i niezawodne przechowywanie w czasie.

Dane wspierają sztuczną inteligencję, a dyski twarde o dużej pojemności wspierają dane.

Spostrzeżenia te ujawnia badanie przeprowadzone w 2025 r. przez firmę badawczą Recon Analytics.

Globalne badanie przedstawia szczegóły dotyczące tego, w jaki sposób przedsiębiorstwa z różnych branż dostosowują swoją infrastrukturę, aby obsługiwać sztuczną inteligencję. Respondenci reprezentowali organizacje, które już korzystają ze sztucznej inteligencji lub planują ją wdrożyć, oferując wgląd w zapotrzebowanie na pamięć masową, wyzwania związane ze skalowaniem i przyszłość infrastruktury danych przedsiębiorstwa.

W globalnym badaniu zleconym przez Seagate wzięło udział 1062 respondentów. Są to nabywcy pamięci masowej IT oraz osoby decyzyjne, pracujące na stanowiskach związanych z infrastrukturą pamięci masowej w firmach, które osiągają roczne przychody przekraczające 10 milionów dolarów, mają obecne zużycie pamięci masowej przekraczające 50 terabajtów (TB), wdrożyły sztuczną inteligencję lub planują wdrożyć ją w ciągu najbliższych trzech lat i mają siedzibę w Stanach Zjednoczonych, Chinach, Wielkiej Brytanii, Korei Południowej, Singapurze, Francji, Indiach, Japonii, Tajwanie i Niemczech.

Badanie koncentrowało się na wpływie wdrożenia sztucznej inteligencji na priorytety infrastrukturalne, przechowywanie danych i zarządzanie danymi. Wyniki rzucają światło na to, jak sztuczna inteligencja wpłynie na potrzeby infrastrukturalne w ciągu najbliższych trzech lat.

Wnioski z globalnego badania: Jak wdrażanie sztucznej inteligencji zmieni infrastrukturę danych

Najnowsze badanie Recon Analytics ujawnia zasadniczą zmianę w sposobie, w jaki przedsiębiorstwa planują swoje ekosystemy danych na erę sztucznej inteligencji. Zamiast traktować sztuczną inteligencję jako odosobnioną inicjatywę, organizacje dokonują obecnie ponownej oceny strategii przechowywania danych, alokacji zasobów i długoterminowego projektowania infrastruktury w odpowiedzi na przyspieszenie wdrażania sztucznej inteligencji. Badanie pokazuje, w jaki sposób światowi liderzy IT przygotowują się na przyszłość, w której wzrost danych, wymagania dotyczące ich przechowywania i oczekiwania dotyczące wydajności będą rosły szybciej niż kiedykolwiek wcześniej.

Wzrost danych AI do roku 2028: Dlaczego zapotrzebowanie na pamięć masową AI rośnie

Przede wszystkim badanie wykazało, że przyjęcie sztucznej inteligencji będzie wspierać wykładniczy wzrost popytu na pamięć masową do 2028 roku.

Aż 61% respondentów z firm, które korzystają głównie z pamięci masowej w chmurze, stwierdziło, że w ciągu najbliższych trzech lat ilość pamięci masowej w chmurze w ich firmach musiałaby wzrosnąć o ponad 100% — czyli podwoić się.

Wykres słupkowy pokazuje, jak bardzo firmy spodziewają się zmian w zakresie potrzeb w zakresie przechowywania danych w ciągu najbliższych trzech lat – od spadku/braku zmian do 100%.

Rysunek 1. 61% respondentów, których przedsiębiorstwa wykorzystują chmurę przede wszystkim do zarządzania danymi AI, spodziewa się zwiększenia wymagań dotyczących pamięci masowej o co najmniej 100%.

Dlaczego długoterminowe przechowywanie danych zwiększa dokładność i wiarygodność sztucznej inteligencji

W miarę jak zastosowania sztucznej inteligencji generują niespotykane dotąd ilości danych, im więcej danych przechowują organizacje, tym bardziej mogą one potwierdzić, że sztuczna inteligencja działa zgodnie z oczekiwaniami. Dzięki dostępowi do danych behawioralnych — takich jak zestawy danych szkoleniowych, punkty kontrolne modeli, podpowiedzi i odpowiedzi — firmy mogą analizować algorytmy oraz lepiej rozumieć i udoskonalać proces podejmowania decyzji przez sztuczną inteligencję. Bez skali i wydajności centrów danych potencjał sztucznej inteligencji byłby ograniczony, ponieważ możliwość przechowania i udostępniania ogromnych zbiorów danych ma kluczowe znaczenie dla właściwego działania sztucznej inteligencji.

Nie tylko ilość pamięci masowej decyduje o sukcesie sztucznej inteligencji. Czas przechowywania danych również ma znaczenie.

Branże takie jak finanse, opieka zdrowotna, produkcja i działalność administracyjna zależą od długoterminowego przechowywania danych, aby spełniać wymogi zgodności i potrzeby audytowe. Przechowywanie danych historycznych wzmacnia ramy zarządzania, ułatwia sprawozdawczość regulacyjną i sprawia, że ​​wyniki sztucznej inteligencji stają się z czasem dokładniejsze.

Spośród respondentów ankiety zatrudnionych w firmach, które wdrożyły technologię sztucznej inteligencji, 90% uważa, że ​​dłuższe przechowywanie danych poprawia jakość wyników sztucznej inteligencji.

Infografika przedstawia podział osób, które uważają, że dłuższy czas przechowywania danych poprawia wyniki stosowania sztucznej inteligencji. Aż 90% firm wykorzystujących sztuczną inteligencję odpowiada twierdząco.

Rysunek 2. 90% firm korzystających obecnie ze sztucznej inteligencji uważa, że ​​przechowywanie większej ilości danych historycznych zwiększa dokładność modelu.

To odkrycie wskazuje na korelację między przechowywaniem danych przez dłuższe okresy a bardziej niezawodnymi informacjami uzyskiwanymi na podstawie sztucznej inteligencji. Może to wynikać z kilku czynników. Po pierwsze, stałe iteracyjne przetwarzanie danych jest nieodłączną częścią działania algorytmów AI. Treści wyjściowe są przesyłane z powrotem do modelu, co poprawia jego dokładność i umożliwia tworzenie nowych modeli. Surowe zbiory danych i wyniki stają się źródłem dla dalszego rozwoju i nowych przepływów roboczych.

Rola pochodzenia danych, zgodności i ochrony własności intelektualnej w godnej zaufania sztucznej inteligencji

Jednak dłuższe przechowywanie zbiorów danych służy również innym ważnym funkcjom biznesowym, ponieważ chroni własność intelektualną firmy. Przechowuje „potwierdzenia” oryginalnych zestawów danych i procesów modelu, dostarczając w razie potrzeby wyjaśnienia wyników (np. w ramach postępowania prawnego).

Potwierdzenia te ustalają pochodzenie danych, przedstawiając przejrzysty zapis przebiegu danych od wejścia do wyjścia. Pochodzenie danych pozwala organizacjom śledzić pochodzenie i wykorzystanie zestawów danych, dzięki czemu modele sztucznej inteligencji są budowane w oparciu o dokładne dane. Umożliwia pełną audytowalność systemów AI oraz wspiera zgodność z przepisami i wewnętrzną rozliczalność.

Ponadto firmy mogą zdecydować się na przechowywanie większej ilości danych przez dłuższy czas, ponieważ zdają sobie sprawę, że dzisiaj nie mogą wiedzieć, jakie nowe, cenne spostrzeżenia algorytmy jutra mogą uzyskać z wczorajszych danych. Dłuższy okres przechowywania danych pozwala na przetwarzanie starych danych przez nieopracowane jeszcze modele sztucznej inteligencji. Z tych powodów dłuższe przechowywanie danych zwiększa wartość biznesową, jaką może zapewnić sztuczna inteligencja.

W powiązanym badaniu decydenci w dziedzinie infrastruktury uznali, że dłuższe przechowywanie danych jest niezbędne do budowania zaufania — kluczowego fundamentu, bez którego wnioski z analiz AI mają niewielką wartość.

88% respondentów, których firmy korzystają obecnie ze sztucznej inteligencji, uważa, że wdrożenie godnej zaufania sztucznej inteligencji zwiększa potrzebę przechowywania większej ilości danych przez dłuższe okresy.

Wykres pokazuje, że 88% firm wdrażających sztuczną inteligencję uważa, że ​​wymogi dotyczące zaufania i zarządzania spowodują konieczność dłuższego okresu przechowywania danych.

Rysunek 3. 88% respondentów, których firmy korzystają obecnie ze sztucznej inteligencji, stwierdziło, że wdrożenie godnej zaufania sztucznej inteligencji wiąże się ze zwiększoną potrzebą przechowywania większej ilości danych przez dłuższy czas.

Seagate definiuje godną zaufania sztuczną inteligencję jako przepływy pracy i modele danych sztucznej inteligencji, które wykorzystują niezawodne dane wejściowe i generują wiarygodne wnioski. Godna zaufania sztuczna inteligencja bazuje na danych, które spełniają następujące kryteria:

  • Wysoka jakość i dokładność
  • Jasne informacje o legalności, własności i pochodzeniu
  • Bezpieczne przechowywanie i ochrona
  • Wyjaśnialne i śledzone transformacje algorytmu
  • Spójne i niezawodne wyniki przetwarzania danych

Skalowalna infrastruktura pamięci masowej wspiera godne zaufania rozwiązania sztucznej inteligencji, ponieważ umożliwia prawidłowe zarządzanie, przechowywanie i zabezpieczanie ogromnych ilości danych wykorzystywanych przez systemy sztucznej inteligencji.

W ramach budowania godnej zaufania sztucznej inteligencji 80% respondentów ankiety podkreśliło znaczenie punktów kontrolnych.

Punkty kontrolne: Dlaczego częste tworzenie migawek modeli wymaga niezawodnego i pojemnego dysku twardego

Tworzenie punktów kontrolnych to proces zapisywania stanu modelu AI w określonych, krótkich odstępach czasu podczas jego trenowania. Modele sztucznej inteligencji są trenowane na dużych zbiorach danych za pomocą iteracyjnych procesów, które mogą trwać od kilku minut do kilku miesięcy. Czas trwania szkolenia modelu zależy od jego złożoności, rozmiaru zbioru danych i dostępnej mocy obliczeniowej. W tym czasie do modeli wprowadzane są dane, parametry są dostosowywane, a system uczy się, jak przewidywać wyniki na podstawie przetworzonych informacji.

  • Punkty kontrolne działają zasadniczo jak migawki bieżącego stanu modelu — jego danych, parametrów i ustawień — w wielu punktach podczas szkolenia. Regularne zapisywanie migawek pozwala zachować zapis postępu modelu i chroni przed utratą danych spowodowaną nieoczekiwanymi przerwami.

Z badania wynika, że ​​firmy wykorzystujące ponad 100 PB pamięci masowej zapisują i tworzą kopie zapasowe punktów kontrolnych codziennie lub co tydzień, przy czym 87% z nich przechowuje te punkty kontrolne w chmurze lub na połączeniu dysków twardych i dysków SSD.

Aby obsługiwać punkty kontrolne na taką skalę, przedsiębiorstwa potrzebują systemów pamięci masowej zdolnych do podtrzymywania ciągłej aktywności zapisu bez zakłócania postępu modelu. Dyski twarde o dużej pojemności i hybrydowa architektura chmurowa zapewniają niezawodność i opłacalność niezbędne do utrzymania tak szybkich cykli migawek. Dzięki ciągłemu rejestrowaniu i ochronie punktów kontrolnych organizacje mogą zabezpieczać postępy szkoleń, przyspieszać odzyskiwanie danych po przerwach i utrzymywać stabilne, przewidywalne przepływy prac związanych z rozwojem sztucznej inteligencji.

Pamięć masowa: Tajny czynnik napędzający skalowalne i ekonomiczne systemy AI

Przetwarzanie danych i energia to popularne tematy w dyskusjach na temat wdrażania sztucznej inteligencji. Jednak badanie Recon Analytics podkreśla, że ​​kluczowym czynnikiem jest pamięć masowa.

  • Z perspektywy nabywców infrastruktury pamięć masowa danych zajmuje drugą pozycję w rankingu infrastruktury AI, zaraz po bezpieczeństwie. Na kolejnych miejscach pod względem ważności znalazły się zarządzanie danymi, przepustowość sieci, moc obliczeniowa, przepisy, wykonalność LLM i energia.
  • Dwie trzecie (66%) respondentów uznało przechowywanie danych za drugi najważniejszy czynnik wśród czterech najważniejszych czynników umożliwiających rozwój sztucznej inteligencji oraz za czwartą najpoważniejszą barierę utrudniającą wdrożenie tej technologii.
Poziomy wykres słupkowy przedstawiający, w jaki sposób respondenci ankiety oceniają przypadki użycia sztucznej inteligencji w kontekście czterech najważniejszych priorytetów.

Rysunek 4. 66% decydentów w dziedzinie infrastruktury uznało pamięć masową za drugi najważniejszy element wśród czterech najważniejszych czynników wspomagających sztuczną inteligencję. Stwierdzili również, że pamięć masowa jest czwartą najważniejszą barierą we wdrażaniu sztucznej inteligencji.

„Zasadniczo wyniki badania wskazują na nadchodzący wzrost popytu na pamięć masową danych, przy czym dyski twarde wyłaniają się jako zdecydowany zwycięzca tej sytuacji. Jeśli weźmiemy pod uwagę, że ankietowani przez nas liderzy przedsiębiorstw zamierzają przechowywać coraz więcej danych opartych na sztucznej inteligencji w chmurze, usługi chmurowe są dobrze przygotowane na drugą falę wzrostu.


Założyciel i główny analityk Recon, Roger Entner, opisuje najważniejsze wnioski w następujący sposób:

Aby maksymalnie wykorzystać sztuczną inteligencję, przedsiębiorstwa muszą przygotować skalowalną i wydajną pamięć masową danych. Niezależnie od tego, czy bezpośrednio, czy za pośrednictwem usług w chmurze, zależność sztucznej inteligencji od danych opiera się na dyskach twardych — oferujących niezrównaną pojemność, efektywność kosztową i zrównoważony rozwój — jako podstawie godnej zaufania sztucznej inteligencji.

Dyski twarde zapewniają bezkonkurencyjny stosunek ceny do TB w przypadku pamięci masowej na potrzeby sztucznej inteligencji. Dyski twarde o dużej pojemności oferują optymalną równowagę między skalowalnością, efektywnością energetyczną i zrównoważonym rozwojem, umożliwiając przedsiębiorstwom rozbudowę pamięci masowej bez przekraczania budżetu lub ograniczeń energetycznych.