Kim są DataScientists i ML Engineers?

Dec 28 2022
Obalamy mity dzięki wartościowemu doświadczeniu W świecie wykorzystywania informacji z danych, czerpania wartości ze spostrzeżeń i zwiększania przychodów biznesowych, firmy zrozumiały, że wartość przechwytywania, przechowywania i przekształcania danych może naprawdę zmienić reguły gry. Istnieje ocean informacji krążących wokół ścieżek kariery dla inżynierów lub osób niebędących inżynierami, które mogą przyczynić się do rozwoju sztucznej inteligencji i firm zatrudniających talenty związane z danymi.

Obalamy mity z cennym tłem

W świecie wykorzystywania informacji z danych, czerpania wartości ze spostrzeżeń i zwiększania przychodów biznesowych, firmy zrozumiały, że wartość przechwytywania, przechowywania i przekształcania danych może naprawdę zmienić reguły gry. Istnieje ocean informacji krążących wokół ścieżek kariery dla inżynierów lub osób niebędących inżynierami, które mogą przyczynić się do rozwoju sztucznej inteligencji i firm zatrudniających talenty związane z danymi.

Zanim przejdziemy do rzeczy, zobaczmy, jak wygląda typowy cykl życia sztucznej inteligencji na rys. 1.a. Wypisałem sześć faz cyklu życia. Ludzie twierdzą, że na początku musi być faza tłumaczenia biznesu na technologię (inaczej określanie zakresu projektu). Rzucam to, aby skupić się wyłącznie na aspekcie technicznym.

Ryc. 1.a Cykl życia AI
  • Zbieranie danych — koncentruje się na gromadzeniu danych, tworzeniu wybranych warstw i przechowywaniu ich w celu dalszego dostępu
  • Eksploracja danych — bardzo zbliżona do inżynierii cech
  • Modelowanie — faza eksperymentów w celu znalezienia najlepszego modelu nauki o danych, który pasuje do przypadku użycia.
  • Development — faza przedprodukcyjna. Zasadniczo przekształcenie eksperymentu w działający komponent
  • Wdrożenie — faza produkcji. Obsługa opracowanego modelu DS na dużą skalę.
  • Monitorowanie — Śledzenie wydajności modeli + funkcji wejściowych.
  • Inżynierowie danych
  • Analitycy danych
  • Naukowcy danych
  • Inżynierowie ML
Ryc. 2.a Role i obowiązki

Teraz, gdy mój czytelnik ma podstawową wiedzę na temat elementów składowych systemu sztucznej inteligencji i ogólny pogląd na oczekiwania jednostki (z perspektywy pracy).

Ograniczmy naszą dyskusję do definicji ról analityków danych i inżynierów uczenia maszynowego.

Jak widać na Rys. 2.a, inżynierowie ML i Data Scientist nakładają się na siebie w fazie rozwoju cyklu życia systemu AI. Większość firm utrzymuje tę fazę jako wspólną odpowiedzialność między tymi dwoma zespołami. (DS i MLE).

Dla każdego przypadku użycia biznesowego podstawowy zakres ról jest zdefiniowany w następujący sposób:

Zakres DS :

  • Analityk danych włożyłby wysiłek w znalezienie odpowiednich zestawów danych. Potencjalnie tabela BigQuery .
  • Przestudiuj odpowiednią literaturę.
  • Wykonaj eksplorację danych i opracuj zoptymalizowane zapytanie sql.
  • Zdefiniuj potencjalne cechy.
  • Przygotuj zestaw treningowy i zestaw testowy.
  • Przeprowadzaj eksperymenty na różnych kandydujących modelach. Może użyć MLflow do śledzenia eksperymentu.
  • Opracuj prototyp na notebookach jupyter opartych na Pythonie.
  • Zidentyfikuj wskaźniki wydajności. Jak dokładność, wynik F1… itd

Zakres ML :

  • Przekształć notatnik jupyter w gotowe do wysyłki moduły Pythona.
  • Konteneryzuj te moduły. Głównie konteneryzacja w stylu dokera .
  • Rozwijaj infrastrukturę, aby móc trenować modele. Airflow , argo , Metaflow są tutaj popularnymi opcjami.
  • Wdróż te przeszkolone modele w różnych regionach i obsługuj ruch. Rozwiązanie podobne do Kubernetes pasuje tutaj.
  • Monitoruj wydajność w produkcji.

Czytelnicy szukający ról DS/ML powinni mieć podstawowe pojęcie o wszystkich powyższych krokach (i znać słowa Buzza ).

Dla DS dobrze jest mieć umiejętności MLE lub odwrotnie. Ale to jest czysto opcjonalne.

To jest mój pierwszy post na blogu, proszę, poświęć trochę czasu na pozostawienie komentarza i daj mi znać, co można ulepszyć. Jesteś niesamowity !!!