Wer sind DataScientists und ML Engineers?
Lassen Sie uns die Mythen mit einem wertvollen Hintergrund sprengen
In der Welt der Nutzung von Informationen aus Daten, der Gewinnung von Wert aus Erkenntnissen und der Steigerung der Geschäftseinnahmen haben Unternehmen verstanden, dass die Erfassung, Speicherung und Transformation von Daten wirklich ein Wendepunkt sein kann. Es gibt einen Ozean von Informationen, die sich um Karrierewege für Ingenieure oder Nicht-Ingenieure drehen, um auf dem Gebiet der künstlichen Intelligenz und Unternehmen, die das Datentalent einstellen, einen Beitrag zu leisten.
Bevor wir einsteigen, lassen Sie uns verstehen, wie ein typischer KI-Lebenszyklus wie in Abb. 1.a aussieht. Ich habe sechs Phasen im Lebenszyklus aufgelistet. Die Leute argumentieren, dass es am Anfang eine Business-to-Tech-Übersetzungsphase (auch bekannt als Project Scoping) geben muss. Ich werfe das weg, um mich nur auf den technischen Aspekt zu konzentrieren.
- Datenerfassung – Konzentriert sich auf die Erfassung von Daten, die Erstellung kuratierter Ebenen und deren Speicherung für den weiteren Zugriff
- Data Exploration – ganz in der Nähe von Feature Engineering
- Modellierung – Eine Experimentierphase, um die besten Data Science-Modelle zu finden, die zum Anwendungsfall passen.
- Entwicklung – eine Vorproduktionsphase. Grundsätzlich ein Experiment in eine funktionierende Komponente umwandeln
- Bereitstellung – Produktionsphase. Bereitstellen Ihres entwickelten DS-Modells im großen Maßstab.
- Überwachung – Verfolgen Sie die Leistung der Modelle und Eingabefunktionen.
- Dateningenieure
- Datenanalysten
- Datenwissenschaftler
- ML-Ingenieure
Nun, mein Leser hat ein grundlegendes Verständnis der Bausteine eines KI-Systems und eine allgemeine Sicht auf die Erwartungen eines Einzelnen (aus beruflicher Sicht).
Beschränken wir unsere Diskussion auf die Rollendefinitionen von Data Scientists und Machine Learning Engineers.
Wie Sie in Abb. 2.a sehen können, überschneiden sich ML-Ingenieure und Datenwissenschaftler in der Entwicklungsphase des KI-Systemlebenszyklus. Die meisten Unternehmen behalten diese Phase als gemeinsame Verantwortung dieser beiden Teams bei. (DS & MLE).
Für jeden geschäftlichen Anwendungsfall ist der grundlegende Umfang der Rollen wie folgt definiert:
DS-Bereich :
- Ein Datenwissenschaftler würde sich bemühen, die richtigen Datensätze zu finden. Möglicherweise eine BigQuery- Tabelle.
- Führen Sie ein relevantes Literaturstudium durch.
- Führen Sie eine Datenexploration durch und erstellen Sie eine optimierte SQL-Abfrage.
- Definieren Sie potenzielle Merkmale.
- Bereiten Sie ein Trainingsset und ein Testset vor.
- Führen Sie Experimente mit verschiedenen Kandidatenmodellen durch. Könnte MLflow für die Versuchsverfolgung verwenden.
- Entwickeln Sie einen Prototyp auf Python-basierten Jupyter- Notebooks.
- Identifizieren Sie Leistungsmetriken. Wie Genauigkeit, F1-Ergebnis usw
ML-Bereich :
- Konvertieren Sie das Jupyter-Notebook in lieferbare Python-Module.
- Containerisieren Sie diese Module. Meistens eine Containerisierung im Docker -Stil.
- Entwickeln Sie eine Infrastruktur, um Modelle trainieren zu können. Airflow , argo , Metaflow sind hier beliebte Optionen.
- Stellen Sie diese trainierten Modelle in allen Regionen bereit, um den Datenverkehr zu bedienen. Hier passt eine Kubernetes- ähnliche Lösung.
- Überwachen Sie die Leistungen in der Produktion.
Die Leser, die nach DS/ML-Rollen Ausschau halten, sollten in der Lage sein, eine grundlegende Vorstellung von allen oben genannten Schritten zu haben (und mit Schlagworten vertraut zu sein ).
Für DS ist es schön, Fähigkeiten eines MLE zu haben oder umgekehrt. Aber das ist rein optional.
Dies ist mein erster Blogbeitrag überhaupt, bitte nehmen Sie sich die Zeit, einen Kommentar abzugeben und mir mitzuteilen, was besser gemacht werden kann. Du bist toll !!!

![Was ist überhaupt eine verknüpfte Liste? [Teil 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































