Python-Tagebücher Nr. 2 – Einzelhaft in Haftanstalten

Feb 01 2023
Der zweite Teil der Python-Tagebücher, einer Reihe, in der ich meine Erfahrungen, Gedanken und Schwierigkeiten beim Erlernen von Python beschreibe. Sofern Sie nicht schon seit einem Jahrzehnt in der Klemme leben, ist Python eine Programmiersprache, die zu einem festen Bestandteil der Datenwissenschaftsbranche geworden ist.

Der zweite Teil der Python-Tagebücher, einer Reihe, in der ich meine Erfahrungen, Gedanken und Schwierigkeiten beim Erlernen von Python beschreibe.

Foto von Grant Durr auf Unsplash

Sofern Sie nicht schon seit einem Jahrzehnt in der Klemme leben, ist Python eine Programmiersprache, die zu einem festen Bestandteil der Datenwissenschaftsbranche geworden ist. Python zu lernen ist etwas, das ich schon seit einiger Zeit auf meiner To-Do-Liste habe, und dank meiner Teilzeit-Lehrtätigkeit in Spanien habe ich endlich die freie Zeit, mich dem Lernen zu widmen!

In den letzten Jahren haben immer mehr Arbeitgeber damit begonnen, Python zu nutzen. Ich habe gelesen, dass Python im Vergleich zu R besser für umfangreiche Webanwendungen , Deep Learning und maschinelles Lernen geeignet ist . Mein Interesse am maschinellen Lernen und mein allgemeiner Wunsch, neue Techniken und Technologien zu erlernen, lassen den Eindruck entstehen, dass es nicht nur faszinierend, sondern notwendig wäre, ein wenig Python zu beherrschen!

Hinweis: Wenn man davon ausgeht, dass man bei der Programmierung völlig freie Wahl hat, ist die Antwort im Allgemeinen klar: Es spielt keine Rolle! Werkzeuge sind nichts anderes als Werkzeuge und sollten daher je nach Zweck und Situation mit Bedacht ausgewählt werden.

In diesem Projekt habe ich die folgenden Konzepte geübt:

  • Erstellen eines Jupyter-Notebooks
  • Importieren einer CSV-Datei
  • Pakete installieren und importieren (Pandas, Numpy, Matplotlib, Seaborn)
  • Bereinigen von Daten
  • Daten manipulieren
  • Ausführen einer grundlegenden inferenzstatistischen Analyse
  • Daten zusammenfassen
  • Daten visualisieren (Histogramm, Balkendiagramm, Boxplot)
  • Kommentare erstellen
  • Festlegen der Formatierung der Datenanzeige
  • Unterteilung von Daten

Ich habe Daten über Einzelhaft in Haftanstalten in den Vereinigten Staaten von Data is Plural gefunden , einem wöchentlichen Newsletter mit dem Ziel, interessante und nützliche Datensätze aus dem Internet zu finden.

Daten manipulieren

Hier habe ich die vorhandenen Daten schnell manipuliert, indem ich zunächst die Anzahl der Staatsbürgerschaften der Insassen für die Top-20-Länder ermittelt habe. Anschließend habe ich diese Zahlen in Prozentsätze umgewandelt, um einen besseren Überblick über die Verbreitung bestimmter Staatsbürgerschaften zu erhalten. Beispielsweise haben in diesem Datensatz mehr als ein Drittel der Insassen der Haftanstalten die mexikanische Staatsbürgerschaft! Auch die Verbreitung der jamaikanischen Staatsbürgerschaft fiel mir auf (3,11 %). Dann habe ich ein kurzes Balkendiagramm erstellt, das dieselben Informationen visualisiert.

Daten zusammenfassen

Das Bild unten zeigt die zusammenfassenden Statistiken unserer interessierenden Variablen „days_solitary“. Die durchschnittliche Zeit in Einzelhaft beträgt 32,72 Tage. Der Median liegt bei 20 Tagen. Da Mittelwert und Median so unterschiedlich sind, liegt wahrscheinlich eine schiefe Rechtsverteilung vor. Mit anderen Worten: Es gibt einige Insassen, die viel Zeit in Einzelhaft verbringen, was die durchschnittliche Zeitspanne in die Höhe treibt. Die Spanne reicht von 0 Tagen bis 781 Tagen in Einzelhaft.

Zusammenfassende Statistik für „days_solitary“

Daten visualisieren (Histogramm, Balkendiagramm, Boxplot)

Die erste Visualisierung, die wir hier haben, ist ein Histogramm, bei dem es sich im Wesentlichen um eine Bilddarstellung der oben genannten zusammenfassenden Statistiken handelt. Die Verteilung der Variablen „days_solitary“ ist rechtsschief, was bedeutet, dass es viele Insassen gab, die für kurze Zeit in Einzelhaft waren, während es einige wenige Insassen gab, die für längere Zeit in Einzelhaft waren. Da die Verteilung rechtsschief ist, bedeutet dies, dass der Mittelwert größer als der Median ist, da die Ausreißer den Mittelwert nach oben ziehen.

Das zweite Bild ist ein Dichtediagramm, das das Histogramm im Wesentlichen glättet und die relative Dichte der Anzahl der Tage in Einzelhaft zeigt. Das dritte Bild überlagert das zweite Bild mit dem ersten, sodass sie leicht verglichen werden können.

Nachfolgend finden Sie eine Grafik, die die Anzahl der verschiedenen Gründe für die Unterbringung eines Häftlings in Einzelhaft zeigt. Wir sehen, dass disziplinarische Gründe die Mehrheit der Gründe ausmachen, während „Schutzhaft: Sicherheit anderer Häftlinge“ die zweithöchste Zahl darstellt. Mir fällt auf, wie viele medizinische Gründe dafür sprechen, dass jemand in Einzelhaft gesteckt wird.

Unten sehen Sie dasselbe mit Seaborn erstellte Balkendiagramm, das die Anzahl der Insassen in jedem Bundesstaat darstellt. Wir sehen, dass Kalifornien im Datensatz die meisten Insassen hat, gefolgt von Texas, Arizona und Georgia. Der einzige Unterschied zwischen den beiden Balkendiagrammen besteht darin, dass eines auf der linken Seite das Standard-Farbschema aufweist, während das rechte über ein benutzerdefiniertes Farbschema verfügt. Hier bestand das Ziel darin, die Themen, die ich mit Seaborn erstellen konnte, besser kennenzulernen! Als allgemeine Faustregel versuche ich, mich an Farbpaletten zu halten, die für Farbenblinde geeignet sind, damit meine Arbeit leichter zugänglich ist.

Links: Standarddesign, Rechts: Benutzerdefiniertes Design

In dem unten abgebildeten Boxplot habe ich Seaborn verwendet, um die Insassen nach dem Bundesstaat zu gruppieren, in dem sie inhaftiert sind, um zu sehen, ob die Anzahl der Tage in Einzelhaft je nach Bundesstaat unterschiedlich ist. Es ist möglich, dass verschiedene Bundesstaaten unterschiedliche Gesetze bezüglich der Zeitspanne haben, die ein Insasse in Einzelhaft verbringen darf.

Allgemeine Überlegungen:

Nach den letzten Python-Tagebüchern wollte ich sofort in die Geodatenanalyse oder lineare Regressionen einsteigen, aber mir wurde klar, dass es besser wäre, sich zuerst mit den grundlegenden Python-Konzepten vertraut zu machen, bevor ich mich etwas Komplizierterem zuwende.

Ich war so aufgeregt, in die Welt der Datenwissenschaft einzutauchen und all die coolen Bibliotheken und Techniken kennenzulernen. Aber mir wurde schnell klar, dass ich, bevor ich überhaupt über die Verwendung dieser Bibliotheken nachdenken konnte, ein tiefes Verständnis der Grundlagen haben musste. Wie in vielen MINT-Bereichen ist auch in der Datenwissenschaft das Verständnis der Grundlagen wie das Fundament eines Hauses. Wenn das Fundament schwach ist, wird der Rest des Hauses einstürzen. Aber mit einem starken Fundament ist es möglich, alles zu bauen.

Es hat sich wirklich gelohnt, mit diesem Datensatz zu arbeiten, da er so viele Möglichkeiten bietet, Menschen und Gemeinschaften zu helfen. Datenwissenschaft kann ein wirksames Instrument zur Förderung des sozialen Wohls sein, insbesondere wenn es um die Analyse komplexer Themen wie Einzelhaft in Haftanstalten geht. Durch den Einsatz von Techniken wie maschinellem Lernen und statistischer Analyse können Datenwissenschaftler Muster und Erkenntnisse aufdecken, die andernfalls möglicherweise unbemerkt bleiben würden. Im Zusammenhang mit Einzelhaft kann die Datenwissenschaft beispielsweise verwendet werden, um große Datenmengen zu den Bedingungen und Ergebnissen dieser Praxis zu analysieren, wie z. B. die Zeitdauer, die Einzelpersonen in Isolation verbringen, die Auswirkungen auf ihre psychische Gesundheit usw Zusammenhang zwischen Einzelhaft und Rückfall. Infolge, Diese Informationen können als Grundlage für politische und anwaltschaftliche Bemühungen genutzt werden, die darauf abzielen, den Einsatz von Einzelhaft zu reduzieren und die Bedingungen für die Inhaftierten zu verbessern. Darüber hinaus kann die Datenwissenschaft auch dazu genutzt werden, die Wirksamkeit dieser Bemühungen im Laufe der Zeit zu überwachen und zu bewerten.

Jetzt, da ich auf der Suche nach meinem ersten Einstiegsjob im Bereich Data Science bin, weiß ich, dass mir die Fähigkeiten, die ich mir durch die Konzentration auf die Grundlagen von Python angeeignet habe, hilfreich sein werden!

Was ich für Python Diaries #3 lernen möchte:

Das nächste Mal möchte ich meine Python-Kenntnisse auf die nächste Stufe bringen, indem ich an Geodaten herumbastele oder einfache lineare Regressionen durchführe .

Möchten Sie meinen Code sehen? → GitHub

Möchten Sie meine bisherigen Erfahrungen sehen? → LinkedIn