Natural Language Processing (February 1st, 2027)
Die Verarbeitung natürlicher Sprache (Natural Language Processing, NLP) ist ein schnell wachsendes Fachgebiet, das es Computern ermöglicht, menschliche Sprache zu verstehen, zu interpretieren und zu generieren. Es findet breite Anwendung in der interdisziplinären akademischen Forschung – von den Digital Humanities über die Sozialwissenschaften bis hin zur biomedizinischen Textanalyse. Dieser Kurs konzentriert sich auf fortgeschrittene NLP-Techniken unter Verwendung der Programmiersprache Python und vermittelt Forschenden die Werkzeuge, um Textdaten klar und präzise zu analysieren, zu modellieren und daraus Erkenntnisse zu gewinnen.
Durch praktische Programmierübungen und reale Datensätze entwickeln Sie praktische Fähigkeiten zur Verarbeitung und Analyse natürlicher Sprache. Sie lernen grundlegende und fortgeschrittene Methoden kennen, von der Vorverarbeitung und Vektorisierung bis hin zu Machine-Learning-Modellen für die Textklassifizierung und -generierung.
Dieser Kurs richtet sich an Forschende und Praktiker:innen mit Vorkenntnissen in der Python-Programmierung. Er befasst sich eingehend mit zentralen und fortgeschrittenen NLP-Techniken, die üblicherweise im akademischen und Forschungsbereich angewendet werden.
Nach erfolgreichem Abschluss dieses Kurses sind Sie in der Lage:
- Rohtextdaten für die Analyse aufzubereiten und zu bereinigen
- Text mithilfe von Techniken wie TF-IDF und Wort-Embeddings in numerische Darstellungen umzuwandeln
- Modelle für Aufgaben wie Stimmungsanalyse, Themenmodellierung und Erkennung benannter Entitäten zu erstellen und zu bewerten
- Python-Bibliotheken wie NLTK, spaCy, scikit-learn und Hugging Face Transformers zu verwenden
- Best Practices für Interpretierbarkeit, Reproduzierbarkeit und den verantwortungsvollen Einsatz von NLP in der Forschung anzuwenden
Methoden
- Der Kurs wechselt zwischen kurzen Einführungen in Konzepte oder Methoden und kleinen Programmierübungen zum Selbermachen.
- Zwischen den Theorieeinheiten werden Sie dazu ermutigt, an Übungen zu arbeiten, die Ihr Verständnis weiter vertiefen.
Voraussetzungen
- Vorkenntnisse im Programmieren werden dringend empfohlen. Der Kurs befasst sich eingehend mit Python. Vorkenntnisse in Data Science mit Python (pandas, grundlegende pyplot- und seaborn-Kenntnisse) werden empfohlen, um dem Kursinhalt folgen zu können. Es wird jedoch vor Kursbeginn Lesematerial zur Verfügung gestellt, um die Grundlagen aufzufrischen.
- Ein Google-Konto, um mit Google Colab als einfacher und sofort einsatzbereiter Entwicklungsumgebung zu arbeiten. Alternative: eine lokal installierte Jupyter-Notebook-Umgebung. Aus Zeitgründen werden wir nicht auf die Installation und Einrichtung eingehen, daher empfehlen wir dringend die Verwendung von Google Colab.
- Bitte bringen Sie Ihren eigenen Laptop mit, um während der Anwendungsübungen mit zu programmieren.
Zielgruppe: Promovierende und Postdocs aller Fachbereiche
Trainer: Jan Bischoff | Datenanalyst
Kurssprache: Englisch
Datum/Uhrzeit: Montag, 1. Februar 2027 | 9:00 – 17:00 Uhr
Ort: Online via Zoom
Anmeldung: Bitte füllen Sie das Ingenium-Anmeldeformular (wird in neuem Tab geöffnet) aus.
Jan Bischoff studierte Wirtschaftswissenschaften an der Goethe-Universität Frankfurt. Derzeit arbeitet er als Datenanalyst und freiberuflicher Dozent für Datenwissenschaft. Er war stellvertretender Vorsitzender der Techacademy e.V. (wird in neuem Tab geöffnet), einer Organisation, die Studierenden das Programmieren beibringt.
Sein Motto: Steve Jobs sagte einmal, dass man durch das Programmieren lernen kann, wie man denkt. Ich stimme dem voll und ganz zu und denke, dass Python die perfekte Sprache für den Einstieg ist, da man sich dank ihres übersichtlichen Designs und ihrer Syntax ganz auf die Logik und die Problemlösung beim Programmieren konzentrieren kann.
Möchten Sie eine Weiterbildung besuchen, aber Ihre Kinderbetreuung deckt die erforderlichen Zeiten nicht ab? Hier finden Sie mehr Informationen über die Angebote der TU zur Ad-hoc-Betreuung für Kinder (wird in neuem Tab geöffnet).