|
Data Integration
DIS 3.3
|
|||||
|---|---|---|---|---|---|
| Workload | Credits | Studiensemester | Frequenz | Dauer | |
| 180 h | 6 | 3. Sem. | jährlich | 1 Sem. | |
| 1 | Lehrveranstaltungen | Kontaktzeit | Selbststudium | Sprache | Gruppengröße |
| ∑ 4 SWS / 60 h | ∑ 120 h | ||||
| DIS3.3 Data Integration (Seminaristischer Unterricht und Laborpraktikum) | DIS3.3 4 SWS / 60 h | DIS3.3 120 h | DIS3.3 Englisch | DIS3.3 70 | |
| 2 | Lernergebnisse (learning outcomes / Kompetenzen): | ||||
Die Studierenden lernen, Daten und Informationen, die in elektronischer Form vorliegen, aufzubereiten, zu strukturieren, zusammenzuführen und in gängige Formate zu überführen und somit mit Hilfe statistischer Methoden analysierbar und weiterverarbeitbar zum machen. Hierzu setzen sie unterschiedliche Formate (z.B. CSV, XML oder JSON), automatisierte Transformationen (z.B. mit Pandas, XSLT oder mit Unixtools) und Editoren und Analysetools (z.B. Notepad++, OpenRefine, Excel) ein. Sie werden somit in die Lage versetzt, beliebige Quelldaten so aufzubereiten, dass diese für spätere Anwendungen, z.B. als Eingabe für Datenbank- und Retrievalsysteme oder für das Data Mining genutzt werden können. Sie kennen dabei typische Verfahren, Tools und Formate, um die Ergebnisse ihrer Datenintegration flexibel einzusetzen. Des Weiteren können sie diese je nach Anwendungsfall und Anforderung anpassen. | |||||
| 3 | Inhalte: | ||||
| DIS3.3 Im Modul Datenintegration werden Verfahren, Tools und Formate zur Aufbereitung, Strukturierung und Transformation von beliebigen Daten und Informationen vorgestellt und deren praktischer Einsatz in Laborpraktika geübt. Im Fokus stehen die verschiedenen Schritte, die notwendig sind, um beliebige digitale Daten und Informationen in eine einheitliche Form zu bringen sowie eine strukturierte Weiterverarbeitung zu ermöglichen. Weiterhin werden Verfahren zur automatisierten Transformation von Daten (z.B. mit regulären Ausdrücken, XSLT oder kleiner Skripte) in diverse Formate (wie z.B. CSV, XML, JSON) unter Verwendung von Texteditoren (wie bspw. Notepad++) behandelt. Neben den theoretischen Grundlagen zur Datenintegration wie Datenstrukturen und -formate, der Daten- und Code-Verwaltung mit Repositorysystemen werden vor allem praktische Fähigkeiten in den unterschiedlichen Arten von Daten- und Informationsgewinnung aus dem Web (Datenbanken, Web-APIs, Scraping) und der Datenbereinigung (Konsistenzprüfung, Harmonisierung, etc.) vermittelt. Hierzu werden eine Reihe von experimentellen sowie bereits im professionellen Einsatz befindliche Methoden und Tools vorgestellt und an praktischen Beispielen evaluiert. | |||||
| 4 | Lehrformen: | ||||
|
Seminaristischer Unterricht und Laborpraktikum (DIS3.3)
|
|||||
| 5 | Teilnahmevoraussetzungen: | ||||
|
Zwingende Voraussetzungen: keine Eine vorherige erfolgreiche Teilnahme an den Modulen DIS 1.1 Algorithmen und Datenstrukturen und DIS 2.1 Programmierung und Softwareentwicklung wird nachdrücklich empfohlen. |
|||||
| 6 | Art der Prüfung: | ||||
|
Schriftliche Ausarbeitung und Präsentation oder mündliche Prüfung
|
|||||
| 7 | Voraussetzungen für die Vergabe von Kreditpunkten: | ||||
| - | |||||
| 8 | Art: Pflicht- oder Wahlmodul | ||||
| Pflichtmodul | |||||
| 9 | Bewertungsmethoden benotet/unbenotet | ||||
| benotet | |||||
| 10 | Stellenwert der Note für die Endnote: | ||||
| 4 % | |||||
| 11 | Modulbeauftragte/r und hauptamtlich Lehrende | ||||
| Modulbeauftragte/r: Prof. Dr. Philipp Schaer
Hauptamtlich Lehrende:
Prof. Dr. Philipp Schaer
|
|||||
| 12 | Sonstige Informationen: | ||||
| - | |||||
| 13 | Literatur / Quellen | ||||
|
Aggarwal, C. C.: Data Mining The Textbook. Springer, 2019. Library Carpentry: https://librarycarpentry.org/lc-shell/ Shotts, W.: The Linux Command Line, https://linuxcommand.org/tlcl.php Sweigart, A.: Automate the Boring Stuff with Python, 2nd Edition. No Starch Press, 2019. |
|||||