Bachelor Sprache, Technologie und Medien (STeM)
Sommersemester 2021
(rot: Komödien; blau: Tragödien; grün: Tragikomödien)
` * für Zitate * keine besopnderen Attribute werden verwendet --- ### Kodieren eines Briefs? * Kapitel [4.2 "Elements Common to All Divisions"](https://www.tei-c.org/release/doc/tei-p5-doc/en/html/DS.html#DSDTB) * `` * `` * `` * `` * Kap. 10.7 "Physical Description" * `` * Kap. 11.3.2.1 "Document Hands": * `` * `` -- ## Thema 7: Topic Modeling --- ### Fragen zu "Signs at 40" 1. Wie heißt die Autorin des Artikels, in dem das Topic mit dem Label "Latin America" wichtiger ist als in allen anderen Artikeln? 2. Welche beiden Topics sind in der Zeitschrift Signs insgesamt am wichtigsten? 2. In welchen Topics spielt das Wort "technology" eine Rolle? 3. Welche 2-3 Topics verlieren in der Zeitschrift ab den 1990er Jahren besonders deutlich an Wichtigkeit? Welche 2-3 Topics gewinnen ab den 1990er Jahren an besonders deutlich an Wichtigkeit? --- #### 1. Wie heißt die Autorin des Artikels, in dem das Topic mit dem Label "Latin America" wichtiger ist als in allen anderen Artikeln? * "Die Autorin heißt Marysa Navarro. Ich habe sie gefunden, indem ich in der Übersicht auf den Kreis geklickt habe, indem Latin größer geschrieben ist als der Rest." --- #### 2. Welche beiden Topics sind in der Zeitschrift Signs insgesamt am wichtigsten? * "Die beiden Topics "the social" und "Women's role" sind insgesamt am bedeutendsten, da sie in der Topics List bei Ordnung nach größter Proportion der Topics die beiden größten sind. --- #### 3. In welchen Topics spielt das Wort "technology" eine Rolle? * "Technology" spielt besonders bei "Information Technology", "Domestic and Urban" und bei "Science" eine Rolle. Man findet die Antwort über den "Word"-Index, wenn man dort "technology" eingibt. --- #### 4. Welche 2-3 Topics verlieren, welche gewinnen, in der Zeitschrift ab den 1990er Jahren besonders deutlich an Wichtigkeit? * Die Topics "Quantitative Methods", "Psychology and women" und "Labor" verlieren ab den 90er Jahren an Wichtigkeit. * Die Topics "Politics of difference", und "Globalization" hingegen nehmen seit den 90er Jahren an Wichtigkeit zu. * Zu erkennen ist dies bei Overview unter dem Reiter "Topics over time". --- ### Rückfragen zum Topic Modeling (1) * (Wie funktioiniert) Latent Dirichlet Allocation? * (Wie funktioniert) die iterative Zuordnung von Wörtern zu Topics (= Gibbs Sampling) * Was hat es genau mit der Bayes'schen Statistik auf sich? * Kann man Topic Modeling auch mit Lyrik, auf Audio-, Bild- oder Videodaten anwenden? (Ja!) * Erkennung von Sarkasmus oder Parodien * Erkennung von Zweideutigkeiten / versteckten Emotionen mit TM? * TM mit kleinerer Textsammlung? (möglich mit vorhandenem Modell) --- ### Rückfragen zum Topic Modeling (2) * Verhältnis qualitative Inhaltsanalyse zu Topic Modeling * Mehrwert einer solchen Analyse gegenüber Inhaltsanalyse? * Dokumente x Topics und Topics x Wörter * Explorative Visualisierung * Andere Programme außer Mallet und gensim? * Wie wird die optimale Anzahl an Topics festgelegt? * Topic Modeling Workflow an einem Beispiel * Wie funktioniert die Evaluation genau? --- ### Inferenz-Problem (1) (Dokumente; Blei 2012) --- ### Inferenz-Problem (2) (Topics und Wörter; Blei 2012) --- ### Topic Modeling ("plate notation") (Wörter, Topics, Dokumente, Hyperparameter) --- ### Dirichlet Distributions (Serrano 2020) --- ### Gibb's Sampling (1) (Missing Assignments; Steyvers and Griffith 2012) --- ### Gibb's Sampling (2) (Estimated Assignments; Steyvers and Griffith 2012) --- ### Video-Empfehlung * (1) Luis Serrano: "Latent Dirichlet Allocation",https://www.youtube.com/watch?v=T05t-SqKArY * (2) Luis Serrano: "Gibbs Sampling",https://www.youtube.com/watch?v=BaM1uiCpj_E --- ### Anwendungsszenarios für TM --- ### Stephen King >Da ich großer Fan von Stephen King bin und auch einige seiner Romane besitze, könnte ich mir im Vergleich der einzelnen Werke mithilfe des Topic Modeling durchaus interessante Ergebnisse vorstellen. Beispielsweise könnte so ermittelt werden, welche Themen in welchen Büchern eine größere Rolle spielen, eventuell auch von solchen, von denen man es gar nicht erwarten würde. Da in Kings Werken hinzukommend viele Geschichten Anspielungen auf andere Romane von ihm machen oder auch dieselben Orte/Szenarien verwendet werden, könnte man auch in dieser Hinsicht neue Erkenntnisse gewinnen, was ich mir sehr spannend vorstelle. --- ### Liedtexte >Welche Topics sind am Häufigsten/Wichtigsten in den Liedtexten der deutschen Charts zum Beispiel im Zeitraum des letzten Jahres und gibt es einen signifikanten Anteil an Topics mit zum Beispiel diskriminierenden oder stigmatisierendem Vokabular. --- ### Twitter >Ich fände es interessant zu sehen was heraus kommt, wenn man zum einen, ganz twitter analysiert und die Ergebnisse dann mit Analysen kleinerer Nutzergruppen (beispielsweise aufgeteilt nach Ethnischer Zugehörigkeit oder Altersgruppe) vergleicht. Inwiefern unterscheiden sich die Twitter Tonics unterschiedlicher Altersgruppen? --- ### Elektromobilität in der Presse >Verschiedene Zeitungen danach zu untersuchen, wie sich die Berichterstattung über Elektroautos über die Jahre verändert hat und inwiefern diese im Zeitverlauf an Relevanz gewonnen haben. Hierbei könnte man ein Topic "Elektroautos" modellieren, welches Wörter wie zum Beispiel "Stromer", "Elektrofahrzeug", "Lithium-Ionen-Batterie", "Emissionsfreiheit", etc. enthält und würde als Textsammlung alle Artikel deutschsprachiger Zeitungen ab dem Jahr 2000 (beispielsweise) nehmen. Anschließend würde man die einzelnen Artikel danach analysieren, ob die Wörter aus dem Topic in den Artikeln vorkommen und könnte dann feststellen, zu welchen Zeitpunkten die Berichterstattung über Elektroautos zu- oder abgenommen hat. [...] Diese Erkenntnisse könnte man dann mit zu dieser Zeit aktuellen Ereignissen in der E-Mobilitätsbranche in Verbindung setzen. --- ### Bundestagsreden >Das übergeordnete Ziel besteht in der Extraktion politischer Positionierungen der Parteien im Bundestag und dem Vergleich dieser Positionen. Zu diesem Zweck werden die vom Bundestag online zur Verfügung gestellten Plenarprotokolle weiter aufbereitet und mittels Topic-Modeling-Verfahren untersucht. Zunächst soll mittels politikwissenschaftlicher Literatur ein theoretischer Rahmen erstellt werden, der als Basis für die Hypothesenbildung der politischen Positionsentwicklung der Parteien dient. Aus den ungenügend strukturierten Protokollen soll anschließend ein einheitlich ausgezeichneter, in Parteien aufgeteilter Datensatz entstehen, aus dem mittels Topic-Modeling die wichtigsten epochalen und parteilichen Themen herausgefiltert werden. [...] Abschließend erfolgt ein Abgleich mit dem theoretischen Rahmen und die Beantwortung der Frage, ob eine automatische Ermittlung politischer Tendenzen mit den angewendeten Verfahren einen Gewinn für die Forschung darstellen kann. -- ## Thema 8: Linked Open Data --- ### Lektüreaufgabe (Tutorial) * Bitte arbeiten Sie das folgende Tutorial zu "Linked Open Data" sorgfältig durch. * Es ist Teil der Plattform "The Programming Historian", richtet sich aber nicht nur an Historier:innen. * Hier der Link: https://programminghistorian.org/en/lessons/intro-to-linked-data * Wir werden in der Sitzung offene gebliebene Fragen besprechen, bitte notieren Sie diese daher wie gewohnt als Lösung zu dieser Aufgabe. --- ### Nachfragen (1): Grundlagen * Was sind konkrete Anwendungsszenarien für LOD? * Was genau ist der Unterschied zwischen URL und URI? * Warum verwendet man Triples (Subjekt-Prädikat-Objekt)? * Was sind RDF/XML und Turtle? * Was ist ein SPARQL-Endpoint? * Worin liegt der Unterschied zwischen Wissensgraph und Ontologie? * Wie kann man die Beziehung zwischen Wikipedia und Wikidata beschreiben? * Was ist das "5-star-rating-system" von Tim Berners-Lee? * Wie funktioniert das "semantic reasoning"? --- ### Was sind konkrete Anwendungsszenarien für LOD? * In den Digital Humanities * Digitale Literaturgeschichte: Projekt "Mining and Modeling Text" * Kulturelles Erbe: Weinetiketten im Wandel * Digitale Edition: Modellierung von Korrespondenz-Netzwerken * Computerlinguistik: Repräsentation enzyklopädisches Weltwissen für NLP-Tasks * uvm. * Allgemein gesprochen * Wenn eine relationale Datenbank zu unflexibel wäre * Wenn die Daten auch über den eigenen Bestand hinaus vernetzt werden sollen --- ### Von Triples zum Netzwerk --- ### Was genau ist der Unterschied zwischen URL und URI? * URL * Uniform Resource Locator (Link) * Nur für Webseiten und Ähnliches (HTTP, FTP, MAILTO) * Siehe: https://de.wikipedia.org/wiki/Uniform_Resource_Locator * URI * Uniform Resource Identifier * Zur Identifikation beliebiger Entitäten, Konzepte, Gegenstände * Häufig in Form einer URL, die aber nicht auf eine HTML-Seite zeigen muss * URLs sind eine Teilmenge der URIs --- ### Wo findet man Ontologien und Identifier? * Ontologien: https://lov.linkeddata.es/dataset/lov/ * Identifier: Bibliotheken und Services * Personen: * Gemeinsame Normdatendatei (GND) * Virtual Authority File (VIAF) * Orte * Getty Thesaurus of Geographical Names (TGN) * Geonames.org * Dokumente * Digital Object Identifier (und: GND, ISBN) Allgemein * Wikidata (inkl. viele Verweise auf andere URIs) --- ### Warum verwendet man Triples (Subjekt-Prädikat-Objekt)? * Ziel ist es, alle Informationen auf eine bestimmte Relation zwischen einer Entität und einer anderen Entität oder einem Wert zu reduzieren * Einfaches Beispiel * Entität 1 = Subjekt, bspw. "Karl Marx" * Relation = Prädikat, bspw. "geboren in" oder "geboren am" * Entität 2 / Wert = Objekt, bspw. "Trier" (Entität) oder "5.5.1818" (Wert) * Man kann mit dieser einfachen Struktur fast alle Informationen ausdrücken * Voraussetzung ist, dass geeignete Begriffe für die Relationen verfügbar sind (siehe Ontologie) --- ### Was sind RDF/XML und Turtle? * RDF * Resource Description Framework: abstraktes Datenmodell für LOD * Regeln: u.a.: Statements sind Tripel aus Subjekt, Prädikat, Objekt * Oder: * RDF-Serialisierungen * RDF/XML: Triples in XML ausgedrückt; validierbar * Turtle: Kompakte Schreibweise für Triples --- ### Beispiel: RDF/XML vs. Turtle --- ### Worin liegt der Unterschied zwischen Wissensgraph und Ontologie? * Wissensgraph * Wissensgraph ist ein anderer Begriff für einen LOD-Datenbestand * Aus einer Menge von LOD-Triples entsteht ein Netzwerk von Informationen * Das Wort "Graph" in Wissensgraph bezieht sich auf die Netzwerkstruktur * Ontologie * Eine Ontologie ist eine organisierte Menge definierter Begriffe, die eine Domäne abbilden * Beispiel für Entität "Person": Geschlecht, Geburtsort, Geburtstag, Sterbeort, Sterbetag, Tätigkeit, Vater, Mutter, Kind(er). * Fazit: Ontologien sind die semantische Grundlage für Wissensgraphen --- ### Wie kann man die Beziehung zwischen Wikipedia und Wikidata beschreiben? * Wikipedia ist menschenlesbar, Wikidata ist maschinenlesbar * Wikipedia gibt es in vielen Sprachen; Jede Wikidata-Seite ist mehrsprachig * Wikidata enthält Informationen aus Wikipedia in strukturierter Form * Beispiel Karl Marx: * Wikipedia: https://de.wikipedia.org/wiki/Karl_Marx * Wikidata: https://www.wikidata.org/wiki/Q9061 --- ### Was ist das "5-star-rating-system"von Tim Berners-Lee? * 5 Kriterien für gute Linked Open Data * ★ Available on the web with an open licence * ★★ In addition, available as machine-readable, structured data * ★★★ In addition, using a non-proprietary format * ★★★★ In addition, using open standards from W3C (like RDF) * ★★★★★ In addition, link your data to other people's data * Siehe: https://www.w3.org/DesignIssues/LinkedData.html --- ### Was ist ein SPARQL-Endpoint? * Ein SPARQL-Endpoint ist eine Abfragemöglichkeit für einen LOD-Datenbestand * SPARQL ist eine Abfragesprache für LOD-Daten * In SPARQL kann man sehr präzise Abfragen formulieren (siehe unten) --- ### Lektüreempfehlung Andreas Dengel (Hg.): Semantische Technologien. Grundlagen. Konzepte. Anwendungen. Spektrum Verlag, 2012. --- ### SPARQL ausprobieren * Siehe "Examples": auswählen und abwandeln! -- ## Thema 9: Visualisierung --- ### "The Value of Information Visualization" * Bitte lesen Sie das erste Kapitel mit dem Titel "The Value of Information Visualization" (S. 1-19) in dem Buch Information Visualization. * Sie können das Buch unter folgender DOI finden: https://doi.org/10.1007/978-3-540-70956-5_1 * Bitte beantworten Sie anschließend in einigen Sätzen die folgenden Fragen: * (1) Welchen der vielen im Artikel genannten Gründe, aus denen Informationsvisualisierungen nützlich sein können, finden Sie selbst am wichtigsten und warum? * (2) Beschreiben Sie aber auch eine Situation, in der Ihrer Meinung nach eine Visualisierung weniger nützlich ist als eine Datentabelle oder eine statistische Auswertung. --- ### Warum ist Informationsvisualisierung nützlich? * Visualisierungen verschaffen einen Überblick / fassen viele Daten zusammen (=cognitive benefit) * Visualisierungen machen Korrelationen in den Daten intuitiv sichtbar (=cognitive benefit) * Visualisierungen bleiben besser im Gedächtnis als eine Datentabelle (=cognitive benefit) --- ### (1b) Warum ist Informationsvisualisierung nützlich? * Visualisierungen sprechen den wichtigsten Wahrnehmungskanal von Menschen an (=perceptual benefit) * Visualisierungen machen abstrakte / komplexe Zusammenhänge verständlich (=cognitive benefit) * Visualisierungen kann man schneller verstehen als einen entsprechenden Text (=cognitive benefit) --- ### (1c) Warum ist Informationsvisualisierung nützlich? * Visualisierungen sind ästhetischer / optisch ansprechender als Tabellen (other) * Visualisierungen sind sprachunabhängig verständlich (other) * Visualisierungen können neue Einblicke oder Ideen generieren (other) * Visualisierungen sind nützlich, wenn es um Kommunikation an die Öffentlichkeit geht --- ### (2a) Wann ist eine Visualisierung weniger nützlich als bspw. eine Tabelle? * ... wenn man Einzelfälle näher betrachten möchte, nicht den Überblick * ... wenn man exakte Zahlenwerte ablesen möchte * ... wenn man die Stärke einer Korrelation oder die Signifikanz eines Unterschieds berechnen möchte --- ### (2b) Wann ist eine Visualisierung weniger nützlich als bspw. eine Tabelle? * ... wenn eine Visualisierung einfach zu komplex / verwirrend wäre * ... wenn eine Visualisierung verfälschend wirkt / manipulativ ist * ... wenn man ohnehin nur sehr wenige Daten / Variablen hat --- ### (2c) Wann ist eine Visualisierung weniger nützlich als bspw. eine Tabelle? * ... wenn man die Daten algorithmisch auswerten möchte * ... wenn man sehr viele Zahlenwerte hat * ... wenn es um Daten wie eine Teilnehmerliste geht (Name, Wohnort, Geburtsdatum etc.) * ... wenn man mehr als nur ein oberflächliches Verständnis ermöglichen möchte --- ### (2d) Wann ist eine Visualisierung weniger nützlich als bspw. eine Tabelle? * ... wenn die Visualisierung unnötig kompliziert ist * ... wenn es um Sachfragen geht (bspw. Wie viele Kriege hat Napoleon geführt?, Kalorien von Nahrungsmitteln) * ... wenn es um den Vergleich von Daten geht (bspw. Trefferquote von Fussballern, Preisvergleich) * ... wenn es nötig wäre, viel Text mit in die Visualisierung einzubauen --- #### Beispiel aus Fekete et al. (2) --- #### Beispiel aus Fekete et al. (2) --- #### Gelungene Visualisierungen (1) * Barchart * ++ verständliche Struktur, relevantes Thema * [Link](https://pudding.cool/2017/03/film-dialogue/) --- #### Gelungene Visualisierungen (2) * stacked horizontal Bar Chart * [Link](https://medium.com/@jeffrey.lancaster/32-game-of-thrones-data-visualizations-f4ab6bc978d8) --- #### Gelungene Visualisierungen (3) * Flowchart * ++ interaktiv, ästhetisch, filterbar * [Link](http://download.gsb.bund.de/BIB/global_flow/) --- #### Gelungene Visualisierungen (4) * Heatmap * ++ vermittelt Überblick, ist interaktiv * [Link](https://www.sueddeutsche.de/wissen/corona-zahlen-1.4844448) --- #### Gelungene Visualisierungen (5) * Informationsvisualisierung * ++ didaktisch, anschaulich, Legende * [Link](https://www.klett.de/alias/1018294) --- #### Gelungene Visualisierungen (6) * Kartierung mit Barcharts * ++ interaktiv, anschaulich * [Link](https://manpopex.us/) --- #### Gelungene Visualisierungen (7) * Scatterplot mit Labels * übersichtlich, mehrdimensional * [Link](https://www.jonasoesch.ch/articles/datavisualization-for-designers) --- #### Problematische Visualisierungen (1) * -- drei Werte, zwei Farben * -- 100 Personen, 1 Schwein? * [Link](https://stefan.bloggt.es/files/2011/06/the-world-of-100-money.jpg) --- #### Problematische Visualisierungen (2) * -- Pie Chart für ähnliche Werte * [Link](https://www.espncricinfo.com/story/kane-williamson-s-is-the-hand-that-steadies-new-zealand-s-ship-1193354) --- #### Problematische Visualisierungen (3) * Farbkodierte Karte * Zahlen sind aussagekräftiger als die Visualisierung! * [Link](https://www.quarks.de/wp-content/uploads/Wasserreserven-weltweit_klein.jpg) -- ## Thema 10: Open Science --- ### Aufgabe A: Video zu Open Access * Bitte schauen Sie sich das folgende Video zum Thema "Open Access" an: https://www.youtube.com/watch?v=9RQy4wtYls0 * Beantworten Sie die beiden folgenden Fragen: * (1) Welche Gründe halten Ihrer Meinung nach Wissenschaftler:innen weiterhin davon ab, noch viel mehr im Open Access zu publizieren, obwohl es doch eigentlich so viele Vorteile bringt, das zu tun? * (2) Welche Anliegen oder Aspekte beim Zugang zu Fachliteratur sind aus Ihrer Sicht als Studierende besonders wichtig und sollten auch politisch / finanziell besser unterstützt werden? --- ### Antworten zu (1) * Geringere Wertschätzung für kostenfreie Literatur? * Angst vor Plagiaten / Missbrauch / Urheberrechtsverletzungen * Autoren vermuten geringeren Lerneffekt, wenn der Rechercheaufwand niedrig ist * Gebühren / Kosten für die Open Access-Publikationen * Bei Open Access-Publikationen verlieren die Autor:innen Einkommen * Es bringt höheres Ansehen / Renommée, nicht Open Access zu publizieren --- ### Antworten zu (1) * Allgemeine Aversion gegen die Digitalisierung * Mangelnder Wille zur Selbstausbeutung * Gewohnheit der altmodischen Methode * Angst vor mangelndem Datenschutz * Im Closed Access werden mehr Leser:innen erreicht * Schwächere Qualitätskontrollen bei Open Access * Schlechtere Auffindbarkeit der Publikationen --- ### Antworten zu (1) * ungeklärte langfristige Zugänglichkeit elektronischer Publikationen * keine Garantie für mehr Zitationen als bei Closed Access * Mehr Aufwand, Open Access zu publizieren * die eigene Arbeit aus Stolz nicht für jeden so leicht zugänglich machen wollen * Kontrollverlust, weil die Rechte abgegeben werden * Schnellere Anschlussforschung durch Andere möglich / Konkurrenz * Es könnte mit dem Journal Impact Factor zusammenhängen * nicht genügend Unterstützung für Open Access --- ### Antworten zu (2) * Kostenfreier Zugriff auf digitale Fachliteratur * Open Access ist einfacher in der Lehre einzusetzen * Mehr Mittel für Subskriptionen sind nötig * Einfachere, übersichtlichere, einheitlichere Auffindbarkeit ermöglichen * Wenigstens kurzer, kostenfreier Zugang um zu Prüfen, ob das Werk relevant ist --- ### Antworten zu (2) * Mehr Mittel für die Bibliotheken, um Lernräume und Technik verfügbar zu machen * Es ist demotivierend, wenn man ständig auf Paywalls stößt * In vielen Ländern bestünde ohne Open Access kaum Zugang zu Forschung * Freemium-Modelle wären hilfreich * Mittel, um freie Verfügbarkeit für die Lehre zu finanzieren * Vor allem Lehrbücher sollten kostenfrei sein --- ### Filmtipp https://paywallthemovie.com/ --- ### (B) Wikipedia-Artikel zum Thema "Open Science" * Bitte lesen Sie den Artikel zu "Open Science" bei Wikipedia: https://en.wikipedia.org/wiki/Open_science * Bitte beantworten Sie die beiden folgenden Fragen: * (1) Wie hängen Ihrer Meinung nach Open Access und Open Data zusammen? * (2) Welche Informationen vermissen Sie in dem Wikipedia-Artikel? --- ### (1) Open Access / Open Science * Beide sind Bestandteile der Open Science-Bewegung * Unterschied: Daten vs. Publikationen * Beide haben ähnliche Ziele * Beide fordern einen freieren Umgang mit gewonnenem Wissen und Forschungsergebnissen * Beide fördern die schnellere Weiterentwicklung der Wissenschaft * Der Übergang von Open Access zu Open Data ist fließend * Beruhen beide auf Software / Digitalisierung / Internet * Beide ermöglichen den freien Zugriff auf Daten --- ### (2) Was fehlt im Wikipedia-Artikel? * Die "Six Principles of Open Science" sind nicht erklärt --- ### (2) Was fehlt im Wikipedia-Artikel? * Tatsächliche Anwendung von Open Science in der Praxis --- ### Beispiel "Open Street Map" * http://www.openstreetmap.org --- ### Beispiel "Wheelmap.org" * http://www.wheelmap.org --- ### (2) Was fehlt im Wikipedia-Artikel? * Vergleich zwischen verschiedenen Ländern * Typen von Open Access (Gold, Grün Bronze) * Geschäftsmodelle von Open Science --- ### (2) Was fehlt im Wikipedia-Artikel? * Zukunftsausblick zu Chancen und Möglichkeiten von Open Science * Warum ist diese "Offenheit" überhaupt so wichtig? * Kritik an Open Science * Wichtige historische und aktuelle Akteure --- ### Weitere Informationen * https://dh-trier.github.io/dh-vorlesung/reveal/DH-E13_Open-Humanities.html#/ --- ### Abschluss: #IchBinHanna * https://dig-hum.de/stellungnahme-dhd-wisszeitvg-0621 * https://twitter.com/hashtag/IchbinHanna