Bitte benutzen Sie diese Referenz, um auf diese Ressource zu verweisen:
doi:10.22028/D291-48080 | Titel: | Developmental, typological, and diachronic applications of cognitively plausible language models |
| VerfasserIn: | Steuer, Julius |
| Sprache: | Englisch |
| Erscheinungsjahr: | 2025 |
| DDC-Sachgruppe: | 004 Informatik 400 Sprache, Linguistik 600 Technik |
| Dokumenttyp: | Dissertation |
| Abstract: | he linguistic competence of today’s neural-network-based language models has given rise to a new paradigm in cognitive modeling: Since human language processing is thought to be partially predictive in nature, the processing effort associated with a linguistic unit –a phoneme in a phonological word, a word in sentence, or a sentence in a document– can be approximated by the probabilistic predictions of a language model. The measure or correlate of processing effort is the negative logarithmic probability of the linguistic unit in context, or its surprisal. Surprisal mirrors how well the linguistic unit in question fits the language model’s training data, i.e., how likely the unit is given the training data and the context units. While there is broad evidence for a correlation of processing effort and surprisal, the nature of today’s transformer-based language models, who during training are exposed to several orders of magnitude more data than a human during language acquisition, has led to a disconnect between a model’s linguistic competence and its applicability to cognitive modeling. In this thesis, I explore several strategies to obtain plausible surprisal estimates from language models by controlling the model’s training data. I show that the disconnect a model’s linguistic competence and cognitive plausibility is most severe in the case of reading times, even if the language model is trained on a developmentally plausible corpus. I then develop a framework in which a language model can serve as an approximation of an average reader of scientific literature in a diachronic setting. Finally, a study on cross-linguistic surprisal of personal pronouns provides an example of a research question that can be tackled with surprisal from a large multilingual model. Throughout the thesis, I highlight avenues for future research that involve tightly controlling inductive biases in the training data, tokenization, and model architecture, as well as methods to test if a language model actually acquired the linguistic structure under consideration Die sprachliche Kompetenz der heutigen, auf neuronalen Netzwerken basierenden Sprachmodelle hat zu einem neuen Paradigma in der kognitiven Modellierung geführt: Da die Verarbeitung menschlicher Sprache als teilweise prädiktiv angesehen wird, kann der mit einer sprachlichen Einheit verbundene Verarbeitungsaufwand –ein Phonem in einem phonologischen Wort, ein Wort in einem Satz oder ein Satz in einem Dokument– durch die probabilistischen Vorhersagen eines Sprachmodells approximiert werden. Das Mass oder Korrelat des Verarbeitungsaufwands ist die negative logarithmische Wahrscheinlichkeit der sprachlichen Einheit im Kontext, oder ihr Surprisal. Surprisal spiegelt wider, wie wahrscheinlich die Einheit angesichts der Trainingsdaten und des Kontexts ist. Zwar gibt es zahlreiche Belege für eine Korrelation zwischen Verarbeitungsaufwand und Surprisal, doch hat die Natur der heutigen transformerbasierten Sprachmodelle zu einer Diskrepanz zwischen der sprachlichen Kompetenz eines Modells und seiner Anwendbarkeit auf die kognitive Modellierung geführt. In dieser Arbeit untersuche ich verschiedene Strategien, um plausible Schätzungen von Surprisal aus Sprachmodellen zu erhalten. Ich zeige, dass die Diskrepanz zwischen der sprachlichen Kompetenz und der kognitiven Plausibilität eines Modells im Fall der Lesezeiten am grössten ist, selbst wenn das Sprachmodell auf einem entwicklungsplausiblen Korpus trainiert wurde. Anschliessend entwickle ich einen Rahmen, in dem ein Sprachmodell als Annäherung an einen durchschnittlichen Leser wissenschaftlicher Literatur in einem diachronen Kontext dienen kann. Schliesslich liefert eine Studie zur sprachübergreifenden Überraschung von Personalpronomen ein Beispiel für eine Forschungsfrage, die mit Hilfe von Surprisal aus einem grossen mehrsprachigen Modell angegangen werden kann. Über die gesamte Arbeit zeige ich Wege für zukünftige Forschung auf, die eine Kontrolle des induktiven Biases in den Trainingsdaten, der Tokenisierung und der Modellarchitektur beinhalten. |
| Link zu diesem Datensatz: | urn:nbn:de:bsz:291--ds-480803 hdl:20.500.11880/42281 http://dx.doi.org/10.22028/D291-48080 |
| Erstgutachter: | Klakow, Dietrich |
| Tag der mündlichen Prüfung: | 14-Apr-2026 |
| Datum des Eintrags: | 24-Jul-2026 |
| Drittmittel / Förderung: | DFG-funded CRC 1102 Information Density and Linguistic Encoding (IDeaL) |
| Fördernummer: | 232722074 |
| Fakultät: | P - Philosophische Fakultät |
| Fachrichtung: | P - Sprachwissenschaft und Sprachtechnologie |
| Professur: | P - Prof. Dr. Dietrich Klakow |
| Sammlung: | SciDok - Der Wissenschaftsserver der Universität des Saarlandes |
Dateien zu diesem Datensatz:
| Datei | Beschreibung | Größe | Format | |
|---|---|---|---|---|
| phd_thesis_final.pdf | 11,11 MB | Adobe PDF | Öffnen/Anzeigen |
Diese Ressource wurde unter folgender Copyright-Bestimmung veröffentlicht: Lizenz von Creative Commons

