Zum Inhalt

Projekte

Projekte

PubMed-Landschaft

Ein 2D-Atlas von über 21 Mio. biomedizinischen Abstracts, erstellt aus Text-Embeddings, zur Untersuchung der Entstehung von Forschungsfeldern und der Dynamik der COVID-19-Forschung.

Python · BERT-Embeddings · t-SNE

Auf GitHub ansehen →

Interaktive Visualisierung →

Blogpost →

Excess Vocabulary durch LLMs

Erkennt die Spuren von LLM-unterstütztem Schreiben in über 15 Mio. biomedizinischen Abstracts, indem Verschiebungen im Wortgebrauch über die Zeit nachverfolgt werden.

Python · NLP · Großskalige Textanalyse

Auf GitHub ansehen →

Presseberichterstattung Die Zeit →

Presseberichterstattung The Economist →

Text-Visualisierungen

Ein SBERT-basierter Projektor, der end-to-end mit einem kontrastiven, t-SNE-ähnlichen InfoNCE-Loss trainiert wird und 2D-Text-Embeddings erzeugt, die gleichzeitig eine gute Visualisierung und ein gutes Sentence-Embedding darstellen.

Python · PyTorch · Sentence Transformers · InfoNCE · Dimensionsreduktion

Auf GitHub ansehen →

Cropping vs. Dropout: Augmentierung von Text-Embeddings

Begleitcode zu unserem TMLR-Paper, das selbstüberwachte Fine-Tuning-Strategien für Text-Embedding-Modelle vergleicht und zeigt, dass cropping-basierte Augmentierung Dropout übertrifft.

Python · PyTorch · Sentence Transformers · Kontrastives Lernen

Auf GitHub ansehen →

LLM-Lesbarkeit

Quantifiziert, wie LLM-unterstütztes Schreiben die Lesbarkeit biomedizinischer Abstracts verändert hat, die zwischen 2010 und 2025 veröffentlicht wurden.

Python · NLP · LLMs

Auf GitHub ansehen →

ICLR-Datensatz

Ein offener Datensatz von über 24.000 ICLR-Einreichungs-Abstracts (2017-2024) mit Entscheidungen und keyword-basierten Labels, genutzt zur Untersuchung von Trends in der Machine-Learning-Forschung.

Python · NLP · Datensatz-Kuration

Auf GitHub ansehen →