Zur Hauptnavigation wechseln Zur Suche wechseln Zum Hauptinhalt wechseln

Vergleich und Validierung der fachlichen Korrektheit von Large Language Models (ChatGPT-3.5, Perplexity, Google Gemini und Venice) bei der Beantwortung oralchirurgischer Fragestellungen in der Zahnmedizin

  • Leo Matthias Gramelsberger

Studienabschlussarbeit: Diplomarbeit

Abstract

Hintergrund: Large Language Models (LLMs) werden zunehmend im medizinischen und zahnmedizinischen Umfeld eingesetzt. Sie können Informationen strukturieren, Texte formulieren und komplexe Inhalte verständlich darstellen. Gleichzeitig ist unklar, wie zuverlässig solche Modelle bei fachlich anspruchsvollen, kliniknahen Fragestellungen sind. Zielsetzung: Ziel dieser Diplomarbeit war es, die fachliche Qualität der Antworten von vier frei zugänglichen LLMs bei der Beantwortung oralchirurgischer Fragestellungen zu vergleichen. Untersucht wurden ChatGPT-3.5, Perplexity, Gemini 2.5 Flash und Venice Uncensored 1.1. Im Mittelpunkt stand die Frage, ob sich die Modelle hinsichtlich ihrer Antwortqualität unterscheiden. Material und Methoden: Es wurden 30 oralchirurgische Fragen aus fünf Themenbereichen definiert: Orale Medizin, Orale Radiologie, chirurgische Zahnentfernung, Wurzelspitzenresektion und Implantologie. Jede Frage wurde den vier LLMs einmalig mit einem standardisierten Prompt gestellt. Daraus ergaben sich 120 Antworten. Die Antworten wurden durch vier Beurteilende anhand eines Beurteilungsrasters bewertet. Bewertet wurden die Kategorien Vollständigkeit, wissenschaftliche Genauigkeit, Klarheit und Relevanz auf einer Skala von 0 bis 10. Aus diesen vier Kategorien wurde der G-Score als Gesamtbewertung berechnet. Die Inter-Rater-Reliabilität wurde mittels Intraklassenkorrelation bestimmt. Zusätzlich wurden die angegebenen Quellenangaben erfasst und ihre Korrektheit geprüft. Die statistische Auswertung erfolgte mittels Kruskal-Wallis-Test. Bei signifikanten Ergebnissen wurden paarweise Post-hoc-Vergleiche mit Dunn-Korrektur durchgeführt. Ergebnisse: Die vier untersuchten LLMs unterschieden sich signifikant hinsichtlich des G-Scores (Kruskal-Wallis-Test: H=47,56; p
Datum der Bewilligung2026
OriginalspracheDeutsch (Österreich)
Gradverleihende Hochschule
  • Medizinische Universität Graz
Betreuer/-inBarbara Kirnbauer (Betreuer*in)

Dieses zitieren

'