Archiv

Fallbeispiel: Doppelt gezählt?

Christine Hennig & Paul Reinelt

Ein kleiner Fehler im Auswertungscode bringt kurz vor der Veröffentlichung die Ergebnisse einer groß angelegten Studie ins Wanken. Doch muss eine Studie ­gestoppt werden, wenn ihre Kernaussage weiterhin stimmt? Dieses Fallbeispiel zeigt, wie Zeitdruck, wissenschaftliche Sorgfalt und transparente Forschung ­miteinander in Konflikt geraten können.

Elias hat in Informatik promoviert und leitet eine Forschungsgruppe an einer Hochschule. Er leitet das ­Forschungsprojekt „ExplAIn“, in dem eine umfassende Studie zur KI-Nutzung an Berufsschulen in Deutschland erstellt wird. Daten werden bundesweit mit Frage­bögen erhoben, um wissenschaftlich zu bewerten, ob der Einsatz von Chat-Tools bei Hausaufgaben Lernprozesse sinnvoll unterstützt oder ob dadurch Kompetenzen wie eigenständiges Arbeiten und kritisches Denken beeinträchtigt werden. Die Ergebnisse sollen als Grundlage für zukünftige bildungspolitische Entscheidungen dienen und werden von einer ­umfangreichen PR-Kampagne begleitet.*

Elias’ Team arbeitet von Anfang an sehr akribisch und erzeugt im Laufe des Projekts eine Reihe unterschiedlicher digitaler Artefakte: verschiedene Versionen der Umfrage, den Workflow der Datenanalyse und die zugehörigen Skripte und Codes für die Auswertung. Dazu kommen der Text für die Veröffentlichung in einer Zeitschrift und die Statements für die Presse. Das Förderprogramm verlangt, dass alle diese Artefakte öffentlich zugänglich und nachnutzbar sind. Dies dient der Überprüfbarkeit sowohl der Ergebnisse als auch der Herangehensweise.

Elias und seine Kollegin Raya diskutieren, wie sie Daten und Auswertungscode geeignet ablegen. Raya hat kürzlich einen Vortrag über Forschungsdatenmanagement gehört und schlägt daher vor, alle digitalen Artefakte im institutionellen Repositorium zu speichern und mit geeigneten Metadaten zu versehen. Daten und Code sollen gemeinsam mit der wissenschaftlichen Publikation veröffentlicht werden, sodass andere Forschende die Ergebnisse nachvollziehen und reproduzieren können. Elias ist skeptisch bezüglich des Codes, insbesondere da einige der verwendeten Skripte aus eher dubiosen Quellen stammen, nur unsauber dokumentiert sind und leider auch nicht alle Workflows eindeutig reproduzierbar sind. Raya kann ihn jedoch überzeugen und verspricht im Gegenzug, die Codequalität zu verbessern und die Dokumentation zu vervollständigen.

Raya investiert viel mehr Zeit als geplant in die Codequalität. Glücklicherweise unterstützt Marie sie dabei, die studentische Hilfskraft im Projektteam. Die beiden stellen fest, dass der extrem hohe Rücklauf von 85 Prozent der Berufsschulen den Code an sein Limit bringt, er skaliert nicht hinreichend. Sie arbeiten mit Hochdruck an der Korrektur. Den teilnehmenden Berufsschulen und der ­Politik wurde versprochen, die Ergebnisse innerhalb von drei Monaten zu ­publizieren und ihnen zur Verfügung zu stellen. Die Zeit rennt ihnen davon, denn die Frist läuft in wenigen Tagen ab.

Am Vorabend der geplanten Veröffentlichung sitzt Marie im Büro und geht den Auswertungsprozess noch ein letztes Mal sorgfältig durch. Ihr Bauchgefühl sagt ihr: Hier ist etwas falsch. Beim Korrekturlesen kommen ihr die Zahlen seltsam vor. Dann findet sie die Ursache ihres Bauchgrummelns: Die Anzahl an verarbeiteten Rückmeldungen erreicht nicht ganz die erwartete Zahl.

Sie schaut erneut auf die Daten und schickt gemeinsam mit Raya noch einmal alles durch das nunmehr bestens dokumentierte Auswertungstool. Sie stellen den Ausgabemodus so ein, dass es für jede einzelne Verarbeitungsaktion eine Meldung ausgibt. Dabei fallen ihnen seltsame Meldungen auf: „name already exists“. Warum hat das bisher niemand bemerkt? Das automatische Auswertungstool hat bei Lehrkräften mit denselben Vor- und Nachnamen jeweils einen der Fragebögen ignoriert. Es gibt unter den befragten Personen zwei „Lisa Bach“ und wer weiß wie viele weitere Namensgleichheiten. Raya stöhnt auf. Sie müsste die Logik ihres Auswertetools komplett umkrempeln. Dabei hatte sie den Code vor der Veröffentlichung von Elias begutachten lassen. Die ganze Studie müsste neu bewertet werden.

Raya telefoniert mit Elias. Aber der winkt ab. Es werden schon nicht alle Lehrkräfte „Lisa Bach“ heißen, das Fehlen einzelner Datensätze falle nicht weiter ins Gewicht und ändere nichts an der Kernaussage der Studie. 65,26 Prozent der Befragten befürworten die Nutzung von KI-Tools für Hausaufgaben. Ob sich nun weit hinter dem Komma eine Ziffer ändere, sei unerheblich. Er weist Raya an, die gefundenen Fehler zu ignorieren und die Studie wie geplant zu veröffentlichen.

Raya und Marie lassen nicht locker. Die nicht ganz exakten Ergebnisse zeugen nicht nur von unsauberer Forschung – der Fehler lässt sich durch den zur Verfügung gestellten Code auch nachweisen. Eine Zählung der Anzahl der Meldungen „name already exists“ ergibt 32 Einträge bei über 100.000 Verarbeitungsmeldungen. Von den erhobenen Datensätzen betrifft das Problem vermutlich nur diese 32, auch wenn Raya und Marie sich nicht ganz sicher sind. Die gefundenen Fehler ändern allerdings nicht die Kernaussagen und Elias’ Argumentation ist somit nicht von der Hand zu weisen.

*Anmerkung: Die Untersuchung ist von uns frei erfunden – eventuell dient die Idee ja für interessierte Forschende als ­Inspiration? Die Story basiert auf der Story 32 der ­Research Data Scarytales. (https://forschungsdaten-thueringen.de/fdm-scarytales/articles/ueberblick.html)

Fragen:

  • Darf Raya die Veröffentlichung der Ergebnisse ­entgegen Elias’ Anweisung zurückhalten?
  • Was bedeutet es für die Reputation von Elias und der gesamten Arbeitsgruppe, wenn ­jemand die Fehler findet?
  • Welche Verantwortung tragen Forschende, wenn ihre Ergebnisse als Grundlage für ­politische ­Entscheidungen dienen?
  • Sollten bekannte Unsicherheiten in den Forschungs­daten offen kommuniziert werden, auch wenn dadurch Zweifel an den ­Ergebnissen ­entstehen könnten?
  • Ist eine Veröffentlichung trotz ­bekannter Fehler vertretbar, wenn die Ergebnisse im Wesentlichen unverändert bleiben? Ab wann wiegt ein Fehler zu schwer?
  • Welche Verantwortung tragen Forschende wie Elias und Raya für die Dokumentation, ­Qualität und Zugänglichkeit der digitalen ­Artefakte? Welchen Anteil hat Marie daran?
  • Welche Rolle spielt die Veröffentlichung von Daten und Code für die Nachvollziehbarkeit wissen­schaftlicher Ergebnisse?
  • Wie können externe Forschende, die die ­Ergebnisse zu reproduzieren versuchen, auf ­Lücken oder Fehler bei der Veröffentlichung ­digitaler ­Artefakte ­aufmerksam machen und wie sollte damit umgegangen werden?
  • Wie kann eine Fehlerkultur etabliert ­werden, die kontinuierliche Verbesserung bei der ­Speicherung und Dokumentation von ­Forschungsdaten ermöglicht?

Erschienen in .inf 15, Das Informatik-Magazin, Herbst 2026, https://inf.gi.de/15/gewissensbits-doppelt-gezaehlt

Leave a Reply

You can use these HTML tags

<a href="" title=""> <abbr title=""> <acronym title=""> <b> <blockquote cite=""> <cite> <code> <del datetime=""> <em> <i> <q cite=""> <s> <strike> <strong>