„Ein historischer Umbruchprozess“

Unter anderem entstehen an Teleskopanlagen oder Teilchenbeschleunigern riesige Datenmengen, die gespeichert und analysiert werden müssen. Künstliche Intelligenz kann Forschenden dabei helfen. Hans-Georg Steinrück vom Forschungszentrum Jülich und der RWTH Aachen erklärt, wie ein Large Language Model unterstützen soll.

Dirk Eidemüller

Diese Illustration symbolisiert das PhysicsLLM-Projekt, das Astrophysik, Teilchenphysik und moderne Sprachmodelle (LLMs) verbindet.

A. Khalatyan (AIP), KI generiert mit Kimi K3

Welt der Physik: Welchen Zweck verfolgen Sie mit „Physics-LLM“?

Porträt des Wissenschaftlers Hans-Georg Steinrück, der in einem Café sitzt. Vor ihm stehen zwei Eisbecher.

Hans-Georg Steinrück

Hans-Georg Steinrück: Wir wollen den Wissenschaftlerinnen und Wissenschaftlern in ganz verschiedenen Disziplinen der Physik ein universelles KI-Toolkit anbieten, das ihnen möglichst viel Arbeit abnimmt. Das LLM steht für „Large Language Model“, genau wie die gängigen KI-Assistenten. Es ist aber auf Fragestellungen in der Physik zugeschnitten, deshalb „Physics-LLM“. Diese KI soll eine Vielfalt von Möglichkeiten bieten: von der Vorbereitung von Experimenten über die Extraktion und Analyse von Daten bis hin zur Erstellung von Programmcodes und Dokumentation von Experimenten.

Welche Disziplinen in der Physik haben besonders große Datenmengen zu bewältigen?

Traditionell sind das die Astrophysik und die Teilchenphysik. Die riesigen Teleskopsysteme produzieren ebenso wie die Detektoren der Teilchenbeschleuniger gigantische Mengen an Bits und Bytes. Diese beiden Disziplinen waren deshalb über die Jahrzehnte auch wichtige Treiber der modernen Computertechnik. Aber auch viele andere Disziplinen haben aufgeholt, was die schiere Datenmenge betrifft. Experimente an Synchrotronstrahlungsquellen, bei denen mit Röntgenlicht Proben durchleuchtet werden, haben etwa in den letzten Jahren einen riesigen Sprung gemacht. Die Röntgendetektoren hatten früher nur einen oder ein paar Dutzend Pixel; heute sind es Millionen – und die zeitliche Auflösung wird ebenfalls immer schneller. In vielen Disziplinen werden mittlerweile so schnell Daten generiert, dass man sie gar nicht vollständig speichern kann. Wir sprechen bei manchen Experimenten von etlichen Petabytes bis Exabytes pro Jahr – dafür bräuchte man Millionen Festplatten.

Wie schaffen es Forscherinnen und Forscher denn, mit solchen Datenbergen sinnvoll umzugehen?

Man muss die Daten zum Teil noch vor dem Abspeichern massiv reduzieren. Dazu braucht man intelligente Filter-Algorithmen, um Rauschen und uninteressante Daten gar nicht erst abzuspeichern. Allerdings muss man dabei auch sehr aufpassen, nicht etwa seltene, aber wissenschaftlich interessante Ereignisse noch vor der eigentlichen Analyse wegzuwerfen. Hier kann die KI ebenso helfen wie dann bei der Auswertung der Daten. Wir nennen das „Big-Data-Analyse“. Bislang ist das eine ziemliche Fleißarbeit, weil wir Wissenschaftlerinnen und Wissenschaftler üblicherweise selbst die Software schreiben müssen, mit der wir Daten auswerten.

Ein langer Gang zwischen sehr großen Serverschränken links und rechts

Rechenzentrum des Forschungszentrums CERN

Aber da kann die KI auch Arbeit abnehmen?

Genau, sie ist sogar erstaunlich effektiv darin, mit Programmcode umzugehen. Die KI kann nicht nur neuen Code erzeugen, um bestimmte Aufgaben zu erledigen. Man kann sie auch dazu nutzen, bestehenden Code zu optimieren, sodass er zum Beispiel schneller läuft. Man braucht dann weniger Rechenzeit auf einem Supercomputer und kann mehr Aufgaben erledigen. Neulich hat mir die KI etwa in wenigen Stunden einen Code verbessert, wofür ich selbst Monate gebraucht hätte. Und so viel Zeit habe ich eigentlich nicht. Mit intelligentem KI-Einsatz lassen sich also viele Dinge erledigen, die wir sonst gar nicht angehen könnten. Unser Projekt Physics-LLM soll auch bei der Dokumentation helfen, um Experimente besser reproduzierbar zu machen. Das hilft dann auch bei der Vorbereitung von Experimenten. So können etwa Forschende die KI fragen: Was sind die besten Einstellungen, um eine bestimmte Messung durchzuführen?

Wenn man so viel an die KI delegiert, besteht dann nicht die Gefahr, dass man selbst den Überblick verliert, wie die einzelnen Schritte von der Messung bis zur Datenanalyse zusammenhängen?

Das ist bei unseren Diskussionen natürlich ein Thema. Wir wollen blinde Flecken vermeiden. Deshalb gestalten wir unser Physics-LLM im Sinne größtmöglicher Transparenz. Der Mensch soll immer bei allen Schritten eingreifen und das Kommando übernehmen können. Wir arbeiten auch mit einem Open-Source-Ansatz. Die Software hat also einen einsehbaren Code und gehört keinem Konzern. Deshalb können die Forschenden sie gemeinsam weiterentwickeln, ohne dass die Gefahr besteht, dass ein Konzern die Arbeit damit kostenpflichtig macht oder gar das LLM abstellt.

Wie ist es möglich, dass ein solches KI-Modell so unterschiedliche Disziplinen wie Teilchenphysik, Astrophysik, Festkörperphysik und Atomphysik gleichermaßen unterstützt?

Wir haben viele Workshops und Diskussionen dazu geführt, wie wir die unterschiedlichen Anforderungen unter einen Hut bekommen. Wir mussten dafür erst einmal eine gemeinsame Sprache finden, denn viele Begriffe werden in den verschiedenen Disziplinen unterschiedlich genutzt. Das Gute daran ist, dass jede Disziplin mit besonderen Herausforderungen zu tun hat und auf diesen Gebieten ihre spezielle Expertise entwickelt hat. Diese Lösungen können dann auch den anderen Disziplinen zugutekommen. So können etwa die Expertinnen und Experten aus der Synchrotron- oder Neutronenforschung von der Astrophysik lernen, wie man Archivdaten effizient nutzt. Gleichzeitig können verschiedene Disziplinen von der Beschleunigerphysik lernen, wie man Hardware mit KI-Agenten optimal steuert.

Mehrere flache Gebäude in einer verschneiten Landschaft; rechts von den Häusern befindet sich ein großer Berg.

Computeranlage des Observatoriums ALMA

Und wie ist es mit der Ausbildung des wissenschaftlichen Nachwuchses: Wie kann man sicherstellen, dass nicht ein Stück weit die Kreativität verloren geht, wenn man zu sehr auf die KI vertraut?

Auch das ist ein wichtiger Punkt, der letztlich nicht nur uns, sondern generell die Ausbildung an Universitäten betrifft. Speziell auf die Physik bezogen heißt das für uns: Das Ausprobieren, das kreative Experimentieren und das Drehen an den verschiedenen Knöpfen sind Dinge, die nicht verloren gehen dürfen. Nur so sammelt man Erfahrung. Viele wichtige Entdeckungen wurden gemacht, weil jemand nicht den Standardanweisungen gefolgt ist, sondern auch einmal scheinbar verrückte Ideen ausprobiert hat. Man muss aber auch sagen: Wir befinden uns in einem historischen Umbruchprozess. Und wir wollen versuchen, ihn auch mit unserem Physics-LLM zu gestalten und somit Vorreiter der Entwicklung zu sein.

Das Bundesministerium für Forschung, Technologie und Raumfahrt fördert das Verbundprojekt: „Physics-LLM: Anwendung von großen Sprachmodellen für Forschungsdatenmanagement in der Physik“ im Zeitraum von November 2025 bis Oktober 2028 mit rund 2,9 Millionen Euro.

Fördersumme: 2 909 860 Euro

Förderzeitraum: 01.11.2025 bis 31.10.2028

Förderkennzeichen: 05D25BA3, 05D25CG3, 05D25CJ1, 05D25PD3, 05D25PE2,05D25WE2, 05D25WO1

Beteiligte Institutionen: Helmholtz-Zentrum hereon, Universität Bonn, Universität Erlangen-Nürnberg, Leibniz-Institut für Astrophysik Potsdam, Deutsches Elektronen-Synchrotron, Technische Universität Dortmund, Technische Universität München, Forschungszentrum Jülich

Quelle: https://www.weltderphysik.de/bmftr/digitalisierung/kuenstliche-intelligenz-ein-historischer-umbruchprozess/