
Für das Karlsruher Institut für Technologie entwickelte cleanercode eine Anwendung, mit der große wissenschaftliche Datensätze aus chemischen Repositories abgerufen, verarbeitet und in unterschiedlichen Formaten bereitgestellt werden können. Von der Anforderungsaufnahme und Architekturplanung über die Abstimmung mit verschiedenen Stakeholdern bis zur Implementierung und Unterstützung beim Deployment entstand eine Lösung, die komplexe Datenprozesse in einen stabilen und nachvollziehbaren Workflow überführt.
In Forschung und Scientific Computing entstehen große Mengen strukturierter Daten. Die Herausforderung liegt häufig nicht darin, ob diese Daten existieren, sondern darin, sie zuverlässig abzurufen, in ein benötigtes Format zu überführen und für weitere Anwendungen nutzbar zu machen.
Besonders bei sehr großen Datensätzen werden klassische Download- und Verarbeitungsprozesse schnell zum Engpass. Unterschiedliche Datenformate, verschiedene Schnittstellen und hohe Datenvolumen erhöhen zusätzlich die technische Komplexität.
Für das KIT sollte deshalb eine Anwendung entstehen, die diese Prozesse bündelt und den Zugriff auf wissenschaftliche Daten deutlich strukturierter gestaltet.
Gemeinsam mit den beteiligten Stakeholdern wurden zunächst die fachlichen und technischen Anforderungen aufgenommen und in eine geeignete Architektur übersetzt.
Darauf aufbauend entwickelte cleanercode den Chemical Repository Tracker & Downloader: eine Anwendung, die Daten aus unterschiedlichen Quellen verarbeitet und für weitere wissenschaftliche Workflows bereitstellt.
Ein Schwerpunkt lag auf dem Umgang mit sehr großen Datensätzen. Daten können komprimiert und als Stream verarbeitet werden, ohne dass zunächst ein vollständiger Datensatz lokal vorliegen muss.
Gleichzeitig unterstützt die Anwendung verschiedene Ausgabeformate und Schnittstellen. Dadurch entsteht keine isolierte Einzellösung, sondern eine technische Grundlage, die sich in bestehende und zukünftige Forschungsprozesse integrieren lässt.
cleanercode begleitete das Projekt nicht nur während der eigentlichen Entwicklung.
Die Zusammenarbeit umfasste die Aufnahme der Anforderungen, die Architekturplanung, die Abstimmung mit den beteiligten Stakeholdern, die technische Umsetzung sowie die Unterstützung bei der Bereitstellung der Anwendung.
Gerade in einem Umfeld mit unterschiedlichen fachlichen Perspektiven ist diese Übersetzung entscheidend: Anforderungen aus Forschung und Anwendung müssen in eine technische Struktur überführt werden, die für alle Beteiligten nachvollziehbar bleibt.
Wissenschaftliche Datenbestände wachsen kontinuierlich. Systeme, die mit ihnen arbeiten, müssen deshalb nicht nur heute funktionieren, sondern auch mit steigender Komplexität umgehen können.
Der Chemical Repository Tracker & Downloader schafft dafür eine belastbare Grundlage: Daten können automatisiert bezogen, verarbeitet, konvertiert und über definierte Schnittstellen für weitere Anwendungen bereitgestellt werden.
Damit wird aus einer Vielzahl einzelner technischer Schritte ein reproduzierbarer Prozess.

Durch die Konvertierung zwischen mehreren Formaten und die Bereitstellung über verschiedene APIs lassen sich wissenschaftliche Daten einfacher in bestehende Tools und Folgeprozesse integrieren.

Durch die Konvertierung zwischen mehreren Formaten und die Bereitstellung über verschiedene APIs lassen sich wissenschaftliche Daten einfacher in bestehende Tools und Folgeprozesse integrieren.

Die Arbeit mit cleanercode war für unser Projekt sehr erfolgreich und das interne Entwicklerteam sehr zufrieden, das ist für mich ausschlaggebend für eine tolle Zusammenarbeit. Wir konnten in kurzer Zeit ein komplexes Projekt durchführen und sind – auch durch viele hilfreiche Gespräche – zum Ziel gekommen.
