Ordnung ist das halbe Leben
Schenkt man der Datenbank BrickLink Glauben, existieren knapp 87.000 unterschiedliche Legosteine und -figuren. Wie man diese alle auseinanderhalten und sortieren soll, ist mir schleierhaft – ich scheitere schon bei dem Versuch, das Kinderzimmer von den gefährlich spitzen Gegenständen zu befreien und alles in die „richtige“ Dose zu sortieren.
Nach Farben? Nach Anzahl der Noppen? Kleine und/oder große Platten? Eckig, rund oder doch lieber bedruckt? Puh … autsch, schon wieder auf einen Einer getreten.
Man stelle sich vor, es gäbe hier einen sympathischen Roboter, der einem zur Hand geht. Ein Traum! Die Mitarbeiter:innen des Statistischen Bundesamtes sortieren zwar keine Legosteine (zumindest nicht beruflich), dafür aber riesige Mengen an Daten. Genauer gesagt: Freitexte. Das können Produktbeschreibungen, Angaben aus Gewerbeanmeldungen oder andere Texte sein, die zunächst einer passenden Kategorie zugeordnet werden müssen, bevor sie statistisch ausgewertet werden können. Eine Aufgabe, die mit wachsender Datenmenge kaum noch vollständig von Hand zu bewältigen ist.
Und ähnlich wie der Lego-Roboter, der extra für diese Aufgabe gebaut und trainiert wurde, kann eine Künstliche Intelligenz nicht einfach loslegen. Sie muss erst lernen, worauf sie achten soll. Denn Sprache ist überraschend kompliziert. „Kfz-Werkstatt“, „Autoreparatur“ oder „Reparatur von Fahrzeugen“ klingen unterschiedlich, können aber dasselbe meinen. Umgekehrt liegt zwischen „Fahrräder verkaufen“ und „Fahrräder weiterverkaufen“ sprachlich nur wenig, semantisch jedoch eine Menge und für die Statistik kann der Unterschied entscheidend sein.
Und während die KI für manche Kategorien mit Tausenden Beispielen üben kann, bekommt sie von anderen vielleicht nur eine Handvoll zu Gesicht. Ein bisschen so, als müsste unser Roboter lernen, 5.000 gelbe Zweiersteine und 10 seltene Spezialteile (2×4 Legostein aus 18-karätigem Gold) zuverlässig auseinanderzuhalten. Ein kleiner Unterschied von ca. 15.000€ …
An diesem komplizierten und unübersichtlichen Punkt setzte das Forschungsprojekt von virtual7 für das Statistische Bundesamt an. Ziel war nicht einfach, einen besonders cleveren Algorithmus auszuwählen. Vielmehr sollte wissenschaftlich fundiert untersucht werden, welche Methoden der Künstlichen Intelligenz sich für unterschiedliche Arten von Textklassifikationen am besten eignen und wie sich ihre Ergebnisse verbessern lassen. Dazu wurden verschiedene Ansätze – von klassischen Machine-Learning-Verfahren bis hin zu modernen Transformer-Modellen – miteinander verglichen und unter realistischen Bedingungen getestet.
Das Ergebnis war weit mehr als ein einzelnes KI-Modell und kann sich sehen lassen. virtual7 entwickelte eine reproduzierbare Datenpipeline, mit der sich Experimente systematisch durchführen und vergleichen lassen. Gleichzeitig entstanden konkrete Handlungsempfehlungen, welche Verfahren für welche Herausforderungen besonders geeignet sind – etwa, wenn Trainingsdaten knapp sind oder sich Kategorien stark ähneln.
Das Statistische Bundesamt kann auf dieser Grundlage zukünftige Klassifikationsaufgaben effizienter automatisieren und neue KI-Anwendungen fundiert weiterentwickeln.
Auch wenn unser Lego-Chaos zu Hause wohl noch eine Weile von Hand sortiert werden muss, zeigt das Projekt eindrucksvoll, welches Potenzial moderne KI heute bereits entfalten kann. Sie ersetzt den Menschen nicht – sie unterstützt ihn dort, wo riesige Datenmengen schnell, konsistent und nachvollziehbar verarbeitet werden müssen. Und genau darin liegt eine der Stärken von virtual7: Anspruchsvolle KI nicht als Selbstzweck einzusetzen, sondern als praxistaugliche Lösung für komplexe Herausforderungen.
Ordnung muss sein – Wir helfen gern. 😊