Mit Open-Source-LLMs zu aussagekräftigen Metadaten: Sprachmodelle als Schlüssel für nutzerfreundliche Open-Data-Portale

  • Eger B
  • Ullmann F
  • Dinter B
  • et al.
N/ACitations
Citations of this article
6Readers
Mendeley users who have this article in their library.

Abstract

Die Verfügbarkeit und Qualität von Metadaten sind zentrale Erfolgsfaktoren für die effektive Nutzung von Open Data. Unvollständige oder inkonsistente Metadaten erschweren jedoch die Auffindbarkeit, Interoperabilität und Wiederverwendung offener Datenbestände erheblich. Dieser Beitrag untersucht, inwieweit Open-Source Large Language Models (LLMs) zur automatisierten Generierung hochwertiger Metadaten beitragen können. Aufbauend auf dem Data Catalog Vocabulary (DCAT) wird ein prototypischer Ansatz entwickelt, der Open-Source-LLMs in den Upload-Prozess von Open-Data-Portalen integriert. Die Evaluation anhand realer Open-Data-Datensätze zeigt, dass die generierten Metadaten in vielen Fällen mit Expertenbewertungen übereinstimmen und insbesondere die Konsistenz und Kategorisierung verbessern. Herausforderungen bestehen jedoch in der präzisen zeitlichen Zuordnung von Daten sowie in der Skalierbarkeit auf unterschiedlichen Datenformaten. Der Beitrag beleuchtet methodische sowie technische Optimierungsmöglichkeiten und gibt Hinweise auf potenzielle Verbesserungen hinsichtlich Skalierbarkeit und zeitlicher Einordnung von Metadaten.The availability and quality of metadata are key success factors for the effective use of Open Data. However, incomplete or inconsistent metadata significantly hinder the discoverability, interoperability, and reusability of open datasets. This paper examines the extent to which open-source Large Language Models (LLMs) can support the automated generation of high-quality metadata. Based on the Data Catalog Vocabulary (DCAT), a prototype is developed that integrates open-source LLMs into the upload process of Open Data portals. The evaluation using real Open Data datasets demonstrates that the generated metadata often aligns with expert assessments, particularly improving consistency and categorization. However, challenges remain in the precise temporal classification of data and scalability across various data formats. This paper discusses methodological and technical optimization opportunities and provides insights into potential improvements regarding scalability and temporal classification of metadata.

Cite

CITATION STYLE

APA

Eger, B.-L., Ullmann, F., Dinter, B., & Gluchowski, P. (2025). Mit Open-Source-LLMs zu aussagekräftigen Metadaten: Sprachmodelle als Schlüssel für nutzerfreundliche Open-Data-Portale. HMD Praxis Der Wirtschaftsinformatik, 62(5), 1112–1126. https://doi.org/10.1365/s40702-025-01197-1

Register to see more suggestions

Mendeley helps you to discover research relevant for your work.

Already have an account?

Save time finding and organizing research with Mendeley

Sign up for free