top of page

Entropy Data: Data Product Marketplace für Data Contracts und AI Agents

vor 27 Minuten
7 Min. Lesezeit

Unternehmen investieren seit Jahren in Data Governance, Datenkataloge und Self-Service Analytics. Trotzdem bleibt eine zentrale Frage oft erstaunlich schwer zu beantworten: Welche Daten sind im Unternehmen wirklich verfügbar, was bedeuten sie fachlich, wer verantwortet sie – und unter welchen Bedingungen dürfen sie genutzt werden? Mit AI Agents wird diese Frage noch wichtiger. Ein Agent kann technisch schnell auf Daten zugreifen oder SQL erzeugen. Verlässlich wird das aber erst dann, wenn er nicht nur Tabellen und Spalten sieht, sondern auch deren Semantik, Qualitätszusagen, Ownership und Nutzungsbedingungen versteht.



Genau hier setzt Entropy Data an. Die Plattform positioniert sich als Data Product Marketplace und Management-Schicht für Datenprodukte, Data Contracts und Semantik. Im Podcast beschreibt Mitgründer Simon den Kern als einen zentralen Ort, an dem Menschen und zunehmend auch AI Agents passende Datenprodukte finden, beurteilen und nutzen können. Die aktuelle Produktdokumentation geht inzwischen weiter: Neben Discovery und Access Workflows gehören auch semantische Modelle, MCP-Zugriff für AI Clients, Governance-Policies sowie ein Data Product Builder für Coding Agents zum Produktbild.


Was ist Entropy Data?

Entropy Data ist kein klassischer Datenkatalog, der möglichst jede technische Tabelle und jedes Asset inventarisieren will. Die Plattform konzentriert sich stärker auf Daten, die bewusst als wiederverwendbare Produkte bereitgestellt werden. Ein Datenprodukt ist eine logisch abgegrenzte, aktiv verantwortete Einheit mit einem Owner und definierten Output Ports. Über diese Output Ports stellt das Datenprodukt Daten für andere Teams, Systeme oder Anwendungen bereit.


Für Konsumenten zählt nicht nur, dass irgendwo eine Tabelle existiert, sondern ob sie für den eigenen Use Case geeignet ist, wie sie genutzt werden darf und auf welche Eigenschaften man sich verlassen kann. Entropy Data beschreibt diese Schnittstelle mit Data Contracts. Ein Output Port kann dadurch nicht nur technische Verbindungsinformationen enthalten, sondern eine maschinenlesbare Vereinbarung über Schema, Semantik, Qualität und Nutzungsbedingungen.


Die Plattform ergänzt laut Hersteller bestehende Datenkataloge. Assets aus Datenplattformen und Katalogen können eingebunden werden, während Entropy Data darüber eine stärker produktorientierte Consumption- und Governance-Schicht aufbaut.


Data Contracts als belastbare Schnittstelle

Im Zentrum stehen Data Contracts. Entropy Data definiert sie als Vereinbarung zwischen einem Team, das Daten produziert, und den Personen oder Systemen, die diese Daten konsumieren. Ein Contract umfasst fünf Kernbereiche: Ownership, Schema, Semantik, Qualität und Terms of Use. Damit wird aus einer lose dokumentierten Tabelle eine explizite Schnittstelle.


Technisch setzt Entropy Data auf den Open Data Contract Standard, kurz ODCS. Der offene, herstellerneutrale Standard wird im Bitol-Projekt unter dem Dach der Linux Foundation AI & Data entwickelt. Die aktuelle ODCS-Version 3.2 beschreibt unter anderem Fundamentals, Schema, Data Quality, Rollen, SLAs, Server, Pricing und authoritative Definitions. Entropy Data verwendet ODCS als maschinenlesbare Grundlage seiner Data Contracts.


Das ist praktisch relevant, weil Verträge dadurch nicht nur im UI gepflegt werden. Sie können als YAML versioniert, in Git verwaltet, per API verarbeitet und automatisiert geprüft werden. Der Open-Source Data Contract CLI kann Contracts linten, mit realen Datenquellen verbinden und Schema- oder Qualitätsregeln testen. Damit kann ein Data Contract Teil einer CI/CD-Pipeline werden: Nicht nur Code, sondern auch die zugesicherte Datenqualität wird überprüfbar.


Contract First statt Data Product Slop

Die Kombination aus Data Contracts und AI Coding Agents verändert den Entwicklungsprozess. In der klassischen Variante baut ein Team zuerst eine Pipeline und dokumentiert später, was dabei herausgekommen ist. Contract First dreht die Reihenfolge um: Zuerst wird festgelegt, was ein Datenprodukt liefern soll. Erst danach wird die Implementierung gebaut.


Das ist gerade im Zeitalter generativer Entwicklung relevant. Ein Coding Agent kann in kurzer Zeit dbt-Modelle, Tests und Pipelines erzeugen. Ohne klare Zieldefinition besteht aber das Risiko, dass für jeden leicht abgewandelten Use Case ein neues Artefakt entsteht. Aus Automatisierung wird dann schnell Data Product Slop: viele ähnliche Datenprodukte, unklare Ownership und steigende Komplexität.


Der von Entropy Data vorgestellte Data Product Builder adressiert genau diesen Punkt. Der Data Contract definiert das „Was“: gewünschtes Schema, Qualitätsregeln, Aktualität und Nutzungsbedingungen. Ein Skill-Repository beschreibt das „Wie“ – also Namenskonventionen, Modell-Layer, Deployment, Security und Governance-Checkpoints. Coding Agents wie Claude Code, OpenAI Codex oder GitHub Copilot können daraus eine Implementierung erzeugen. Über Marketplace und CLI können sie vorhandene Upstream-Datenprodukte finden, deren Verträge prüfen und sie als Input Ports verwenden.


Warum Metadaten für AI Agents wichtiger werden

Für Menschen kann schlechte Dokumentation lästig sein. Für AI Agents ist sie ein strukturelles Problem. Ein Agent kann nur dann zuverlässig entscheiden, welche Daten er nutzen soll, wenn die verfügbaren Datenprodukte maschinenlesbar beschrieben sind. Tabellen- und Spaltennamen allein reichen dafür nicht.


Deshalb verschiebt sich der Wert von Metadaten. Sie müssen zunehmend erklären, was Daten fachlich bedeuten, welche Begriffe synonym sind, welche Beziehungen bestehen, wie Kennzahlen definiert sind und welche Regeln für den Zugriff gelten. Ein Agent braucht nicht nur Datenzugriff, sondern Kontext.


Entropy Data baut dafür eine semantische Schicht auf. Über Ontologien und Business Concepts können Datenprodukte mit fachlichen Begriffen verbunden werden. Im MCP-Toolset lassen sich Namespaces, Konzepte und Beziehungen durchsuchen und auf konkrete Datenprodukte zurückführen. Damit wird aus „Suche mir eine Tabelle mit customer_id“ eher die Frage: „Welche vertrauenswürdigen Datenprodukte liefern Informationen zum Business-Konzept Kunde und dürfen für meinen Zweck verwendet werden?“


MCP: Data Marketplace als Werkzeug für AI Clients

Ein besonders aktueller Baustein ist der MCP-Zugang. Entropy Data stellt einen Model Context Protocol Server bereit, über den kompatible AI Clients auf Marketplace und semantische Schicht zugreifen können.


Der relevante Punkt ist Governance. Ein AI Client soll nicht einfach technisch erreichbare Daten lesen. Nach Angaben von Entropy Data gelten dieselben Access Rights und Data-Contract-Bedingungen wie für menschliche Nutzer. Wenn Datenzugriff aktiviert ist, können AI Clients auf freigegebenen Output Ports read-only SQL ausführen. Berechtigungen des Nutzers und Nutzungsbedingungen der Data Contracts bleiben dabei Teil des Prozesses.


Damit wird ein Data Marketplace für Agents zu mehr als einer Suchoberfläche. Er kann zur Kontroll- und Kontextschicht zwischen LLM und Datenplattform werden: Welche Datenprodukte passen zur Frage? Welche Semantik gilt? Hat der Nutzer Zugriff? Darf der Zweck mit den Terms of Use kombiniert werden? Erst danach erfolgt die eigentliche Abfrage.


Semantik und Apache Ossie

Im Podcast wird Open Semantic Interchange angesprochen. Inzwischen hat sich hier etwas Wesentliches verändert: Die Initiative heißt seit 2026 Apache Ossie und befindet sich als incubating project bei der Apache Software Foundation. Ziel bleibt ein herstellerneutraler Standard für semantische Metadaten über Analytics-, AI- und BI-Plattformen hinweg.


Apache Ossie definiert semantische Modelle mit Datasets, Feldern, Beziehungen und Metriken. Für AI-Anwendungen ist ein eigener AI Context relevant, der etwa Anweisungen, Synonyme oder weitere Hinweise für AI Tools enthalten kann. Zusätzlich existiert eine Ontology Specification, mit der fachliche Konzepte und Beziehungen modelliert werden können.


Für Entropy Data passt das strategisch gut. Data Contracts beschreiben die verlässliche Bereitstellung eines Datenprodukts; die semantische Ebene beschreibt, was die Daten fachlich bedeuten und wie sie in einen unternehmensweiten Begriffskontext passen. Zusammen entsteht eine maschinenlesbare Schicht, die sowohl BI-Tools als auch AI Agents nutzen können.


Power BI und Microsoft Fabric als konkreter Anwendungsfall

Besonders interessant ist die aktuelle Integration mit Microsoft Fabric und Power BI. Die Entropy-Data-Dokumentation beschreibt eine experimentelle Fabric-Integration, die Workspaces, OneLake-Tabellen, semantische Modelle, Reports und Scorecards synchronisieren kann. Semantische Modelle werden mit Tabellen, Spalten, berechneten Spalten und Measures als Assets erfasst. Reports lassen sich mit den verwendeten Modellen verknüpfen, wodurch Business Lineage sichtbarer wird.


Noch spannender ist die Gegenrichtung: Aus einem Data Contract kann Entropy Data ein neues Power-BI-Semantikmodell erzeugen. Dafür wird aus dem ODCS-Vertrag eine TMDL-Definition generiert und in einen ausgewählten Fabric Workspace publiziert. Aktuell ist dieser Publish-to-Power-BI-Flow als experimentell gekennzeichnet und unterstützt für die zugrunde liegende Verbindung derzeit Snowflake und Databricks.


Microsoft unterstützt für Semantic Model Definitions sowohl TMDL als auch TMSL; TMDL ist das Standardformat. In den Fabric-Modellartefakten existieren zudem Bereiche für Copilot Instructions und Verified Answers. Auch die Microsoft-Welt bewegt sich damit stärker zu explizit beschriebenen semantischen und AI-nutzbaren Modellschichten.


Self-Service Access und Governance

Ein Marketplace ist erst dann wertvoll, wenn der Weg von Discovery zu tatsächlicher Nutzung funktioniert. Entropy Data bildet dafür einen Access Lifecycle ab. Konsumenten können Zugriff auf einen konkreten Output Port beantragen und einen Zweck angeben. Je nach Konfiguration wird der Zugriff automatisch genehmigt oder vom verantwortlichen Team freigegeben. Integrationen können die eigentliche Berechtigung anschließend in der Datenplattform provisionieren.


Governance soll dabei nicht nur aus Wiki-Seiten bestehen. In Entropy Data lassen sich Policies als verständliche Regeln formulieren und gegen Data Products oder Access Requests prüfen. Das Produkt nutzt AI, um solche Regeln auszuwerten und Abweichungen sichtbar zu machen. Das kann Governance näher an Entwicklung und Nutzung bringen.


Betriebsmodell und Datensouveränität

Entropy Data ist sowohl als gemanagte Cloud-Version als auch self-hosted verfügbar. Für die Cloud-Version gibt der Anbieter an, Server und Daten innerhalb der Azure EU Data Boundary zu betreiben. Die Self-Hosted-Variante kann mit Container Runtime und PostgreSQL in eigener Infrastruktur oder auf verschiedenen Cloud-Plattformen betrieben werden.


Für AI-Funktionen ist zudem Bring Your Own Model möglich. Unternehmen können beispielsweise Azure OpenAI oder OpenAI-kompatible Endpoints anbinden. Dadurch lässt sich stärker kontrollieren, in welcher Region AI-Verarbeitung stattfindet und welche Retention- oder Logging-Regeln gelten.


Der strategisch wichtigere Punkt bleibt die Portabilität der Metadaten. Offene Standards wie ODCS, ODPS und Apache Ossie reduzieren die Gefahr, dass fachliche Definitionen ausschließlich in proprietären Plattformformaten gefangen sind. Gerade wenn AI Agents stärker automatisiert mit Unternehmensdaten arbeiten, wird diese Metadatenebene zu einem Teil der eigenen Dateninfrastruktur.


Für wen eignet sich Entropy Data?

Der größte Nutzen entsteht dort, wo Daten nicht nur analysiert, sondern als wiederverwendbare Produkte betrieben werden. Das betrifft Unternehmen mit mehreren Data Domains ebenso wie Organisationen, die Self-Service Analytics, Fabric, Databricks oder Snowflake systematischer organisieren wollen.


Besonders relevant wird die Plattform, wenn AI Agents produktiv mit Unternehmensdaten arbeiten sollen. Dann braucht es eine zentrale Stelle für Discovery, Semantik, Berechtigungen und Verträge. Ein LLM sollte nicht selbst erraten müssen, welche Tabelle „Umsatz“ enthält oder welche Kennzahl fachlich gültig ist.


Auch kleinere Organisationen können von dem Prinzip profitieren, wenn wiederkehrende Analysen oder automatisierte Prozesse entstehen. Ein Beratungsunternehmen könnte Zeitbuchungen, Stundensätze, Retainer und Projektbudgets zu einem definierten Datenprodukt zusammenführen. Ein Data Contract beschreibt die gewünschte Schnittstelle; ein Coding Agent baut die Pipeline; spätere Anwendungen greifen auf dasselbe geprüfte Produkt zurück.

Fazit: Die eigentliche Infrastruktur ist die verlässliche Schnittstelle

Entropy Data adressiert ein Problem, das durch Agentic AI deutlicher wird: Daten allein reichen nicht. Menschen und Maschinen brauchen verlässliche Schnittstellen, über die sie verstehen können, was ein Datenprodukt liefert, wie gut es ist, wer dafür verantwortlich ist und unter welchen Bedingungen es genutzt werden darf.


Der Data Product Marketplace verbindet dafür Data Products, Data Contracts, Semantik, Access Management und Governance. Mit MCP und dem Data Product Builder wird diese Ebene zunehmend direkt von AI Agents genutzt. Offene Standards wie ODCS und Apache Ossie sollen gleichzeitig dafür sorgen, dass die fachliche Logik nicht an eine einzelne Datenplattform gebunden bleibt.


Damit wird aus dem klassischen Metadatenproblem eine Architekturfrage für AI-ready Data Platforms. Wer Agents produktiv auf Unternehmensdaten arbeiten lassen will, braucht nicht nur einen leistungsfähigen Lakehouse- oder Warehouse-Unterbau. Er braucht eine verlässliche, maschinenlesbare Definition der Schnittstellen darüber. Genau dort positioniert sich Entropy Data.

Nächste Schritte

Wer Data Contracts und einen Data Product Marketplace im eigenen Unternehmen erproben möchte, sollte nicht mit einer vollständigen Governance-Initiative starten. Sinnvoller ist ein klar abgegrenzter Use Case mit mehreren Datenquellen und einem konkreten Konsumenten – beispielsweise ein Reporting, ein semantisches Modell oder ein AI Agent. Zuerst wird definiert, welches Datenprodukt benötigt wird und welche Anforderungen an Schema, Semantik, Qualität, Ownership und Zugriff gelten.


Anschließend lässt sich prüfen, wie ein Data Contract diese Schnittstelle beschreibt und wie Entropy Data Discovery, Access und Governance darauf aufsetzen kann. So entsteht Schritt für Schritt eine belastbare Grundlage für wiederverwendbare Datenprodukte – und später auch für AI Agents, die Unternehmensdaten nicht nur finden, sondern kontrolliert und fachlich korrekt einsetzen sollen.


bottom of page