DataHub MCP Server
Offizieller MCP-Server für die Suche und Prüfung von DataHub-Metadaten, Lineage und Trust Signals per KI-Client.
- Skill Road
- DataHub MCP Server
Kategorien
Beschreibung
Der DataHub MCP Server ist der offizielle Model-Context-Protocol-Server von Acryl Data für DataHub. DataHub ist ein Metadata- und Data-Catalog-System: Es bündelt technischen und organisatorischen Kontext über Datenbestände, etwa Tabellen, Spalten, Dashboards, Pipelines, Dokumente und ML-Modelle. Der MCP Server gibt einem kompatiblen KI-Client Zugang zu diesen in DataHub vorhandenen Metadaten. Er ist damit kein allgemeiner Datenbankzugriff und keine Ausführungsumgebung für beliebige SQL-Abfragen gegen Snowflake, Postgres oder ein Warehouse. Sein Zweck ist Discovery, Einordnung und Governance-Kontext; ein Agent kann aus diesem Kontext SQL entwerfen, aber Ausführung braucht eine separat erlaubte Datenbankverbindung oder ein anderes Werkzeug.
Was der Server laut Anbieter findet und erklärt
Die offizielle README beschreibt natürlichsprachliche Suche über die DataHub-Landschaft. Sie kann relevante Tabellen, Spalten, Dashboards und Metriken auffindbar machen, sofern diese als Entitäten und Metadaten im eigenen DataHub katalogisiert sind. Suchtreffer lassen sich mit strukturierten Ausdrücken, Filtern und Sortierung eingrenzen; die Quelle nennt etwa Wildcards, Feldsuche nach Tags und boolesche Logik. Zu einer gefundenen Entität kann der Agent Details, Schemafelder, Ownership, Dokumentation, Tags, Glossary Terms, Nutzungs- und Qualitätsinformationen abrufen. Das ist eine Katalogabfrage, nicht das Lesen der Rohzeilen einer Tabelle.
Für die Bewertung nennt DataHub Trust Signals wie Popularität, Qualität, Lineage und Query History. Diese Signale helfen, Treffer einzuordnen, ersetzen aber keine fachliche Freigabe und beweisen nicht automatisch Datenrichtigkeit. Ihre Aussagekraft hängt davon ab, welche Metadaten, Qualitäts- und Nutzungsdaten die Organisation in DataHub gepflegt hat. Der Server kann zudem reale, in DataHub referenzierte SQL-Abfragen zu einem Dataset oder einer Spalte anzeigen, damit ein Agent Join-Muster, Filter und Aggregationen versteht. Solche Query-History kann Geschäftslogik oder sensible Bezeichner enthalten und gehört deshalb in das Berechtigungskonzept.
Lineage, Dashboards und Spalten im Kontext
Mit get_lineage und get_lineage_paths_between kann der Server laut Repository Upstream- und Downstream-Lineage für Entitäten wie Datasets, Spalten und Dashboards abfragen, inklusive Hop-Begrenzung, Filtern und Pfaden zwischen Assets. Damit lässt sich vor einer geplanten Änderung nachvollziehen, welche nachgelagerten Objekte betroffen sein könnten. Die offizielle Dokumentation beschreibt Lineage auf Tabellen- und Spaltenebene; daraus folgt nicht, dass jede angeschlossene Quelle vollständige oder fehlerfreie Lineage liefert. Prüfe daher wichtige Auswirkungen gegen den Katalog und verantwortliche Teams.
search, get_entities und list_schema_fields dienen der Discovery und Inspektion. Der Server durchsucht auch gespeicherte Dokumente, wenn der Katalog solche Dokumente enthält; Dokument-Werkzeuge werden laut README ausgeblendet, wenn keine vorhanden sind. So kann ein Agent Tabellen, Spalten, Dashboards, Metriken und die zugehörigen Fachbegriffe im gemeinsamen Kontext betrachten. Das ist besonders passend für Datenanalyse und Recherche: Der Wert liegt im Auffinden und Verstehen vorhandener Datenassets, nicht im Umgehen der Zugriffsgrenzen der Quellsysteme.
Betrieb und Authentifizierung
Für DataHub Cloud gibt es einen verwalteten MCP-Endpunkt; die Dokumentation empfiehlt für interaktive Clients OAuth mit Dynamic Client Registration. Die Tokens sind dabei dem angemeldeten DataHub-Nutzer zugeordnet. Für Service Accounts, unbeaufsichtigte Abläufe, DataHub Core oder Clients ohne Remote-OAuth nennt die Dokumentation persönliche Access Tokens. Der Open-Source-Server kann lokal per stdio mit uvx mcp-server-datahub oder selbst gehostet betrieben werden. Lokaler stdio-Betrieb liest DATAHUB_GMS_URL und DATAHUB_GMS_TOKEN aus der Umgebung oder ~/.datahubenv.
Für einen geteilten HTTP-Betrieb verlangt die aktuelle Quelle pro Request einen eigenen Bearer Token. Ein serverweiter DATAHUB_GMS_TOKEN wird dort absichtlich abgelehnt, damit Rechte und Audit-Identität pro Person erhalten bleiben. Token gehören ausschließlich in den Authorization-Header, nicht in URLs. Die DataHub-Instanz muss die Metadata-Service-Authentifizierung aktivieren, damit sie die aufrufende Identität feststellen kann. Der /health-Endpunkt meldet nur Prozessgesundheit und fragt DataHub nicht ab.
Rechte, Metadaten-Exposition und Modellpfad
Der MCP Server kann nur die Informationen zurückgeben, die der verwendete DataHub-Token und die DataHub-Policies sichtbar machen. Trotzdem kann bereits lesender Katalogzugriff sensibel sein: Namen von Tabellen und Spalten, Klassifikationen wie PII, Owner, Query History, Dashboards, Dokumente und Lineage offenbaren Architektur, Geschäftsprozesse oder Datenflüsse. Nutze pro Agent einen minimal privilegierten Account. Für Service Accounts kann eine Default View die Suche laut Dokumentation auf bestimmte Domains, Plattformen oder Team-Assets einschränken.
Die Read-only-Tools ändern keinen Katalogzustand. Mutationswerkzeuge für Tags, Glossary Terms, Owner, Domains, Beschreibungen und strukturierte Properties sind standardmäßig deaktiviert und benötigen TOOLS_IS_MUTATION_ENABLED=true; kompatible Clients können anhand der MCP-Hinweise eine Bestätigung verlangen. Aktiviere sie nur für klar abgegrenzte Workflows und prüfe Änderungs- oder Proposal-Prozesse. Der Server verarbeitet Tool-Aufrufe, doch das Ergebnis kann im Kontext des verbundenen KI-Clients landen. Je nach Client, Modellanbieter, Prompt, Protokollierung und Retention können zurückgegebene Metadaten an einen externen Modellpfad gelangen. Prüfe daher Datenklassifizierung, Vertragslage und Client-Einstellungen; keine geheimen Tokens in Prompts, Screenshots oder Repositorys ablegen.
Lizenz, Grenzen und Einordnung
Das Repository acryldata/mcp-server-datahub steht unter Apache-2.0. Die GitHub-API meldete am 08.09.2026 exakt 80 Sterne; das ist eine Momentaufnahme der Repository-Popularität, kein Qualitäts- oder Sicherheitsnachweis. Der Server ist Open Source, während die Verfügbarkeit von DataHub Cloud, DataHub Core, der eigenen Infrastruktur und des gewählten KI-Clients vom jeweiligen Einsatz abhängt. Aktuelle Bedingungen veröffentlicht der Anbieter. Die Kategorien Datenanalyse und Recherche passen, weil der Server Metadaten auffindbar, vergleichbar und für Datenfragen nutzbar macht, ohne selbst den Datenbankzugriff zu ersetzen.
FAQ
Liest der DataHub MCP Server Tabellenzeilen? Nein. Laut Dokumentation liefert er DataHub-Metadaten wie Assets, Schemas, Lineage, Query-Kontext und Governance-Informationen. SQL kann er auf Grundlage dieses Kontexts entwerfen; eine Ausführung setzt einen getrennten, ausdrücklich erlaubten Datenbankweg voraus.
Kann ein Agent Metadaten verändern? Nur wenn Mutation Tools bewusst über die genannte Umgebungsvariable aktiviert wurden und der verwendete DataHub-Account dafür autorisiert ist. Für Recherche und Analyse sollten die Read-only-Tools der Standard bleiben.
Wie begrenze ich die Sichtbarkeit? Verwende einen eigenen, minimal berechtigten Nutzer oder Service Account. Ergänze bei Service Accounts eine Default View und prüfe DataHub-Policies, bevor du den Agenten mit einem extern gehosteten Modell verbindest.
Voraussetzungen
DataHub Cloud oder DataHub Core, ein persönlicher Access Token bzw. OAuth-Login, ein MCP-fähiger Client und für lokalen Betrieb das Tool uv/uvx.
Installationsanleitung
Für DataHub Cloud den offiziellen OAuth-Endpunkt https://mcp.datahub.com/mcp im MCP-Client verwenden. Für self-hosted stdio DATAHUB_GMS_URL und DATAHUB_GMS_TOKEN sicher setzen und uvx mcp-server-datahub starten. Geteiltes HTTP nur mit individuellen Bearer Tokens und TLS betreiben.
uvx mcp-server-datahub
Authentifizierung
DataHub Cloud unterstützt OAuth mit persönlichem Login. Self-hosted stdio nutzt DATAHUB_GMS_URL und DATAHUB_GMS_TOKEN; geteilter HTTP-Betrieb verlangt pro Request einen Bearer Token im Authorization-Header.
Benötigte Zugriffsrechte
Der sichtbare Katalogkontext folgt dem DataHub-Nutzer bzw. Service Account und dessen Policies. Default Views können die Suche eines Service Accounts auf konkrete Datenassets begrenzen.
Übertragene oder gespeicherte Daten
Der Server liefert DataHub-Metadaten und Query-Kontext an den MCP-Client. Diese Ergebnisse können im Kontext des verbundenen Modells verarbeitet, geloggt oder an dessen Anbieter übertragen werden.
Sicherheitsrisiken
Katalogmetadaten, Query History und Lineage können sensible Architektur- oder Geschäftsdetails offenlegen. Breite Tokens und aktivierte Mutation Tools erhöhen Risiko von Exposition oder ungewollten Metadatenänderungen; Shared HTTP benötigt TLS, Rate Limits und individuelle Tokens.
Lizenz und Kosten
- Lizenz
- Apache-2.0
- Kosten
- kostenlos
Der MCP-Server steht unter Apache-2.0. Die Verfügbarkeit und Bedingungen von DataHub Cloud, selbst gehosteter Infrastruktur und KI-Clients richten sich nach dem jeweiligen Anbieter und Einsatz.
Alternativen
Noch nicht erfasst.
Auf einen Blick
- Anbieter
- Acryl Data
- Status
- Offizieller Server
- Betriebsart
- Lokal und Remote
- Aktuelle Version
- Noch nicht erfasst.
- GitHub-Sterne
- 81
- Zuletzt geprüft
- 08.09.2026
Repository und Dokumentation
Kategorien
Unterstützte Clients
Passende Ratgeber
Anleitungen und Hintergrund, die zu diesem Eintrag passen.
Mapbox MCP Server einrichten
Mapbox MCP Server einrichten: gehosteter Endpunkt oder lokales Token, erster Test und sinnvolle Grenzen.
30.09.2026
Elastic Agent Builder MCP Server einrichten
Agent Builder in Kibana aktivieren, Werkzeuge konfigurieren und den eingebauten MCP-Endpunkt sicher per API-Key oder OAuth 2.1 mit einem KI-Client verbinden.
20.09.2026
Searchcraft MCP Server einrichten
Searchcraft MCP Server einrichten mit geprüften Links, minimalen Rechten und sicherem ersten Test starten.
19.09.2026
Redis MCP Server sicher einrichten
Redis-MCP lokal einrichten, ACL-Rechte begrenzen und Verbindung verschlüsseln.
18.09.2026