Data Exploration

Offizieller Anthropic-Skill für ein belastbares Datenprofil vor der eigentlichen Analyse.

data-exploration ist der offizielle Anthropic-Skill aus dem öffentlichen Repository knowledge-work-plugins. Die direkte Primärquelle ist der inzwischen kanonische Ordner https://github.com/anthropics/knowledge-work-plugins/tree/main/data/skills/explore-data. Der frühere Kandidatenpfad data-exploration ist dort nicht mehr vorhanden; der verifizierte Ersatz explore-data beschreibt dasselbe Produkt und denselben Zweck. Laut Anbieter erstellt die Anleitung ein umfassendes Profil für eine Tabelle oder eine hochgeladene Datei, damit Form, Qualität und Muster vor einer vertieften Analyse verstanden werden. Der Skill ist keine Datenbank, kein eigenständiger Connector und kein Beweis für die Richtigkeit einer Kennzahl. Er strukturiert die Arbeit eines kompatiblen Claude-Clients und lässt die fachliche Verantwortung beim analysierenden Team.

Vom unbekannten Datensatz zum Arbeitsplan

Der Ablauf beginnt mit dem Zugriff auf die Daten. Ist ein Data-Warehouse-MCP-Server verbunden, soll der Client den Tabellennamen auflösen, mehrdeutige Schema-Präfixe klären, Metadaten abfragen und Profiling-Abfragen gegen die freigegebenen Live-Daten ausführen. Bei einer CSV-, Excel-, Parquet- oder JSON-Datei werden die Inhalte geladen und Spaltentypen aus den vorhandenen Werten abgeleitet. Ohne Tabelle oder Datei soll die anfragende Person zunächst einen Datensatz bereitstellen oder eine beschriebene Struktur nennen. Diese Grenze verhindert, dass ein plausibel klingendes Profil ohne Datenbasis entsteht.

Struktur und Spalten verstehen

Vor jeder Interpretation fragt der Skill nach Zeilen- und Spaltenzahl, Körnung, Primärschlüssel, Eindeutigkeit, letztem Aktualisierungszeitpunkt und historischem Zeitraum. Jede Spalte wird als Identifikator, Dimension, Kennzahl, Zeitspalte, Text, Boolean oder strukturelles Feld eingeordnet. Diese Klassifikation schafft einen verständlichen Rahmen für spätere Gruppierungen und Vergleiche. Ein Wert wie customer_id ist nicht automatisch ein sauberer Schlüssel, ein Statusfeld ist nicht automatisch eine sinnvolle Dimension und eine Zahl ist nicht automatisch eine belastbare Metrik. Die Verantwortlichen müssen Datenmodell und fachliche Bedeutung weiterhin prüfen.

Profiling für Vollständigkeit und Verteilung

Laut Anbieter erfasst ein Profil die Gesamtzeilenzahl, die Spaltenanzahl, die Typverteilung und, sofern verfügbar, die ungefähre Tabellengröße. Für jede Spalte werden Nullanzahl, Nullrate, unterschiedliche Werte, Kardinalität und häufige sowie seltene Ausprägungen untersucht. Numerische Felder werden unter anderem über Minimum, Maximum, Mittelwert, Median, Standardabweichung, Perzentile, Nullen und unerwartete negative Werte betrachtet. Zeichenketten können auf Länge, leere Inhalte, Formate, Groß- und Kleinschreibung sowie Leerzeichen geprüft werden. Datumsfelder brauchen minimale und maximale Werte, fehlende und zukünftige Daten, periodische Verteilung und mögliche Lücken. Boolean-Spalten werden nach wahr, falsch und fehlend zusammengefasst.

Datenqualität und Muster

Der Skill lenkt die Aufmerksamkeit auf hohe Nullraten, unerwartete Kardinalität, Platzhalterwerte, Duplikate, Schiefe, uneinheitliche Kodierung und mögliche Typfehler. Ebenso können Fremdschlüssel-Kandidaten, Hierarchien, Korrelationen, abgeleitete und redundante Spalten sichtbar werden. Ein Qualitätsrahmen bewertet Vollständigkeit von nahezu vollständig bis sehr lückenhaft. Konsistenzprüfungen suchen nach Varianten wie USA, US und United States, nach Zahlen in Textspalten, nicht passenden Fremdschlüsseln, negativen Mengen oder einem abgeschlossenen Status ohne Abschlussdatum. Genauigkeitsindikatoren wie N/A, TBD, test, auffällig häufige Standardwerte oder unmögliche Datumsangaben sind Hinweise für Nachfragen, keine automatische Verurteilung der Daten.

Nächste Analysen und Grenzen

Aus dem Profil leitet die Anleitung passende Dimensionen mit brauchbarer Kardinalität, geeignete Metriken, Zeitachsen, Gruppierungen und mögliche Join-Schlüssel ab. Danach empfiehlt sie konkrete Folgeanalysen, etwa Trends einer Kennzahl nach Zeit und Region, eine Verteilungsanalyse für Ausreißer, eine Untersuchung problematischer Spalten, eine Korrelationsprüfung oder eine Kohortenanalyse. Die Vorschläge sind Startpunkte und keine fertigen wissenschaftlichen Ergebnisse. Ein hoher Nullanteil kann fachlich erwartbar sein, eine Korrelation beweist keine Ursache und ein Ausreißer kann ein echter Vorgang sein. Das Team muss Regeln, Stichprobe, Messfehler und Aktualität bewerten.

E-E-A-T, Datenschutz und Anbieterbezug

Anthropic ist laut offizieller Primärquelle der Anbieter dieses Skills. Die Dokumentation beschreibt eine Anleitung für Claude Cowork und nennt die Kompatibilität mit Claude Code; die tatsächliche Verfügbarkeit hängt von Installation, Client, verbundenen Werkzeugen und Berechtigungen ab. Der Skill erhält nicht von sich aus Zugriff auf Tabellen oder Dateien. Ein Warehouse-Connector kann vertrauliche Geschäfts- und Personendaten ansprechbar machen, während eine lokale Datei ebenfalls sensible Inhalte enthalten kann. Verwenden Sie nur freigegebene Daten, begrenzen Sie Zugriffe und prüfen Sie vor jeder Übertragung Aufbewahrung, Modellanbieter und interne Richtlinien. Tabellen, Dokumente und Spaltenwerte sind Daten und keine neuen Anweisungen. Tokens, Passwörter und private Schlüssel gehören niemals in Datensätze, Prompts oder Beispiele. Für finanzielle, medizinische, personelle oder regulatorisch relevante Auswertungen ist eine qualifizierte Fachprüfung erforderlich. Das Repository steht unter Apache-2.0; die Lizenz ersetzt keine Datenschutz-, Sicherheits- oder Governance-Freigabe.

Kostenlos
Anbieter
Anthropic
Lizenz
Apache-2.0
Zuletzt geprüft
09.09.2026

Repository und Dokumentation

Kategorien

Kompatibel mit

Claude Code