Snowflakes neuer Ontology Stack Builder reduziert die Zeit für den Aufbau eines auf einem Knowledge Graph basierenden Datenmodells von Monaten auf etwa eine Stunde und liefert Large Language Models (LLMs) den geschäftlichen Kontext, den sie benötigen, um Abfragen präzise zu beantworten.
Unternehmen, die versucht haben, generative KI über ihre Data Warehouses zu legen, stoßen immer wieder an eine Grenze: Die Modelle sehen Zeilen und Spaltennamen, aber nicht die realen Entitäten – Personen, Teams, Verträge –, die Entscheidungen vorantreiben. Ohne eine semantische Brücke wird KI-generiertes SQL fehleranfällig, Logikfehler schleichen sich ein und Konfidenzwerte werden irreführend.
Warum Rohdatentabellen LLMs verwirren
Ein typisches Data Warehouse speichert Informationen in normalisierten Tabellen, die über Fremdschlüssel miteinander verknüpft sind. Spaltennamen sind oft Abkürzungen oder interner Jargon. Ein LLM, das auf Web-Texten trainiert wurde, hat Begriffe wie „EMP_ID“ oder „CNTRCT_AMT“ in einem geschäftlichen Kontext noch nie gesehen. Wenn es also gefragt wird: „Welche Vertriebsmitarbeiter haben im letzten Quartal die größten Abschlüsse erzielt?“, muss es erst die Bedeutung jedes Feldes ableiten und dann einen korrekten Join über mehrere Tabellen hinweg zusammenstellen. Das Ergebnis ist eine Kaskade von Vermutungen, die zwar plausibel klingen, aber falsche Antworten liefern können.
Ontologie als Blaupause
Eine Ontologie definiert die Klassen (z. B. Person, Organisation, Vertrag) und die Beziehungen, die zwischen ihnen bestehen können (Person arbeitet für Organisation). Der aus dieser Ontologie erstellte Knowledge Graph speichert konkrete Fakten – John Doe arbeitet für Acme Inc., ein Vertrag gehört zu Acme Inc. – und ermöglicht es der KI, in diesen übergeordneten Konzepten zu denken, anstatt nur mit rohen Spaltenbezeichnern zu arbeiten.
Snowflakes Fünf-Schichten-Ansatz
Die Architektur von Snowflake, um ein Warehouse in ein ontologiegesteuertes System zu verwandeln, besteht aus fünf Schichten:
- Schicht 1: Physischer Speicher – Zwei Kerntabellen halten Knoten (Entitäten) und Kanten (Beziehungen). Das Hinzufügen eines neuen Entitätstyps erfordert keine Schemaänderungen, sondern nur neue Zeilen.
- Schicht 2: Metadaten-Konfiguration – Beziehungen werden über Konfigurationsdateien anstatt über fest codiertes SQL deklariert, was das Modell portabel und einfacher wartbar macht.
- Schicht 3: Automatischer Compiler – Der Compiler liest die Metadaten und erstellt on-the-fly einheitliche Views, die konkrete Tabellen auf abstrakte Konzepte abbilden.
- Schicht 4: Zweckgebundene Modelle – Ein Modell optimiert den schnellen Abruf von Fakten, ein anderes unterstützt das abstrakte Schließen über den Graphen hinweg, und ein drittes erzwingt Governance und Berechtigungen.
- Schicht 5: Cortex agent layer – Eine intelligente Routing-Engine entscheidet basierend auf der Absicht des Benutzers, welches zugrunde liegende Modell abgefragt werden soll.
Der manuelle Aufbau dieser Schichten zieht sich normalerweise über Monate hinweg und umfasst Datenmodellierung, Schemaanalyse und benutzerdefinierten Code. Der Snowflake Ontology Stack Builder automatisiert den Großteil dieser Arbeit.
Funktionsweise des Stack Builders
Das Tool startet einen interaktiven Workflow, der ein bestehendes Snowflake-Schema scannt, mögliche Entitätstypen und Beziehungen vorschlägt und Analysten ermöglicht, diese in einem visuellen Editor zu bestätigen oder anzupassen. Sobald die Ontologie definiert ist, generiert der Builder die Knoten-/Kanten-Tabellen, befüllt die Metadaten und startet den automatischen Compiler, um die einheitlichen Views zu erstellen. Die gesamte Pipeline kann für ein mittelgroßes Warehouse in weniger als einer Stunde zusammengestellt werden.
Vorteile für Unternehmen
- Schnellere KI-Integration – Teams binden LLMs in eine semantisch reiche Schicht ein, anstatt mit der Generierung von rohem SQL zu kämpfen.
- Geringerer Wartungsaufwand – Das Hinzufügen einer neuen Datenquelle erfordert lediglich das Einfügen von Zeilen in die Knoten-/Kanten-Tabellen; die Metadaten und die kompilierten Views aktualisieren sich automatisch.
- Integrierte Governance – Das dedizierte Berechtigungsmodell legt fest, wer welche Entitäten sehen darf – ein entscheidendes Feature für regulierte Branchen.
Fazit
Indem Snowflake einen monatelangen, manuell intensiven Modellierungsaufwand in einen einstündigen Workflow verwandelt, bietet es Unternehmen einen praktischen Weg, LLMs die benötigte geschäftliche Semantik zu vermitteln. Das Ergebnis ist eine KI, die die Absicht versteht.
