$ sha256sum chunks.jsonl ✓ stimmt mit dem manifest überein
RAG-fertige Daten. Prüfbare Herkunft.
Kryptografisch prüfbare, für KI lizenzierte Datensätze aus Primärquellen. Jeder Eintrag gehasht, jedes Release über einen Merkle root verankert, jede ID über Releases hinweg stabil — damit Ihre Retrieval-Schicht auf Daten steht, die Sie verteidigen können.
Daten, die Sie Ihrer Rechtsabteilung vorlegen können
Prüfbare Herkunft
Jeder Eintrag trägt seine Quell-URL, den Abrufzeitpunkt und SHA-256. Jedes Release enthält ein Manifest mit einem Merkle root über jeden Chunk-Hash — berechnen Sie ihn aus den heruntergeladenen Dateien neu und prüfen Sie jeden Eintrag selbst.
source_url · fetched_at · sha256
Für RAG lizenziert
Eine ausdrückliche Lizenz für RAG- und Embedding-Nutzung statt einer Grauzone, mit Haftungsfreistellung bei Pro und Enterprise. Ihre Rechtsprüfung passt auf eine Seite, nicht auf vierzig.
embedding_use: permitted
Stabile IDs über Releases hinweg
record_id ist eine UUID v5 aus Datensatz und natürlichem Schlüssel, chunk_id ist eine Content-Adresse. Derselbe Chunk trägt in zwei Releases dieselbe ID und denselben Hash — Sie vergleichen Releases also selbst und betten nur das neu ein, was sich bewegt hat.
record_id · chunk_id · stable across releases
Zwei Korpora live, fünf auf der Karte
US-Bundesvergabe und Regulierung sind heute verfügbar; Gerichte, SEC-Einreichungen und E-Commerce stehen auf der Roadmap. Alles aus Primärquellen erhoben — niemals weiterverkaufte Anbieter-Feeds.
Offizielle Bulk-Dateien und öffentliche APIs — heute SAM.gov und Federal Register. Jede Rohantwort wird als eigener Nachweiseintrag gespeichert und beim Abruf gehasht.
→
02normalize
Wir normalisieren und chunken mit stabilen IDs
Bereinigt, strukturiert, für Retrieval gechunkt. Chunk-IDs sind Content-Adressen: Ein unveränderter Chunk behält seine ID über Releases hinweg.
→
03release
Sie holen versionierte Releases über die API
JSONL plus ein Manifest pro Release, mit dem SHA-256 jeder Datei und dem Merkle root. Berechnen Sie den Root neu, bevor ein einziges Byte in Ihren Index gelangt.
Darf ich diese Daten rechtlich einbetten und durchsuchen?
Ja — genau darum geht es. Jeder Datensatz wird unter einer ausdrücklichen Lizenz ausgeliefert, die RAG-, Embedding- und Retrieval-Nutzung erlaubt. Die Lizenzen von Pro und Enterprise enthalten eine Haftungsfreistellung. Keine Scraping-Grauzonen: Wir erheben aus Primärquellen, respektieren robots.txt und Opt-outs und filtern personenbezogene Daten aus jedem Eintrag heraus, bevor er gehasht wird.
Wie prüfe ich die Herkunft?
Jeder Eintrag trägt seine Quell-URL, den Abrufzeitpunkt und den SHA-256 der Rohantwort. Jedes Release enthält ein Manifest mit einem SHA-256 pro Datei und einem Merkle root über die geordneten Chunk-Hashes. Berechnen Sie die Datei-Hashes neu, bauen Sie den Root aus chunks.jsonl wieder auf, vergleichen Sie — ein paar Zeilen Ihres eigenen Codes, keine einzige von uns. Genau das haben wir mit einer separaten Implementierung gegen ein Release mit vollständiger Historie durchgerechnet, und die Roots stimmten überein.
Wie oft werden Datensätze aktualisiert?
Die Frequenz hängt vom Datensatz und vom Plan ab: Starter liefert wöchentliche Releases, Pro täglich. Jedes Release ist versioniert, und weil Eintrags- und Chunk-IDs über Releases hinweg stabil sind, vergleichen Sie zwei beliebige davon selbst und sehen genau, was sich bewegt hat.
Welche Formate liefern Sie?
JSONL für Einträge und retrieval-fertige Chunks, dazu eine manifest.json pro Release mit SHA-256 und Bytegröße jeder Datei, den Eintrags- und Chunk-Zählwerten, Qualitätsmetriken und dem Merkle root über die geordneten Chunk-Hashes.
Kann ich vor dem Kauf testen?
Heute nicht über einen Beispieldatensatz — der Beispielzugang bleibt geschlossen, solange das Korpus wächst, und öffnet bald. Sagen Sie uns in der Zwischenzeit, welches Korpus Sie prüfen: Wir gehen ein echtes Release mit Ihnen durch — das Manifest, den SHA-256 je Datei und den Merkle root — und Sie rechnen die Wurzel mit Ihrem eigenen Code nach, bevor Geld fließt.
Bauen Sie eigene Nischen?
Im Enterprise-Plan bauen wir eigene Nischen und Konnektoren auf Basis Ihrer Quellenliste, mit im Vertrag vereinbarten Aktualitätskonditionen. Sagen Sie uns über das Kontaktformular, was Ihrer Retrieval-Schicht fehlt.