merkleset

$ sha256sum chunks.jsonl stimmt mit dem manifest überein

RAG-fertige Daten.
Prüfbare Herkunft.

Kryptografisch prüfbare, für KI lizenzierte Datensätze aus Primärquellen. Jeder Eintrag gehasht, jedes Release über einen Merkle root verankert, jede ID über Releases hinweg stabil — damit Ihre Retrieval-Schicht auf Daten steht, die Sie verteidigen können.

beispielzugang öffnet bald · vollständige herkunftskette bei jedem eintrag · nur primärquellen

us-federal-procurement@2026.08.10 / manifest.jsonprüfbar
4b1d9e2cc7a01f8eab52630de9f42d7b8c3a5e91f04d7ba6d2c83a6f9f2c
merkle_root9f2c41ab…c135e41aprüfbares release

"why_merkleset":

Daten, die Sie Ihrer Rechtsabteilung vorlegen können

Prüfbare Herkunft

Jeder Eintrag trägt seine Quell-URL, den Abrufzeitpunkt und SHA-256. Jedes Release enthält ein Manifest mit einem Merkle root über jeden Chunk-Hash — berechnen Sie ihn aus den heruntergeladenen Dateien neu und prüfen Sie jeden Eintrag selbst.

source_url · fetched_at · sha256

Für RAG lizenziert

Eine ausdrückliche Lizenz für RAG- und Embedding-Nutzung statt einer Grauzone, mit Haftungsfreistellung bei Pro und Enterprise. Ihre Rechtsprüfung passt auf eine Seite, nicht auf vierzig.

embedding_use: permitted

Stabile IDs über Releases hinweg

record_id ist eine UUID v5 aus Datensatz und natürlichem Schlüssel, chunk_id ist eine Content-Adresse. Derselbe Chunk trägt in zwei Releases dieselbe ID und denselben Hash — Sie vergleichen Releases also selbst und betten nur das neu ein, was sich bewegt hat.

record_id · chunk_id · stable across releases

Zwei Korpora live, fünf auf der Karte

US-Bundesvergabe und Regulierung sind heute verfügbar; Gerichte, SEC-Einreichungen und E-Commerce stehen auf der Roadmap. Alles aus Primärquellen erhoben — niemals weiterverkaufte Anbieter-Feeds.

procurement ✓ regulatory ✓ courts · sec · ecommerce

"how_it_works":

Pipeline statt Versprechen

  1. 01 collect

    Wir erheben aus Primärquellen

    Offizielle Bulk-Dateien und öffentliche APIs — heute SAM.gov und Federal Register. Jede Rohantwort wird als eigener Nachweiseintrag gespeichert und beim Abruf gehasht.

  2. 02 normalize

    Wir normalisieren und chunken mit stabilen IDs

    Bereinigt, strukturiert, für Retrieval gechunkt. Chunk-IDs sind Content-Adressen: Ein unveränderter Chunk behält seine ID über Releases hinweg.

  3. 03 release

    Sie holen versionierte Releases über die API

    JSONL plus ein Manifest pro Release, mit dem SHA-256 jeder Datei und dem Merkle root. Berechnen Sie den Root neu, bevor ein einziges Byte in Ihren Index gelangt.

"catalog":

Zwei Nischen live, drei geplant. Ein Vertrag.

"pricing":

Preise auf der Seite, pro Datensatz

alle preise

demo

0 $

beispielzugang öffnet bald

  • Evaluierungsbeispiel, bald verfügbar
  • Vollständige Herkunftskette bei jedem Eintrag
  • Merkle root über jeden Chunk-Hash
  • Dasselbe JSONL wie in den Bezahlplänen
Über ein Beispiel sprechen

starter

99 $/Mon.

pro datensatz / monat

  • Wöchentliche Release-Updates
  • JSONL + Manifest mit Merkle root
  • Herkunftsfelder pro Eintrag
  • E-Mail-Support
Für ein Abo Kontakt aufnehmen
am beliebtesten

pro

299 $/Mon.

pro datensatz / monat

  • Tägliche Release-Updates
  • Stabile Eintrags- und Chunk-IDs über Releases hinweg
  • RAG-/Embedding-Lizenz mit Haftungsfreistellung
  • Priority-Support
Für ein Abo Kontakt aufnehmen

enterprise

Individuell

individuelle vereinbarung

  • Alle Datensätze, die wir veröffentlichen
  • Aktualitäts- und Support-Konditionen im Vertrag
  • Eigene Nischen und Konnektoren
  • Dedizierter Support
Kontakt aufnehmen

"faq":

Fragen, die Käufer wirklich stellen

Darf ich diese Daten rechtlich einbetten und durchsuchen?

Ja — genau darum geht es. Jeder Datensatz wird unter einer ausdrücklichen Lizenz ausgeliefert, die RAG-, Embedding- und Retrieval-Nutzung erlaubt. Die Lizenzen von Pro und Enterprise enthalten eine Haftungsfreistellung. Keine Scraping-Grauzonen: Wir erheben aus Primärquellen, respektieren robots.txt und Opt-outs und filtern personenbezogene Daten aus jedem Eintrag heraus, bevor er gehasht wird.

Wie prüfe ich die Herkunft?

Jeder Eintrag trägt seine Quell-URL, den Abrufzeitpunkt und den SHA-256 der Rohantwort. Jedes Release enthält ein Manifest mit einem SHA-256 pro Datei und einem Merkle root über die geordneten Chunk-Hashes. Berechnen Sie die Datei-Hashes neu, bauen Sie den Root aus chunks.jsonl wieder auf, vergleichen Sie — ein paar Zeilen Ihres eigenen Codes, keine einzige von uns. Genau das haben wir mit einer separaten Implementierung gegen ein Release mit vollständiger Historie durchgerechnet, und die Roots stimmten überein.

Wie oft werden Datensätze aktualisiert?

Die Frequenz hängt vom Datensatz und vom Plan ab: Starter liefert wöchentliche Releases, Pro täglich. Jedes Release ist versioniert, und weil Eintrags- und Chunk-IDs über Releases hinweg stabil sind, vergleichen Sie zwei beliebige davon selbst und sehen genau, was sich bewegt hat.

Welche Formate liefern Sie?

JSONL für Einträge und retrieval-fertige Chunks, dazu eine manifest.json pro Release mit SHA-256 und Bytegröße jeder Datei, den Eintrags- und Chunk-Zählwerten, Qualitätsmetriken und dem Merkle root über die geordneten Chunk-Hashes.

Kann ich vor dem Kauf testen?

Heute nicht über einen Beispieldatensatz — der Beispielzugang bleibt geschlossen, solange das Korpus wächst, und öffnet bald. Sagen Sie uns in der Zwischenzeit, welches Korpus Sie prüfen: Wir gehen ein echtes Release mit Ihnen durch — das Manifest, den SHA-256 je Datei und den Merkle root — und Sie rechnen die Wurzel mit Ihrem eigenen Code nach, bevor Geld fließt.

Bauen Sie eigene Nischen?

Im Enterprise-Plan bauen wir eigene Nischen und Konnektoren auf Basis Ihrer Quellenliste, mit im Vertrag vereinbarten Aktualitätskonditionen. Sagen Sie uns über das Kontaktformular, was Ihrer Retrieval-Schicht fehlt.