merkleset

$ sha256sum chunks.jsonl komt overeen met het manifest

RAG-ready data.
Verifieerbare herkomst.

Cryptografisch verifieerbare, voor AI gelicentieerde datasets uit primaire bronnen. Elk record gehasht, elke release vastgelegd in een Merkle root, elke ID stabiel over releases heen — zodat uw retrieval-laag op data staat die u kunt verantwoorden.

toegang tot voorbeelden opent binnenkort · volledige herkomstketen op elk record · alleen primaire bronnen

us-federal-procurement@2026.08.10 / manifest.jsonverifieerbaar
4b1d9e2cc7a01f8eab52630de9f42d7b8c3a5e91f04d7ba6d2c83a6f9f2c
merkle_root9f2c41ab…c135e41averifieerbare release

"why_merkleset":

Data die u aan uw juristen kunt voorleggen

Verifieerbare herkomst

Elk record draagt zijn bron-URL, ophaalmoment en SHA-256. Elke release bevat een manifest met een Merkle root over elke chunk-hash — herbereken die uit de bestanden die u hebt gedownload en controleer elk record zelf.

source_url · fetched_at · sha256

Gelicentieerd voor RAG

Een expliciete licentie voor RAG- en embeddinggebruik in plaats van een grijs gebied, met vrijwaring bij Pro en Enterprise. Uw juridische review is één pagina, geen veertig.

embedding_use: permitted

Stabiele ID's over releases heen

record_id is een UUID v5 van de dataset plus de natuurlijke sleutel, chunk_id is een content-adres. Dezelfde chunk heeft in twee releases dezelfde ID en dezelfde hash, dus u vergelijkt releases zelf en embedt alleen opnieuw wat er veranderd is.

record_id · chunk_id · stable across releases

Twee corpora live, vijf op de kaart

Amerikaanse federale aanbestedingen en regelgeving zijn er vandaag; rechtbanken, SEC-documenten en e-commerce staan op de roadmap. Alles verzameld uit primaire bronnen — nooit doorverkochte leveranciersfeeds.

procurement ✓ regulatory ✓ courts · sec · ecommerce

"how_it_works":

Pipeline, geen beloften

  1. 01 collect

    Wij verzamelen uit primaire bronnen

    Officiële bulkbestanden en publieke API's — vandaag SAM.gov en de Federal Register. Elke ruwe response wordt als eigen bewijsrecord opgeslagen en bij het ophalen gehasht.

  2. 02 normalize

    Wij normaliseren en chunken met stabiele ID's

    Opgeschoond, gestructureerd, gechunkt voor retrieval. Chunk-ID's zijn content-adressen: een ongewijzigde chunk houdt zijn ID over releases heen.

  3. 03 release

    U haalt versiebeheerde releases op via de API

    JSONL plus een manifest per release, met de SHA-256 van elk bestand en de Merkle root. Herbereken de root voordat er één byte in uw index terechtkomt.

"catalog":

Twee niches live, drie gepland. Eén contract.

"pricing":

Prijzen op de pagina, per dataset

alle prijzen

demo

US$ 0

toegang tot voorbeelden binnenkort

  • Evaluatievoorbeeld, binnenkort
  • Volledige herkomstketen op elk record
  • Merkle root over elke chunk-hash
  • Dezelfde JSONL als in de betaalde plannen
Praat met ons over een voorbeeld

starter

US$ 99/mnd

per dataset / maand

  • Wekelijkse release-updates
  • JSONL + manifest met Merkle root
  • Herkomstvelden per record
  • Support via e-mail
Neem contact op voor een abonnement
meest gekozen

pro

US$ 299/mnd

per dataset / maand

  • Dagelijkse release-updates
  • Stabiele record- en chunk-ID's over releases heen
  • RAG-/embeddinglicentie met vrijwaring
  • Prioriteitssupport
Neem contact op voor een abonnement

enterprise

Op maat

overeenkomst op maat

  • Elke dataset die wij publiceren
  • Actualiteits- en supportvoorwaarden in het contract
  • Eigen niches en connectors
  • Toegewijde support
Neem contact op

"faq":

Vragen die kopers echt stellen

Mag ik deze data juridisch embedden en doorzoeken?

Ja — dat is precies het punt. Elke dataset komt met een expliciete licentie die RAG-, embedding- en retrievalgebruik toestaat. De licenties van Pro en Enterprise bevatten vrijwaring. Geen grijze scraping-zones: wij verzamelen uit primaire bronnen, respecteren robots.txt en opt-outs, en filteren persoonsgegevens uit elk record voordat het gehasht wordt.

Hoe verifieer ik de herkomst?

Elk record draagt zijn bron-URL, ophaalmoment en de SHA-256 van de ruwe response. Elke release bevat een manifest met een SHA-256 voor elk bestand en een Merkle root over de geordende chunk-hashes. Herbereken de bestandshashes, bouw de root opnieuw op uit chunks.jsonl, vergelijk — een paar regels van uw eigen code, geen enkele van ons. Wij hebben precies dat gedaan op een release met de volledige historie, met een aparte implementatie, en de roots kwamen overeen.

Hoe vaak worden datasets bijgewerkt?

De frequentie hangt af van de dataset en het plan: Starter levert wekelijkse releases, Pro dagelijkse. Elke release heeft een versienummer, en omdat record- en chunk-ID's stabiel blijven over releases heen kunt u er zelf twee willekeurige vergelijken en precies zien wat er veranderd is.

Welke formaten levert u?

JSONL voor records en retrieval-klare chunks, plus een manifest.json per release met de SHA-256 en het aantal bytes van elk bestand, de aantallen records en chunks, kwaliteitsmetrieken en de Merkle root over de geordende chunk-hashes.

Kan ik het proberen voordat ik betaal?

Vandaag niet via een voorbeelddataset — de toegang tot voorbeelden is dicht zolang het corpus groeit, en opent binnenkort. Laat ons in de tussentijd weten welk corpus u beoordeelt: we lopen een echte release met u door — het manifest, de SHA-256 per bestand en de Merkle root — en u herberekent de root met uw eigen code voordat er geld overgaat.

Bouwt u eigen niches?

Op het Enterprise-plan bouwen wij eigen niches en connectors op basis van uw bronnenlijst, met actualiteitsvoorwaarden die in het contract worden vastgelegd. Vertel ons via het contactformulier wat uw retrieval-laag mist.