$ sha256sum chunks.jsonl ✓ komt overeen met het manifest
RAG-ready data. Verifieerbare herkomst.
Cryptografisch verifieerbare, voor AI gelicentieerde datasets uit primaire bronnen. Elk record gehasht, elke release vastgelegd in een Merkle root, elke ID stabiel over releases heen — zodat uw retrieval-laag op data staat die u kunt verantwoorden.
Elk record draagt zijn bron-URL, ophaalmoment en SHA-256. Elke release bevat een manifest met een Merkle root over elke chunk-hash — herbereken die uit de bestanden die u hebt gedownload en controleer elk record zelf.
source_url · fetched_at · sha256
Gelicentieerd voor RAG
Een expliciete licentie voor RAG- en embeddinggebruik in plaats van een grijs gebied, met vrijwaring bij Pro en Enterprise. Uw juridische review is één pagina, geen veertig.
embedding_use: permitted
Stabiele ID's over releases heen
record_id is een UUID v5 van de dataset plus de natuurlijke sleutel, chunk_id is een content-adres. Dezelfde chunk heeft in twee releases dezelfde ID en dezelfde hash, dus u vergelijkt releases zelf en embedt alleen opnieuw wat er veranderd is.
record_id · chunk_id · stable across releases
Twee corpora live, vijf op de kaart
Amerikaanse federale aanbestedingen en regelgeving zijn er vandaag; rechtbanken, SEC-documenten en e-commerce staan op de roadmap. Alles verzameld uit primaire bronnen — nooit doorverkochte leveranciersfeeds.
Officiële bulkbestanden en publieke API's — vandaag SAM.gov en de Federal Register. Elke ruwe response wordt als eigen bewijsrecord opgeslagen en bij het ophalen gehasht.
→
02normalize
Wij normaliseren en chunken met stabiele ID's
Opgeschoond, gestructureerd, gechunkt voor retrieval. Chunk-ID's zijn content-adressen: een ongewijzigde chunk houdt zijn ID over releases heen.
→
03release
U haalt versiebeheerde releases op via de API
JSONL plus een manifest per release, met de SHA-256 van elk bestand en de Merkle root. Herbereken de root voordat er één byte in uw index terechtkomt.
Mag ik deze data juridisch embedden en doorzoeken?
Ja — dat is precies het punt. Elke dataset komt met een expliciete licentie die RAG-, embedding- en retrievalgebruik toestaat. De licenties van Pro en Enterprise bevatten vrijwaring. Geen grijze scraping-zones: wij verzamelen uit primaire bronnen, respecteren robots.txt en opt-outs, en filteren persoonsgegevens uit elk record voordat het gehasht wordt.
Hoe verifieer ik de herkomst?
Elk record draagt zijn bron-URL, ophaalmoment en de SHA-256 van de ruwe response. Elke release bevat een manifest met een SHA-256 voor elk bestand en een Merkle root over de geordende chunk-hashes. Herbereken de bestandshashes, bouw de root opnieuw op uit chunks.jsonl, vergelijk — een paar regels van uw eigen code, geen enkele van ons. Wij hebben precies dat gedaan op een release met de volledige historie, met een aparte implementatie, en de roots kwamen overeen.
Hoe vaak worden datasets bijgewerkt?
De frequentie hangt af van de dataset en het plan: Starter levert wekelijkse releases, Pro dagelijkse. Elke release heeft een versienummer, en omdat record- en chunk-ID's stabiel blijven over releases heen kunt u er zelf twee willekeurige vergelijken en precies zien wat er veranderd is.
Welke formaten levert u?
JSONL voor records en retrieval-klare chunks, plus een manifest.json per release met de SHA-256 en het aantal bytes van elk bestand, de aantallen records en chunks, kwaliteitsmetrieken en de Merkle root over de geordende chunk-hashes.
Kan ik het proberen voordat ik betaal?
Vandaag niet via een voorbeelddataset — de toegang tot voorbeelden is dicht zolang het corpus groeit, en opent binnenkort. Laat ons in de tussentijd weten welk corpus u beoordeelt: we lopen een echte release met u door — het manifest, de SHA-256 per bestand en de Merkle root — en u herberekent de root met uw eigen code voordat er geld overgaat.
Bouwt u eigen niches?
Op het Enterprise-plan bouwen wij eigen niches en connectors op basis van uw bronnenlijst, met actualiteitsvoorwaarden die in het contract worden vastgelegd. Vertel ons via het contactformulier wat uw retrieval-laag mist.